MLOps Academy · レッスン

推論レイテンシーをプロファイルして調整する

perf_analyzerを使って最適な設定を見つけます。

レッスン 4/413 ステップ

「推論レイテンシーをプロファイルして調整する」はCoddyKit上の無料MLOps Academyレッスンです。 これはレッスン4/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはMLOps Academy学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 MLOps Academyコースには全4レッスンが含まれています。

計測して調整する

計測しなければ調整できません。設定を変更する前に、信頼できる負荷をかけて実際のレイテンシとスループットを記録してください。📏

perf_analyzerを使う

Tritonにはperf_analyzerが付属しています。これはモデルに大量のリクエストを送り、レイテンシとスループットを報告するツールで、設定を比較するのに役立ちます。

基本的なテストを実行する

perf_analyzerでモデルを指定すると、合成リクエストが送信され、1秒あたりの推論数とレイテンシの内訳が表示されます。

perf_analyzer -m my_model

同時実行数を変えて調べる

最も役立つフラグは同時実行数を変化させます。これは実行中のリクエスト数を表し、負荷が増えたときにスループットとレイテンシがどう変化するかを明らかにします。

perf_analyzer -m my_model --concurrency-range 1:8

曲線を読み取る

同時実行数が増えると、スループットは上昇してから横ばいになりますが、レイテンシは増え続けます。その曲線の折れ曲がる点が、実用上の運用ポイントです。

パーセンタイルを使う

平均値では問題が隠れてしまいます。p95レイテンシを確認してください。これは95%のリクエストが下回る値であり、ユーザーが実際に感じるのはテールレイテンシだからです。

キューの遅延を調整する

レイテンシが高すぎる場合はmax_queue_delay_microsecondsを下げます。高負荷時のスループットが低すぎる場合は、値を上げてより大きなバッチを作ります。

インスタンスを調整する

GPUの使用率が低い場合はインスタンスを追加します。メモリに余裕がない場合やスループットが停止する場合は、1つ減らします。一度に1つの設定だけを変更し、再度計測してください。

一度に1つだけ変更する

調整は飛躍ではなく、繰り返しの作業です。1つの設定を変更し、perf_analyzerを再実行して比較します。数値が実際に改善した場合だけ、その変更を残します。

レイテンシ予算を設定する

まず予算を決めます。たとえばp95を50ミリ秒未満にする、といった具合です。その制限内に収まる範囲で、バッチサイズとインスタンス数をできるだけ増やします。

処理経路全体を考慮する

サーバーの数値だけでは全体像を把握できません。ネットワークの経路やクライアントコードも時間を追加するため、ユーザーのいる場所からのエンドツーエンドのレイテンシも計測してください。

確認問題

調整時に平均レイテンシよりp95レイテンシを重視するのはなぜですか。

まとめ

perf_analyzerで同時実行数を変化させ、p95におけるスループットとレイテンシの曲線を読み取り、予算内でキューの遅延とインスタンス数を一度に1つずつ調整しました。🙌

無料で開始

AI チューターと学ぶ Python — 無料

ブラウザでリアルコードを書いて実行し、24/7 の AI チューターから瞬時にサポートを受け、ウェブまたはアプリで続きから学習できます。

コース
30
レッスン
120

よくある質問

「推論レイテンシーをプロファイルして調整する」レッスンは無料ですか?

はい。「推論レイテンシーをプロファイルして調整する」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、MLOps Academyコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 MLOps Academyコースには全4レッスンが含まれています。

「推論レイテンシーをプロファイルして調整する」で何を学びますか?

perf_analyzerを使って最適な設定を見つけます。 ブラウザで直接実行するハンズオンコードでMLOps Academyを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。

MLOps Academyを始めるのに経験は必要ですか?

事前経験は必要ありません。CoddyKitのMLOps Academyは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン4/4です。

「推論レイテンシーをプロファイルして調整する」レッスンにはどのくらい時間がかかりますか?

ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。

このMLOps Academyレッスンでコードを書いて実行できますか?

はい。すべてのMLOps Academyレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。

このコースのすべてのレッスン

  1. GPUにバッチ処理が必要な理由
  2. Tritonで動的バッチ処理を設定する
  3. 1つのGPUで複数のモデルインスタンスを実行する
  4. 推論レイテンシーをプロファイルして調整する
← MLOps Academyに戻る