推論レイテンシーをプロファイルして調整する
perf_analyzerを使って最適な設定を見つけます。
「推論レイテンシーをプロファイルして調整する」はCoddyKit上の無料MLOps Academyレッスンです。 これはレッスン4/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはMLOps Academy学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 MLOps Academyコースには全4レッスンが含まれています。
計測して調整する
計測しなければ調整できません。設定を変更する前に、信頼できる負荷をかけて実際のレイテンシとスループットを記録してください。📏
perf_analyzerを使う
Tritonにはperf_analyzerが付属しています。これはモデルに大量のリクエストを送り、レイテンシとスループットを報告するツールで、設定を比較するのに役立ちます。
基本的なテストを実行する
perf_analyzerでモデルを指定すると、合成リクエストが送信され、1秒あたりの推論数とレイテンシの内訳が表示されます。
perf_analyzer -m my_model同時実行数を変えて調べる
最も役立つフラグは同時実行数を変化させます。これは実行中のリクエスト数を表し、負荷が増えたときにスループットとレイテンシがどう変化するかを明らかにします。
perf_analyzer -m my_model --concurrency-range 1:8曲線を読み取る
同時実行数が増えると、スループットは上昇してから横ばいになりますが、レイテンシは増え続けます。その曲線の折れ曲がる点が、実用上の運用ポイントです。
パーセンタイルを使う
平均値では問題が隠れてしまいます。p95レイテンシを確認してください。これは95%のリクエストが下回る値であり、ユーザーが実際に感じるのはテールレイテンシだからです。
キューの遅延を調整する
レイテンシが高すぎる場合はmax_queue_delay_microsecondsを下げます。高負荷時のスループットが低すぎる場合は、値を上げてより大きなバッチを作ります。
インスタンスを調整する
GPUの使用率が低い場合はインスタンスを追加します。メモリに余裕がない場合やスループットが停止する場合は、1つ減らします。一度に1つの設定だけを変更し、再度計測してください。
一度に1つだけ変更する
調整は飛躍ではなく、繰り返しの作業です。1つの設定を変更し、perf_analyzerを再実行して比較します。数値が実際に改善した場合だけ、その変更を残します。
レイテンシ予算を設定する
まず予算を決めます。たとえばp95を50ミリ秒未満にする、といった具合です。その制限内に収まる範囲で、バッチサイズとインスタンス数をできるだけ増やします。
処理経路全体を考慮する
サーバーの数値だけでは全体像を把握できません。ネットワークの経路やクライアントコードも時間を追加するため、ユーザーのいる場所からのエンドツーエンドのレイテンシも計測してください。
確認問題
調整時に平均レイテンシよりp95レイテンシを重視するのはなぜですか。
まとめ
perf_analyzerで同時実行数を変化させ、p95におけるスループットとレイテンシの曲線を読み取り、予算内でキューの遅延とインスタンス数を一度に1つずつ調整しました。🙌
AI チューターと学ぶ Python — 無料
ブラウザでリアルコードを書いて実行し、24/7 の AI チューターから瞬時にサポートを受け、ウェブまたはアプリで続きから学習できます。
- コース
- 30
- レッスン
- 120
よくある質問
「推論レイテンシーをプロファイルして調整する」レッスンは無料ですか?
はい。「推論レイテンシーをプロファイルして調整する」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、MLOps Academyコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 MLOps Academyコースには全4レッスンが含まれています。
「推論レイテンシーをプロファイルして調整する」で何を学びますか?
perf_analyzerを使って最適な設定を見つけます。 ブラウザで直接実行するハンズオンコードでMLOps Academyを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。
MLOps Academyを始めるのに経験は必要ですか?
事前経験は必要ありません。CoddyKitのMLOps Academyは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン4/4です。
「推論レイテンシーをプロファイルして調整する」レッスンにはどのくらい時間がかかりますか?
ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。
このMLOps Academyレッスンでコードを書いて実行できますか?
はい。すべてのMLOps Academyレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。
このコースのすべてのレッスン
- GPUにバッチ処理が必要な理由
- Tritonで動的バッチ処理を設定する
- 1つのGPUで複数のモデルインスタンスを実行する
- 推論レイテンシーをプロファイルして調整する