インスタンスとレプリカを適正化する
実際の負荷特性にハードウェアを合わせます。
「インスタンスとレプリカを適正化する」はCoddyKit上の無料MLOps Academyレッスンです。 これはレッスン1/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはMLOps Academy学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 MLOps Academyコースには全4レッスンが含まれています。
使った分だけ支払う
ML のサービング料金の大半は、ほとんどアイドル状態のインスタンスから発生します。適正サイジングとは、最悪のケースを恐れて余分に用意するのではなく、実際の負荷にハードウェアとレプリカ数を合わせることです。
削減する前に測定する
測定していないものを適正化することはできません。まず、通常のトラフィックがある1日のCPU とメモリの使用率を確認します。
過剰プロビジョニングの罠
念のため巨大なインスタンスを選ぶと安心できますが、毎時間コストがかかります。継続的に使用率が低いことは、過剰プロビジョニングの最も明確な兆候です。
使用率を読み取る
平均 CPU 使用率が15パーセント程度なら、インスタンスが大きすぎます。短時間の急増に備えた余裕を残しつつ、適切な目標使用率を目指します。
kubectl top pods -n serving垂直スケーリングと水平スケーリング
垂直スケーリングでは、1つのレプリカにより大きなマシンを割り当てます。一方、水平スケーリングでは小さなレプリカを増やすため、通常は変動の大きいトラフィックに適しています。
リクエストと制限を設定する
Kubernetes では、リソースリクエストによって各レプリカに本当に必要な量をスケジューラーへ伝えます。大まかな推測ではなく、実測した使用量に基づいて設定します。
resources:
requests:
cpu: "500m"
memory: "1Gi"適切なレプリカ数を選ぶ
レプリカが少なすぎるとリクエストがキューにたまり、応答が遅くなります。多すぎると、料金を払い続けるアイドル状態の Pod が発生します。レプリカ数はピーク時の同時負荷に合わせます。
オートスケーリングで需要に追従する
Horizontal Pod Autoscalerは、負荷が高まるとレプリカを追加し、低下すると削除します。これにより、オフピーク時のキャパシティに料金を払い続けずに済みます。
kubectl autoscale deploy model --min 2 --max 10 --cpu-percent 60安全のための最低数を維持する
レプリカの最小数を設定すると、いくつかの Pod が起動済みの状態で待機するため、トラフィックが空のサービスに初めてアクセスすることを避けられます。これはコストと可用性のトレードオフです。
GPU マシンは高価
GPU インスタンスは CPU インスタンスの何倍もの費用がかかります。モデルが本当に必要とする場合だけGPUを要求し、アイドル状態にならないよう処理をできるだけ詰め込みます。
適正サイジングは継続的に行う
トラフィックのパターンは数週間、数か月の間に変化します。定期的にインスタンスタイプとレプリカ数を見直し、システム全体を適切な構成に保ちます。
クイックチェック
使用率が低いことから何が分かるか確認しましょう。
まとめ
使用率を測定し、垂直スケーリングと水平スケーリングを選択し、リクエストを設定して、オートスケーリングを追加しました。これでシステム全体が実際の需要に合うようになりました。💸
よくある質問
「インスタンスとレプリカを適正化する」レッスンは無料ですか?
はい。「インスタンスとレプリカを適正化する」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、MLOps Academyコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 MLOps Academyコースには全4レッスンが含まれています。
「インスタンスとレプリカを適正化する」で何を学びますか?
実際の負荷特性にハードウェアを合わせます。 ブラウザで直接実行するハンズオンコードでMLOps Academyを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。
MLOps Academyを始めるのに経験は必要ですか?
事前経験は必要ありません。CoddyKitのMLOps Academyは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン1/4です。
「インスタンスとレプリカを適正化する」レッスンにはどのくらい時間がかかりますか?
ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。
このMLOps Academyレッスンでコードを書いて実行できますか?
はい。すべてのMLOps Academyレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。
このコースのすべてのレッスン
- インスタンスとレプリカを適正化する
- 量子化と蒸留で推論コストを下げる
- 学習にSpot Instanceを使う
- 予測1回あたりのコストを追跡する