0Pricing
MLOps Academy · レッスン

インスタンスとレプリカを適正化する

実際の負荷特性にハードウェアを合わせます。

「インスタンスとレプリカを適正化する」はCoddyKit上の無料MLOps Academyレッスンです。 これはレッスン1/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはMLOps Academy学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 MLOps Academyコースには全4レッスンが含まれています。

使った分だけ支払う

ML のサービング料金の大半は、ほとんどアイドル状態のインスタンスから発生します。適正サイジングとは、最悪のケースを恐れて余分に用意するのではなく、実際の負荷にハードウェアとレプリカ数を合わせることです。

削減する前に測定する

測定していないものを適正化することはできません。まず、通常のトラフィックがある1日のCPU とメモリの使用率を確認します。

過剰プロビジョニングの罠

念のため巨大なインスタンスを選ぶと安心できますが、毎時間コストがかかります。継続的に使用率が低いことは、過剰プロビジョニングの最も明確な兆候です。

使用率を読み取る

平均 CPU 使用率が15パーセント程度なら、インスタンスが大きすぎます。短時間の急増に備えた余裕を残しつつ、適切な目標使用率を目指します。

kubectl top pods -n serving

垂直スケーリングと水平スケーリング

垂直スケーリングでは、1つのレプリカにより大きなマシンを割り当てます。一方、水平スケーリングでは小さなレプリカを増やすため、通常は変動の大きいトラフィックに適しています。

リクエストと制限を設定する

Kubernetes では、リソースリクエストによって各レプリカに本当に必要な量をスケジューラーへ伝えます。大まかな推測ではなく、実測した使用量に基づいて設定します。

resources:
  requests:
    cpu: "500m"
    memory: "1Gi"

適切なレプリカ数を選ぶ

レプリカが少なすぎるとリクエストがキューにたまり、応答が遅くなります。多すぎると、料金を払い続けるアイドル状態の Pod が発生します。レプリカ数はピーク時の同時負荷に合わせます。

オートスケーリングで需要に追従する

Horizontal Pod Autoscalerは、負荷が高まるとレプリカを追加し、低下すると削除します。これにより、オフピーク時のキャパシティに料金を払い続けずに済みます。

kubectl autoscale deploy model --min 2 --max 10 --cpu-percent 60

安全のための最低数を維持する

レプリカの最小数を設定すると、いくつかの Pod が起動済みの状態で待機するため、トラフィックが空のサービスに初めてアクセスすることを避けられます。これはコストと可用性のトレードオフです。

GPU マシンは高価

GPU インスタンスは CPU インスタンスの何倍もの費用がかかります。モデルが本当に必要とする場合だけGPUを要求し、アイドル状態にならないよう処理をできるだけ詰め込みます。

適正サイジングは継続的に行う

トラフィックのパターンは数週間、数か月の間に変化します。定期的にインスタンスタイプとレプリカ数を見直し、システム全体を適切な構成に保ちます。

クイックチェック

使用率が低いことから何が分かるか確認しましょう。

まとめ

使用率を測定し、垂直スケーリングと水平スケーリングを選択し、リクエストを設定して、オートスケーリングを追加しました。これでシステム全体が実際の需要に合うようになりました。💸

よくある質問

「インスタンスとレプリカを適正化する」レッスンは無料ですか?

はい。「インスタンスとレプリカを適正化する」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、MLOps Academyコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 MLOps Academyコースには全4レッスンが含まれています。

「インスタンスとレプリカを適正化する」で何を学びますか?

実際の負荷特性にハードウェアを合わせます。 ブラウザで直接実行するハンズオンコードでMLOps Academyを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。

MLOps Academyを始めるのに経験は必要ですか?

事前経験は必要ありません。CoddyKitのMLOps Academyは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン1/4です。

「インスタンスとレプリカを適正化する」レッスンにはどのくらい時間がかかりますか?

ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。

このMLOps Academyレッスンでコードを書いて実行できますか?

はい。すべてのMLOps Academyレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。

このコースのすべてのレッスン

  1. インスタンスとレプリカを適正化する
  2. 量子化と蒸留で推論コストを下げる
  3. 学習にSpot Instanceを使う
  4. 予測1回あたりのコストを追跡する
← MLOps Academyに戻る