トレードオフ:レイテンシ、コスト、性能
オープンウェイトはコストを抑えられますが、エンジニアの作業時間が必要です。採用を決める前にベンチマークしましょう。
「トレードオフ:レイテンシ、コスト、性能」はCoddyKit上の無料AI Agentsレッスンです。 これはレッスン4/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはAI Agents学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 AI Agentsコースには全4レッスンが含まれています。
3つの軸から2つを選ぶ
すべてのモデル選択では、次の要素のトレードオフが発生します。
- レイテンシー — 1回の応答にかかる時間
- コスト — 100万トークンあたりの費用
- 能力 — 難しいタスクでの品質
3つすべてで最適なモデルはありません。
能力の全体像
| トップ層 | 中位層 | 小型層 | |
|---|---|---|---|
| クローズド | GPT-4o、Claude Sonnet 4.5 | GPT-4o-mini、Haiku | — |
| オープン | Llama 3.1 405B | Llama 3.1 70B、Qwen 2.5 72B | Llama 3.1 8B、Phi-3 |
レイテンシーの全体像
一般的なエージェントの1ターンにおける、おおよその p50 レイテンシー。
- Groq Llama 3.1 70B:約200ms(非常に高速)
- gpt-4o-mini:約600ms
- gpt-4o:約1500ms
- 1xH100 上のセルフホスト Llama 70B:約800ms
- RTX 4090 上のセルフホスト Llama 8B:約200ms
100万トークンあたりのコスト(概算)
2025年半ば時点の概算(入力/出力):
- GPT-4o: $2.50 / $10
- GPT-4o-mini: $0.15 / $0.60
- Claude Sonnet 4.5: $3 / $15
- Claude Haiku: $0.80 / $4
- Together Llama 70B: $0.88 / $0.88
- Groq Llama 70B: $0.59 / $0.79
- セルフホスト(ご自身のGPU):トークンあたり実質無料
損益分岐点を計算する
セルフホストでコストを削減できるのは、一定量を超えた場合だけです。概算は次のとおりです。
GPU_COST_PER_HOUR = 1.5
GPU_TOKENS_PER_SECOND = 50
TOKENS_PER_HOUR = GPU_TOKENS_PER_SECOND * 3600
# 180,000 tokens/hour
print(f"Tokens per hour: {TOKENS_PER_HOUR:,}")
breakeven_tokens = GPU_COST_PER_HOUR / 0.6e-6
print(f"Breakeven vs $0.60/1M closed-model price: {breakeven_tokens:,.0f} tokens/hour")
print("Far above typical small-app traffic")
モデルルーティング
通常は安価なモデルを使い、必要な場合だけ高価なモデルに切り替えます。
def answer(query):
cheap = call_model('gpt-4o-mini', query)
if confidence(cheap) > 0.8:
return cheap
return call_model('gpt-4o', query)ステップごとのルーティング
エージェント内で、ステップごとに振り分けます。
- GPT-4oで計画(難しい推論)
- Llama 8Bで検索(安価なループ処理)
- Claudeで統合(高品質な文章作成)
レイテンシー重視の処理経路
音声やリアルタイムチャットでは、次のようにします。
- 200ミリ秒未満を実現するためにGroq、SambaNova、またはCerebrasを使用する
- トークンを積極的にストリーミングする
- クリティカルパス上での多段階エージェントを避ける
品質重視の処理経路
最終回答や重要度の高い処理では、次のようにします。
- 予算の範囲で利用できる最良のモデルを使う
- モデル間の相互評価を追加する(GPT-4が記述し、Claudeがレビューする)
- 検証を追加する(コードを実行し、事実を確認する)
総保有コスト
セルフホストのコストには、次が含まれます。
- GPUのレンタル費用または設備投資
- インフラ管理にかかるエンジニアの時間
- 監視、オンコール対応
- ホステッドサービスより低いスループット
ほとんどのチームでは、非常に大規模な利用量に達するまでは、ホステッドAPIのほうがTCOは安くなります。
大規模なクローズドモデルに料金を支払う場合
- ユーザーに最終的に提示する回答
- 最先端の推論
- マルチモーダル処理
- 20万トークン以上のコンテキスト
自分のタスクでベンチマークする
公開ベンチマークで分かるのは、全体の一部だけです。実際のデータを使って50問の評価セットを作成し、それぞれの候補モデルで測定してください。品質要件を満たす中で最も安価なモデルを選びます。
ルーティング戦略
品質要件を満たしながら、最も安価になるモデルルーティング戦略は何でしょうか。
まとめ
レイテンシー、コスト、性能のうち、2つを選びます。通常は安価なモデルを使い、必要な場合に切り替えてください。ホステッドのオープンモデルAPI(Groq、Together)は、両極端な選択肢より優れていることがよくあります。
AI チューターと学ぶ AI Agents — 無料
ブラウザでリアルコードを書いて実行し、24/7 の AI チューターから瞬時にサポートを受け、ウェブまたはアプリで続きから学習できます。
- コース
- 60
- レッスン
- 239
よくある質問
「トレードオフ:レイテンシ、コスト、性能」レッスンは無料ですか?
はい。「トレードオフ:レイテンシ、コスト、性能」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、AI Agentsコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 AI Agentsコースには全4レッスンが含まれています。
「トレードオフ:レイテンシ、コスト、性能」で何を学びますか?
オープンウェイトはコストを抑えられますが、エンジニアの作業時間が必要です。採用を決める前にベンチマークしましょう。 ブラウザで直接実行するハンズオンコードでAI Agentsを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。
AI Agentsを始めるのに経験は必要ですか?
事前経験は必要ありません。CoddyKitのAI Agentsは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン4/4です。
「トレードオフ:レイテンシ、コスト、性能」レッスンにはどのくらい時間がかかりますか?
ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。
このAI Agentsレッスンでコードを書いて実行できますか?
はい。すべてのAI Agentsレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。
このコースのすべてのレッスン
- Llama、Mistral、Qwenの概要
- Ollamaとllama.cppでローカルモデルを実行する
- オープンモデルでFunction Callingを行う(Hermes、Functionary)
- トレードオフ:レイテンシ、コスト、性能