AI Agents · レッスン

トレードオフ:レイテンシ、コスト、性能

オープンウェイトはコストを抑えられますが、エンジニアの作業時間が必要です。採用を決める前にベンチマークしましょう。

レッスン 4/414 ステップ

「トレードオフ:レイテンシ、コスト、性能」はCoddyKit上の無料AI Agentsレッスンです。 これはレッスン4/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはAI Agents学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 AI Agentsコースには全4レッスンが含まれています。

3つの軸から2つを選ぶ

すべてのモデル選択では、次の要素のトレードオフが発生します。

  • レイテンシー — 1回の応答にかかる時間
  • コスト — 100万トークンあたりの費用
  • 能力 — 難しいタスクでの品質

3つすべてで最適なモデルはありません。

能力の全体像

トップ層中位層小型層
クローズドGPT-4o、Claude Sonnet 4.5GPT-4o-mini、Haiku—
オープンLlama 3.1 405BLlama 3.1 70B、Qwen 2.5 72BLlama 3.1 8B、Phi-3

レイテンシーの全体像

一般的なエージェントの1ターンにおける、おおよその p50 レイテンシー。

  • Groq Llama 3.1 70B:約200ms(非常に高速)
  • gpt-4o-mini:約600ms
  • gpt-4o:約1500ms
  • 1xH100 上のセルフホスト Llama 70B:約800ms
  • RTX 4090 上のセルフホスト Llama 8B:約200ms

100万トークンあたりのコスト(概算)

2025年半ば時点の概算(入力/出力):

  • GPT-4o: $2.50 / $10
  • GPT-4o-mini: $0.15 / $0.60
  • Claude Sonnet 4.5: $3 / $15
  • Claude Haiku: $0.80 / $4
  • Together Llama 70B: $0.88 / $0.88
  • Groq Llama 70B: $0.59 / $0.79
  • セルフホスト(ご自身のGPU):トークンあたり実質無料

損益分岐点を計算する

セルフホストでコストを削減できるのは、一定量を超えた場合だけです。概算は次のとおりです。

GPU_COST_PER_HOUR = 1.5
GPU_TOKENS_PER_SECOND = 50
TOKENS_PER_HOUR = GPU_TOKENS_PER_SECOND * 3600
# 180,000 tokens/hour
print(f"Tokens per hour: {TOKENS_PER_HOUR:,}")
breakeven_tokens = GPU_COST_PER_HOUR / 0.6e-6
print(f"Breakeven vs $0.60/1M closed-model price: {breakeven_tokens:,.0f} tokens/hour")
print("Far above typical small-app traffic")

モデルルーティング

通常は安価なモデルを使い、必要な場合だけ高価なモデルに切り替えます。

def answer(query):
    cheap = call_model('gpt-4o-mini', query)
    if confidence(cheap) > 0.8:
        return cheap
    return call_model('gpt-4o', query)

ステップごとのルーティング

エージェント内で、ステップごとに振り分けます。

  • GPT-4oで計画(難しい推論)
  • Llama 8Bで検索(安価なループ処理)
  • Claudeで統合(高品質な文章作成)

レイテンシー重視の処理経路

音声やリアルタイムチャットでは、次のようにします。

  • 200ミリ秒未満を実現するためにGroq、SambaNova、またはCerebrasを使用する
  • トークンを積極的にストリーミングする
  • クリティカルパス上での多段階エージェントを避ける

品質重視の処理経路

最終回答や重要度の高い処理では、次のようにします。

  • 予算の範囲で利用できる最良のモデルを使う
  • モデル間の相互評価を追加する(GPT-4が記述し、Claudeがレビューする)
  • 検証を追加する(コードを実行し、事実を確認する)

総保有コスト

セルフホストのコストには、次が含まれます。

  • GPUのレンタル費用または設備投資
  • インフラ管理にかかるエンジニアの時間
  • 監視、オンコール対応
  • ホステッドサービスより低いスループット

ほとんどのチームでは、非常に大規模な利用量に達するまでは、ホステッドAPIのほうがTCOは安くなります。

大規模なクローズドモデルに料金を支払う場合

  • ユーザーに最終的に提示する回答
  • 最先端の推論
  • マルチモーダル処理
  • 20万トークン以上のコンテキスト

自分のタスクでベンチマークする

公開ベンチマークで分かるのは、全体の一部だけです。実際のデータを使って50問の評価セットを作成し、それぞれの候補モデルで測定してください。品質要件を満たす中で最も安価なモデルを選びます。

ルーティング戦略

品質要件を満たしながら、最も安価になるモデルルーティング戦略は何でしょうか。

まとめ

レイテンシー、コスト、性能のうち、2つを選びます。通常は安価なモデルを使い、必要な場合に切り替えてください。ホステッドのオープンモデルAPI(Groq、Together)は、両極端な選択肢より優れていることがよくあります。

無料で開始

AI チューターと学ぶ AI Agents — 無料

ブラウザでリアルコードを書いて実行し、24/7 の AI チューターから瞬時にサポートを受け、ウェブまたはアプリで続きから学習できます。

コース
60
レッスン
239

よくある質問

「トレードオフ:レイテンシ、コスト、性能」レッスンは無料ですか?

はい。「トレードオフ:レイテンシ、コスト、性能」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、AI Agentsコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 AI Agentsコースには全4レッスンが含まれています。

「トレードオフ:レイテンシ、コスト、性能」で何を学びますか?

オープンウェイトはコストを抑えられますが、エンジニアの作業時間が必要です。採用を決める前にベンチマークしましょう。 ブラウザで直接実行するハンズオンコードでAI Agentsを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。

AI Agentsを始めるのに経験は必要ですか?

事前経験は必要ありません。CoddyKitのAI Agentsは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン4/4です。

「トレードオフ:レイテンシ、コスト、性能」レッスンにはどのくらい時間がかかりますか?

ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。

このAI Agentsレッスンでコードを書いて実行できますか?

はい。すべてのAI Agentsレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。

このコースのすべてのレッスン

  1. Llama、Mistral、Qwenの概要
  2. Ollamaとllama.cppでローカルモデルを実行する
  3. オープンモデルでFunction Callingを行う(Hermes、Functionary)
  4. トレードオフ:レイテンシ、コスト、性能
← AI Agentsに戻る