0Pricing
AI Agents · 课时

取舍:延迟、成本、能力

开放权重模型可以节省成本,但会消耗工程师工时;请在作出决定前进行基准测试。

取舍:延迟、成本、能力 是 CoddyKit 上的免费 AI Agents 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。

三个维度,选两个

每次模型选择都需要在以下方面进行权衡:

  • 延迟——每次响应所需的时间
  • 成本——每百万个令牌的费用
  • 能力——处理困难任务时的质量

没有任何模型能在这三个方面都做到最好。

能力分布

顶级中档小型
闭源GPT-4o、Claude Sonnet 4.5GPT-4o-mini、Haiku—
开放Llama 3.1 405BLlama 3.1 70B、Qwen 2.5 72BLlama 3.1 8B、Phi-3

延迟分布

典型智能体轮次的大致 p50 延迟:

  • Groq Llama 3.1 70B:约 200ms(快如闪电)
  • gpt-4o-mini:约 600ms
  • gpt-4o:约 1500ms
  • 在 1xH100 上自托管 Llama 70B:约 800ms
  • 在 RTX 4090 上自托管 Llama 8B:约 200ms

每百万个词元的成本(约)

2025年年中估算,输入/输出:

  • GPT-4o:$2.50 / $10
  • GPT-4o-mini:$0.15 / $0.60
  • Claude Sonnet 4.5:$3 / $15
  • Claude Haiku:$0.80 / $4
  • Together Llama 70B:$0.88 / $0.88
  • Groq Llama 70B:$0.59 / $0.79
  • 自托管(您的 GPU):每个词元基本上免费

计算成本平衡点

只有超过某个用量阈值后,自托管才会省钱。粗略估算:

GPU_COST_PER_HOUR = 1.5
GPU_TOKENS_PER_SECOND = 50
TOKENS_PER_HOUR = GPU_TOKENS_PER_SECOND * 3600
# 180,000 tokens/hour
print(f"Tokens per hour: {TOKENS_PER_HOUR:,}")
breakeven_tokens = GPU_COST_PER_HOUR / 0.6e-6
print(f"Breakeven vs $0.60/1M closed-model price: {breakeven_tokens:,.0f} tokens/hour")
print("Far above typical small-app traffic")

模型路由

默认使用便宜的模型,只在必要时升级到昂贵的模型:

def answer(query):
    cheap = call_model('gpt-4o-mini', query)
    if confidence(cheap) > 0.8:
        return cheap
    return call_model('gpt-4o', query)

按步骤路由

在智能体内部按步骤进行路由:

  • 使用 GPT-4o 进行规划(复杂推理)
  • 使用 Llama 8B 进行搜索(便宜的循环操作)
  • 使用 Claude 进行综合(更高的写作质量)

对延迟敏感的路径

对于语音或实时聊天:

  • 使用 Groq、SambaNova 或 Cerebras,将延迟控制在 200 毫秒以内
  • 积极地流式传输词元
  • 避免在关键路径上使用多步骤智能体

对质量敏感的路径

对于最终答案和高风险工作:

  • 使用您负担得起的最佳模型
  • 加入跨模型批评(GPT-4 撰写,Claude 审查)
  • 加入验证步骤(运行代码、核查事实)

总拥有成本

自托管成本包括:

  • GPU 租用费用或资本支出
  • 管理基础设施所需的工程师时间
  • 监控和值班支持
  • 吞吐量低于托管服务

对于大多数团队,在用量非常高之前,托管 API 的 TCO 更低。

何时为大型闭源模型付费

  • 面向最终用户的答案
  • 前沿推理
  • 多模态能力
  • 200k 以上的上下文

在您的任务上进行基准测试

公开基准只能说明部分情况。请使用您的实际数据构建一个包含 50 个问题的评测集,并据此衡量每个候选模型。选择满足质量要求的最便宜模型。

路由策略

在仍满足质量要求的前提下,最便宜的模型路由策略是什么?

回顾

延迟、成本、能力——三者只能选两项。默认使用便宜的模型,在需要时再升级。托管的开放模型 API(Groq、Together)通常优于两个极端选择。

常见问题解答

「取舍:延迟、成本、能力」课时是免费的吗?

是的 — 「取舍:延迟、成本、能力」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。

「取舍:延迟、成本、能力」这节课中我会学到什么?

开放权重模型可以节省成本,但会消耗工程师工时;请在作出决定前进行基准测试。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 AI Agents 需要有经验吗?

无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。

「取舍:延迟、成本、能力」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 AI Agents 课中编写并运行代码吗?

能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. Llama、Mistral 与 Qwen 概览
  2. 使用 Ollama 和 llama.cpp 运行本地模型
  3. 支持函数调用的开放模型(Hermes、Functionary)
  4. 取舍:延迟、成本、能力
← 返回 AI Agents