取舍:延迟、成本、能力
开放权重模型可以节省成本,但会消耗工程师工时;请在作出决定前进行基准测试。
取舍:延迟、成本、能力 是 CoddyKit 上的免费 AI Agents 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。
三个维度,选两个
每次模型选择都需要在以下方面进行权衡:
- 延迟——每次响应所需的时间
- 成本——每百万个令牌的费用
- 能力——处理困难任务时的质量
没有任何模型能在这三个方面都做到最好。
能力分布
| 顶级 | 中档 | 小型 | |
|---|---|---|---|
| 闭源 | GPT-4o、Claude Sonnet 4.5 | GPT-4o-mini、Haiku | — |
| 开放 | Llama 3.1 405B | Llama 3.1 70B、Qwen 2.5 72B | Llama 3.1 8B、Phi-3 |
延迟分布
典型智能体轮次的大致 p50 延迟:
- Groq Llama 3.1 70B:约 200ms(快如闪电)
- gpt-4o-mini:约 600ms
- gpt-4o:约 1500ms
- 在 1xH100 上自托管 Llama 70B:约 800ms
- 在 RTX 4090 上自托管 Llama 8B:约 200ms
每百万个词元的成本(约)
2025年年中估算,输入/输出:
- GPT-4o:$2.50 / $10
- GPT-4o-mini:$0.15 / $0.60
- Claude Sonnet 4.5:$3 / $15
- Claude Haiku:$0.80 / $4
- Together Llama 70B:$0.88 / $0.88
- Groq Llama 70B:$0.59 / $0.79
- 自托管(您的 GPU):每个词元基本上免费
计算成本平衡点
只有超过某个用量阈值后,自托管才会省钱。粗略估算:
GPU_COST_PER_HOUR = 1.5
GPU_TOKENS_PER_SECOND = 50
TOKENS_PER_HOUR = GPU_TOKENS_PER_SECOND * 3600
# 180,000 tokens/hour
print(f"Tokens per hour: {TOKENS_PER_HOUR:,}")
breakeven_tokens = GPU_COST_PER_HOUR / 0.6e-6
print(f"Breakeven vs $0.60/1M closed-model price: {breakeven_tokens:,.0f} tokens/hour")
print("Far above typical small-app traffic")
模型路由
默认使用便宜的模型,只在必要时升级到昂贵的模型:
def answer(query):
cheap = call_model('gpt-4o-mini', query)
if confidence(cheap) > 0.8:
return cheap
return call_model('gpt-4o', query)按步骤路由
在智能体内部按步骤进行路由:
- 使用 GPT-4o 进行规划(复杂推理)
- 使用 Llama 8B 进行搜索(便宜的循环操作)
- 使用 Claude 进行综合(更高的写作质量)
对延迟敏感的路径
对于语音或实时聊天:
- 使用 Groq、SambaNova 或 Cerebras,将延迟控制在 200 毫秒以内
- 积极地流式传输词元
- 避免在关键路径上使用多步骤智能体
对质量敏感的路径
对于最终答案和高风险工作:
- 使用您负担得起的最佳模型
- 加入跨模型批评(GPT-4 撰写,Claude 审查)
- 加入验证步骤(运行代码、核查事实)
总拥有成本
自托管成本包括:
- GPU 租用费用或资本支出
- 管理基础设施所需的工程师时间
- 监控和值班支持
- 吞吐量低于托管服务
对于大多数团队,在用量非常高之前,托管 API 的 TCO 更低。
何时为大型闭源模型付费
- 面向最终用户的答案
- 前沿推理
- 多模态能力
- 200k 以上的上下文
在您的任务上进行基准测试
公开基准只能说明部分情况。请使用您的实际数据构建一个包含 50 个问题的评测集,并据此衡量每个候选模型。选择满足质量要求的最便宜模型。
路由策略
在仍满足质量要求的前提下,最便宜的模型路由策略是什么?
回顾
延迟、成本、能力——三者只能选两项。默认使用便宜的模型,在需要时再升级。托管的开放模型 API(Groq、Together)通常优于两个极端选择。
常见问题解答
「取舍:延迟、成本、能力」课时是免费的吗?
是的 — 「取舍:延迟、成本、能力」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。
「取舍:延迟、成本、能力」这节课中我会学到什么?
开放权重模型可以节省成本,但会消耗工程师工时;请在作出决定前进行基准测试。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 AI Agents 需要有经验吗?
无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。
「取舍:延迟、成本、能力」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 AI Agents 课中编写并运行代码吗?
能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。