模型路由(低价 -> 高价)
先尝试小模型,只有在小模型失败或置信度较低时,才升级到前沿模型。
模型路由(低价 -> 高价) 是 CoddyKit 上的免费 AI Agents 课时。 这是第 2 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。
本课时的部分内容尚未翻译,以英文显示。
不要为简单任务使用大型模型
调用 GPT-4o 来判断“这封电子邮件是否为垃圾邮件?”是在浪费资金。请将简单任务路由到低成本模型,将困难任务路由到高成本模型。
路由模式
- 首先尝试小型或低成本模型
- 如果输出的置信度较低或未通过验证,则升级到大型模型
- 记录采用了哪条路径
Confidence-Based Routing
cheap_response = call('gpt-4o-mini', messages)
confidence = parse_confidence(cheap_response)
if confidence > 0.85:
return cheap_response
# Otherwise escalate
return call('gpt-4o', messages)基于验证的路由
如果低成本模型的输出未通过模式验证,则升级到更大的模型:
try:
result = Schema.model_validate_json(cheap_response.content)
return result
except ValidationError:
return Schema.model_validate_json(call('gpt-4o', messages).content)逐步选择模型
智能体的不同部分需要不同的模型:
MODEL_BY_STEP = {
'classify_intent': 'gpt-4o-mini', # easy
'plan': 'gpt-4o', # critical
'extract': 'gpt-4o-mini', # routine
'write_response': 'claude-sonnet-4-5' # quality matters
}
# --- demo ---
for step in ['classify_intent', 'plan', 'extract', 'write_response']:
print(f'{step:16s} -> {MODEL_BY_STEP[step]}')
跨提供商路由
使用 Groq 降低延迟,使用 OpenAI 提高质量,使用 Anthropic 处理长上下文:
if need_low_latency:
return call_groq('llama-3.1-70b')
elif need_long_context:
return call_anthropic('claude-sonnet-4-5')
else:
return call_openai('gpt-4o-mini')让 LLM 充当路由器
由小型模型对请求进行分类,并选择下一个模型:
router = call('gpt-4o-mini', 'Classify this request as simple/complex/code. Return one word.')
if router == 'simple':
return call('gpt-4o-mini', user_msg)
else:
return call('gpt-4o', user_msg)回退链
如果主模型失败(达到速率限制或发生错误),则尝试备用模型:
for model in ['gpt-4o', 'claude-sonnet-4-5', 'gpt-4o-mini']:
try:
return call(model, messages)
except RateLimitError:
continue
raise AllModelsFailed()基于嵌入的路由
对查询进行嵌入;如果它与已知的简单案例相似,则使用低成本模型,否则使用大型模型:
embedding = embed(query)
matches = vector_db.query(embedding, k=3, filter={'category': 'easy'})
if max(m.score for m in matches) > 0.9:
use_cheap_model()路由层级示例
| 层级 | 成本 | 用途 |
|---|---|---|
| 第 1 层 | $ — Llama 8B | 分类、提取 |
| 第 2 层 | $$ — gpt-4o-mini | 标准智能体步骤 |
| 第 3 层 | $$$ — gpt-4o / claude | 困难推理、最终综合 |
衡量净节省额
跟踪以下指标:
- 由各层级处理的请求占比
- 各层级的质量(评估通过率)
- 每次请求的总成本
将结果与基线(始终使用大型模型)进行比较,以验证路由是否确实带来帮助。
校准置信度
模型自报的置信度并不可靠。请使用评估集进行校准;如果模型声称置信度为 90%,但实际只有 60% 的正确率,就应调整阈值。
开源路由器
RouteLLM(LMSYS)是一个用于训练模型路由器的 OSS 框架。如果路由对您的成本结构至关重要,值得研究这一框架。
路由策略
最简单且最有效的路由策略是什么?
回顾
采用分层模型、优先使用低成本模型并在必要时升级、逐步路由以及回退链。衡量各层级的占比和质量。路由是生产成本中影响最大的杠杆。
用 AI 导师学习 AI Agents — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 60
- 课程
- 239
常见问题解答
「模型路由(低价 -> 高价)」课时是免费的吗?
是的 — 「模型路由(低价 -> 高价)」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。
「模型路由(低价 -> 高价)」这节课中我会学到什么?
先尝试小模型,只有在小模型失败或置信度较低时,才升级到前沿模型。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 AI Agents 需要有经验吗?
无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 2 节课,共 4 节。
「模型路由(低价 -> 高价)」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 AI Agents 课中编写并运行代码吗?
能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- 为每一步设置令牌预算
- 模型路由(低价 -> 高价)
- 提示与结果缓存(Anthropic、Vertex)
- 量化与推测解码