代理式推理(o1、o3、推理模型)
这类模型会在回答前“思考”——包括内部思维链、测试时计算和自我纠错。
代理式推理(o1、o3、推理模型) 是 CoddyKit 上的免费 AI Agents 课时。 这是第 1 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。
本课时的部分内容尚未翻译,以英文显示。
一类新模型
OpenAI o1(2024 年 9 月)引入了“推理模型”——这类 LLM 会在生成用户可见的答案之前,明确地进行逐步推理。后继模型包括 o3、DeepSeek R1、支持扩展思考的 Claude、Gemini 2.5 thinking,以及许多其他模型。
它们如何工作
模型不会立即生成答案,而是会:
- 生成一段很长的内部“思考”序列(类似 CoT)
- 探索多种方法
- 自我纠正
- 然后输出最终的可见答案
测试时计算
您可以选择模型进行多少“思考”。投入更多令牌进行思考,意味着在困难问题上获得更好的答案。代价是更高的延迟和成本。
OpenAI o-Series API
response = client.chat.completions.create(
model='o3-mini',
messages=[{'role': 'user', 'content': 'Solve this puzzle...'}],
reasoning_effort='high' # low / medium / high
)
print(response.choices[0].message.content)
print(response.usage.reasoning_tokens) # how many 'thinking' tokens were usedAnthropic Extended Thinking
response = client.messages.create(
model='claude-sonnet-4-5',
max_tokens=8192,
thinking={'type': 'enabled', 'budget_tokens': 4096},
messages=[{'role': 'user', 'content': 'Hard reasoning problem'}]
)
# response.content includes 'thinking' blocks + 'text' final answer推理模型大显身手的场景
- 多步骤数学问题
- 包含复杂逻辑的代码生成
- 法律 / 科学推理
- 需要前瞻的规划
基准测试:o3 在 AIME 上的得分超过 90%,在 GPQA 上也取得了很高的分数,远超非推理模型。
标准模型更好的场景
- 简单聊天 / 问答 — 推理是浪费
- 对延迟敏感的路径 — 推理会增加数秒延迟
- 对成本敏感的大批量工作 — 推理会使成本成倍增加
- 风格 / 格式处理任务 — 没有收益
成本特征
推理令牌会计入定价。高强度的 o3-mini 每个问题可能使用 1 万至 10 万个思考令牌。在更大型的推理模型上,每个问题的成本可能达到 0.10—1 美元。
在智能体循环内部
将推理模型用作大型智能体内部的规划器:
- 推理模型:规划 / 决策 / 评估
- 标准模型:执行步骤
- 工具调用:正常运行
兼得两者优势:在关键环节进行深度推理,在其他地方使用廉价执行。
不要在顶部强行添加 CoT
使用推理模型时,您不再需要使用“让我们一步一步思考”这类提示——它们已经在内部执行 CoT。添加这类提示实际上可能会产生反效果。
开源推理
DeepSeek R1、R1-Distill 以及其他模型将推理能力带到了开放权重模型中。您可以在 HuggingFace、Together AI 等平台上使用它们。
研究前沿
- 反思调优 — 训练模型进行自我批评
- 基于搜索的推理 — 在推理时使用思维树、MCTS
- 测试时训练 — 针对每个查询调整权重
注意:黑盒思考
推理模型的“思考”通常会对您隐藏(OpenAI),或经过摘要后提供(Anthropic)。透明度有限会使调试更加困难;请改为依靠输入 / 输出评估。
何时使用推理模型
对于哪种任务,推理模型最值得额外的成本?
回顾
推理模型(o1、o3、R1、支持扩展思考的 Claude)以时间和成本换取困难任务上的质量。请在智能体内部将其用作规划器或评判器。简单聊天则无需使用。
用 AI 导师学习 AI Agents — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 60
- 课程
- 239
常见问题解答
「代理式推理(o1、o3、推理模型)」课时是免费的吗?
是的 — 「代理式推理(o1、o3、推理模型)」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。
「代理式推理(o1、o3、推理模型)」这节课中我会学到什么?
这类模型会在回答前“思考”——包括内部思维链、测试时计算和自我纠错。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 AI Agents 需要有经验吗?
无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 1 节课,共 4 节。
「代理式推理(o1、o3、推理模型)」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 AI Agents 课中编写并运行代码吗?
能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- 代理式推理(o1、o3、推理模型)
- 混合符号与神经代理
- 多模态代理(视觉 + 语音 + 操作)
- 开放问题:稳健性、对齐与长时记忆