AI Agents · 课时

代理式推理(o1、o3、推理模型)

这类模型会在回答前“思考”——包括内部思维链、测试时计算和自我纠错。

第 1 / 4 课15 个步骤

代理式推理(o1、o3、推理模型) 是 CoddyKit 上的免费 AI Agents 课时。 这是第 1 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。

本课时的部分内容尚未翻译,以英文显示。

一类新模型

OpenAI o1(2024 年 9 月)引入了“推理模型”——这类 LLM 会在生成用户可见的答案之前,明确地进行逐步推理。后继模型包括 o3、DeepSeek R1、支持扩展思考的 Claude、Gemini 2.5 thinking,以及许多其他模型。

它们如何工作

模型不会立即生成答案,而是会:

  1. 生成一段很长的内部“思考”序列(类似 CoT)
  2. 探索多种方法
  3. 自我纠正
  4. 然后输出最终的可见答案

测试时计算

您可以选择模型进行多少“思考”。投入更多令牌进行思考,意味着在困难问题上获得更好的答案。代价是更高的延迟和成本。

OpenAI o-Series API

response = client.chat.completions.create(
    model='o3-mini',
    messages=[{'role': 'user', 'content': 'Solve this puzzle...'}],
    reasoning_effort='high'   # low / medium / high
)
print(response.choices[0].message.content)
print(response.usage.reasoning_tokens)   # how many 'thinking' tokens were used

Anthropic Extended Thinking

response = client.messages.create(
    model='claude-sonnet-4-5',
    max_tokens=8192,
    thinking={'type': 'enabled', 'budget_tokens': 4096},
    messages=[{'role': 'user', 'content': 'Hard reasoning problem'}]
)
# response.content includes 'thinking' blocks + 'text' final answer

推理模型大显身手的场景

  • 多步骤数学问题
  • 包含复杂逻辑的代码生成
  • 法律 / 科学推理
  • 需要前瞻的规划

基准测试:o3 在 AIME 上的得分超过 90%,在 GPQA 上也取得了很高的分数,远超非推理模型。

标准模型更好的场景

  • 简单聊天 / 问答 — 推理是浪费
  • 对延迟敏感的路径 — 推理会增加数秒延迟
  • 对成本敏感的大批量工作 — 推理会使成本成倍增加
  • 风格 / 格式处理任务 — 没有收益

成本特征

推理令牌会计入定价。高强度的 o3-mini 每个问题可能使用 1 万至 10 万个思考令牌。在更大型的推理模型上,每个问题的成本可能达到 0.10—1 美元。

在智能体循环内部

将推理模型用作大型智能体内部的规划器:

  • 推理模型:规划 / 决策 / 评估
  • 标准模型:执行步骤
  • 工具调用:正常运行

兼得两者优势:在关键环节进行深度推理,在其他地方使用廉价执行。

不要在顶部强行添加 CoT

使用推理模型时,您不再需要使用“让我们一步一步思考”这类提示——它们已经在内部执行 CoT。添加这类提示实际上可能会产生反效果。

开源推理

DeepSeek R1、R1-Distill 以及其他模型将推理能力带到了开放权重模型中。您可以在 HuggingFace、Together AI 等平台上使用它们。

研究前沿

  • 反思调优 — 训练模型进行自我批评
  • 基于搜索的推理 — 在推理时使用思维树、MCTS
  • 测试时训练 — 针对每个查询调整权重

注意:黑盒思考

推理模型的“思考”通常会对您隐藏(OpenAI),或经过摘要后提供(Anthropic)。透明度有限会使调试更加困难;请改为依靠输入 / 输出评估。

何时使用推理模型

对于哪种任务,推理模型最值得额外的成本?

回顾

推理模型(o1、o3、R1、支持扩展思考的 Claude)以时间和成本换取困难任务上的质量。请在智能体内部将其用作规划器或评判器。简单聊天则无需使用。

免费开始

用 AI 导师学习 AI Agents — 免费

在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。

课程
60
课程
239

常见问题解答

「代理式推理(o1、o3、推理模型)」课时是免费的吗?

是的 — 「代理式推理(o1、o3、推理模型)」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。

「代理式推理(o1、o3、推理模型)」这节课中我会学到什么?

这类模型会在回答前“思考”——包括内部思维链、测试时计算和自我纠错。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 AI Agents 需要有经验吗?

无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 1 节课,共 4 节。

「代理式推理(o1、o3、推理模型)」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 AI Agents 课中编写并运行代码吗?

能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 代理式推理(o1、o3、推理模型)
  2. 混合符号与神经代理
  3. 多模态代理(视觉 + 语音 + 操作)
  4. 开放问题:稳健性、对齐与长时记忆
← 返回 AI Agents