0Pricing
AI Agents · 课时

反思与自我批评循环

每一步之后都询问模型“刚才做得对吗?接下来做什么?”——这是成本最低的可靠性提升方法。

反思与自我批评循环 是 CoddyKit 上的免费 AI Agents 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。

本课时的部分内容尚未翻译,以英文显示。

什么是反思

反思是指智能体回顾自己过去的动作,并询问:“哪些地方做得好?哪些地方做得不好?我应该做出哪些不同的处理?”

这是提升智能体可靠性成本最低的方法。

Reflexion 论文

Shinn 等人于 2023 年提出了 Reflexion。在每次失败的尝试之后,智能体都会撰写自我批评,并将其作为下一次尝试的指导。质量大幅提升。

A Simple Reflection Loop

def with_reflection(task, max_attempts=3):
    reflections = []
    for attempt in range(max_attempts):
        result = agent.run(task, hints=reflections)
        if result.success:
            return result
        reflection = llm.invoke(f'''
Task: {task}
Attempt: {attempt + 1}
What went wrong: {result.error}

Reflect on what to do differently next time.
''').content
        reflections.append(reflection)
    return last_result

没有失败时进行自我批评

您也可以让智能体对成功的输出进行自我批评:

critique_prompt = '''
Review your answer for:
1. Is it factually correct?
2. Is it complete?
3. Are there obvious improvements?

If improvements possible, return REVISE: <revised answer>.
Otherwise return ACCEPT.
'''

将批评器作为独立模型

使用不同的模型进行批评:

  • 减少共同偏差
  • 成本可能更低(小型批评模型、大型生成模型)
  • 也可以反过来(小型生成模型、大型批评模型)

步骤级反思

在每个 STEP 之后进行反思,而不只是最后反思:

thought = 'I will use search_kb'
action = call_search_kb(...)
observation = '...'
reflection = llm.invoke(f'Did that step help? Should I try a different tool next?').content

成本意识

反思会使 LLM call 次数翻倍。对于延迟要求极高的路径,请跳过反思。对于高质量输出,反思是值得的。

避免迎合式反思

如果您问“这是否奏效了?”,模型通常会回答“是”。请强制进行批判性评估:

critique_prompt = 'List 3 SPECIFIC PROBLEMS with the previous answer. If you cannot find any, say WHY there are none.'

反思记忆

将反思保存到持久化存储中。经过多次会话后,智能体会建立一个“经验教训”库:

save_reflection({
    'task_type': 'sql-write',
    'lesson': 'Always check if table is partitioned before running heavy aggregations.',
    'created_at': now()
})

检索相关的过往反思

开始新任务时,检索与任务类型匹配的经验教训:

lessons = vector_db.search(embed(task_description), filter={'type': 'reflection'}, k=3)
prompt += '\nLessons learned from past tasks:\n' + '\n'.join(lessons)

一个具体成果

在代码智能体提示词中加入“完成每个步骤后,简要记录可能出错的地方并再次检查”,通常能在基准测试中将错误率降低 15-30%。

验证器—生成器

一种变体是:让一个 LLM 生成内容,另一个进行验证。如果验证器拒绝,生成器就根据拒绝原因重试。如今许多生产环境中的智能体都采用这种方式。

何时不进行 NOT 反思

  • 本身成本已经很低的一次性任务
  • 实时聊天
  • 对延迟要求极高的路径

Reflexion 的洞见

Reflexion 论文的关键洞见是什么?

回顾

反思是低成本的质量提升手段。失败后进行批评,保存经验教训,并在未来处理类似任务时检索这些经验。条件允许时,请使用独立的批评模型。

常见问题解答

「反思与自我批评循环」课时是免费的吗?

是的 — 「反思与自我批评循环」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。

「反思与自我批评循环」这节课中我会学到什么?

每一步之后都询问模型“刚才做得对吗?接下来做什么?”——这是成本最低的可靠性提升方法。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 AI Agents 需要有经验吗?

无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。

「反思与自我批评循环」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 AI Agents 课中编写并运行代码吗?

能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 层次化任务分解
  2. 目标栈与回溯
  3. 世界模型与前瞻
  4. 反思与自我批评循环
← 返回 AI Agents