0Pricing
AI Prompt Engineering · 课时

思维链提示

引导模型进行逐步推理。

思维链提示 是 CoddyKit 上的免费 AI Prompt Engineering 课时。 这是第 1 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Prompt Engineering 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Prompt Engineering 课程共包含 4 节课。

将推理视为令牌预算

思维链(CoT)提示会在最终答案之前引出中间推理步骤。关键洞见是:这类模型会对每个令牌执行固定量的计算,因此允许模型生成推理令牌,实际上就等于为它提供了更多串行计算来得出答案。

强制模型立即作答,会限制解决困难问题时可用的计算量;CoT 通过将计算分散到生成的令牌中,消除了这一限制。

# Direct: model must compute everything before the first token
DIRECT = 'Q: ' + q + '\nA:'
# CoT: model can use tokens as scratch space
COT = 'Q: ' + q + '\nA: Let us reason step by step.'

零样本 CoT

著名的触发短语“让我们一步一步思考”(Kojima 等,2022)无需示例即可引出推理。这是因为经过指令微调的模型已经内化了这样的模式:该短语通常出现在完整解答之前。

零样本 CoT 成本低且效果出人意料地好,但其推理质量不如经过整理示例的少样本 CoT 那样容易控制。

def zero_shot_cot(question):
    stage1 = llm('Q: ' + question + '\nA: Let us think step by step.')
    # Extract the final answer in a second, constrained call
    stage2 = llm(stage1 + '\nTherefore, the final answer is:')
    return parse_answer(stage2)

少样本 CoT

少样本 CoT(Wei 等,2022)提供包含推理轨迹的示例,而不仅仅是答案。这既教会模型如何推理,也教会模型所需的格式,因此比零样本方案产生的思维链更可靠、更一致。

请整理推理风格、细致程度和长度都符合您期望的示例。不一致的示例推理会产生不一致的思维链。

FS_COT = (
    'Q: Roger has 5 balls, buys 2 cans of 3. How many balls?\n'
    'A: 5 + 2*3 = 5 + 6 = 11. The answer is 11.\n\n'
    'Q: ' + question + '\nA:'
)

将推理与答案分离

始终让最终答案可由机器提取:以固定标记结束思维链(例如“答案是 X”或一个 JSON 字段)。解析自由格式的思维链十分脆弱。

对于面向用户的产品,您可以隐藏思维链,只呈现解析后的答案,并将推理保留为内部草稿。

import re

def extract(chain):
    m = re.search(r'[Tt]he answer is\s*(.+?)[.\n]', chain)
    if not m:
        raise ValueError('no answer marker found')
    return m.group(1).strip()

不保证忠实性

一个关键注意事项是:用语言表达出的思维链可能无法反映模型的真实计算过程。研究表明,模型可能会生成听起来合理的推理,在事后为一个实际由隐藏偏差驱动的答案提供合理化解释(例如选项的位置)。

不要将 CoT 视为忠实的解释或审计记录。它能提高许多任务的准确率,但并不能让您了解模型的真实运行机制。

# Faithfulness probe: perturb an irrelevant cue (e.g., always make
# option A correct in the few-shot). If the chain still 'justifies'
# choosing A, the stated reasoning is unfaithful to the real cause.

CoT 的解码设置

对于单条确定性思维链,较低的温度可以降低方差。但 CoT 与采样结合时效果强大:在中等温度下,您可以生成多条各不相同的思维链并进行汇总(将在自洽性部分介绍)。

如果您打算采样多条路径,请避免使用贪心解码;贪心解码会压缩多样性,使汇总失去意义。

single = llm(COT, temperature=0.0)            # one stable chain
paths  = [llm(COT, temperature=0.7) for _ in range(10)]  # diverse

结构化与表格化推理

对于复杂问题,请为思维链施加结构:使用编号步骤、状态表,或将先规划后执行分开。结构可以减少跳过步骤的情况,并使中间状态可验证。

程序辅助方法还可以更进一步,将可执行代码作为推理过程输出,并把算术运算交给解释器,从而消除整类计算错误。

PAL = (
    'Solve by writing Python. Q: ' + q + '\n'
    'A:\ndef solve():\n'
    '    # the model writes code here, then we exec() it\n'
)
# Offload arithmetic to a deterministic interpreter

长度、成本与延迟

CoT 会增加输出令牌数量,从而提高成本和延迟。对于简单项目,这些额外开销没有收益;对于困难项目,它却不可或缺。一种实用模式是adaptive 推理:只有在廉价的难度估计或低置信度的直接答案表明有必要时,才触发 CoT。

对于内置思考能力的推理模型,您应控制推理工作量预算,而不是自行提示思维链。

def adaptive(question):
    direct = llm('Q: ' + question + '\nA (answer only):', temperature=0)
    if confidence(direct) > 0.85:
        return direct
    return zero_shot_cot(question)  # escalate to reasoning only if needed

推理原生模型中的 CoT

现代推理模型会自动执行扩展的内部思考。对它们塞入冗长的“让我们一步一步思考”指令可能是多余的,甚至会适得其反,干扰其经过训练的思考过程。

对于这类模型,请优先使用简洁的任务说明和明确的答案格式要求,并调整推理工作量参数,而不是手工编写思维链。

# Reasoning-native model: let it think, just constrain the output
resp = reasoning_model(
    prompt=question,
    reasoning_effort='medium',
    output_format='Final answer on the last line as: ANSWER=<x>'
)

CoT 适得其反的情况

在推理过程会压过正确直觉、任务只是简单模式匹配,或语言化会引入模型原本不会隐式犯下的错误时,CoT 可能会造成负面影响。在较长的推理链中,提示注入的攻击面也会扩大。

针对每项任务,将 CoT 与直接作答进行基准比较;切勿假定推理提示普遍都有益。

def should_use_cot(task_acc_cot, task_acc_direct, cot_cost_mult):
    gain = task_acc_cot - task_acc_direct
    # Only adopt CoT if accuracy gain justifies the token multiplier
    return gain > MIN_GAIN and gain / cot_cost_mult > MIN_EFFICIENCY

将 CoT 用于生产环境

生产环境中的 CoT:整理一致的示例(或依赖模型自身的推理能力),强制使用可解析的 answer 标记,为困难题目采样多条推理链,尽可能通过代码执行验证算术,并根据难度估计决定是否启用推理,以控制成本。

记录推理链以供离线分析,但绝不要将其暴露为事实依据的解释。

def production_solve(q):
    if easy(q):
        return extract(llm(DIRECT_PROMPT.format(q=q), temperature=0))
    chains = [llm(FS_COT.format(q=q), temperature=0.7) for _ in range(8)]
    return majority_vote([extract(c) for c in chains])

快速检查

思考 CoT 为什么有帮助,以及它在哪些情况下没有帮助。

回顾

关键要点:

  • CoT 以额外令牌换取额外的串行计算;它有助于多步骤任务,而非琐碎任务。
  • 零样本 CoT 使用触发短语;少样本 CoT 提供一致的推理示例。
  • 始终以机器可提取的 answer 标记结尾;推理链不是忠实的解释。
  • 为困难题目采样多条推理链,将算术交给代码处理,并根据难度决定是否启用 CoT。
  • 对于原生具备推理能力的模型,相比冗长的推理链指令,应优先使用简洁提示和推理工作量预算。

常见问题解答

「思维链提示」课时是免费的吗?

是的 — 「思维链提示」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Prompt Engineering 课程的其余内容,请升级到 CoddyKit PRO。 AI Prompt Engineering 课程共包含 4 节课。

「思维链提示」这节课中我会学到什么?

引导模型进行逐步推理。 你通过在浏览器中直接运行的动手代码来练习 AI Prompt Engineering,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 AI Prompt Engineering 需要有经验吗?

无需任何先前经验。CoddyKit 上的 AI Prompt Engineering 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 1 节课,共 4 节。

「思维链提示」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 AI Prompt Engineering 课中编写并运行代码吗?

能。每节 AI Prompt Engineering 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 思维链提示
  2. 自洽性采样
  3. 思维树探索
  4. 推理提示何时有帮助
← 返回 AI Prompt Engineering