0Pricing
AI Prompt Engineering · 课时

结构化输出的意义

可靠且机器可读的结果。

结构化输出的意义 是 CoddyKit 上的免费 AI Prompt Engineering 课时。 这是第 1 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Prompt Engineering 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Prompt Engineering 课程共包含 4 节课。

自由文本问题

自然语言 LLM 输出难以明确解析。模型可能这次回答 The price is $42,下次却回答 It costs forty-two dollars。期望得到数字的下游代码就会崩溃。

结构化输出是指约束模型以机器可读的形状(JSON、类型化对象)输出数据,使解析具有确定性,而不是依赖启发式方法。

解析是隐性成本

团队在脆弱文本的后处理上投入的工程工作,往往比提示词设计还多。正则表达式提取、模糊字符串匹配以及解析失败后重试的循环,都是非结构化输出的症状。

  • 措辞发生变化时,正则表达式就会失效。
  • 模糊匹配会引入不易察觉的错误。
  • 每增加一个字段,解析范围都会成倍扩大。

结构化生成将这一契约前移到请求中。

结构化的三个层级

约束强度可以分为以下几个层级:

  • 软提示——在提示中要求输出 JSON;不提供保证。
  • 模式引导——传入 JSON 模式;由提供方进行验证。
  • 受约束解码——语法或 FSM 会屏蔽无效令牌,因此只能生成有效的 JSON。

每个层级都在灵活性和可靠性之间进行权衡。

受约束解码的内部机制

在最强的约束层级中,解码器会在每一步应用令牌掩码。语法(通常会编译为有限状态机)会计算哪些下一个令牌能够保持输出有效,而采样器只能从这些令牌中进行选择。

这样一来,格式错误的 JSON 在结构上不可能产生,而不只是受到劝阻。

# Conceptual: logit masking against a grammar FSM
def masked_sample(logits, fsm_state, grammar):
    allowed = grammar.allowed_token_ids(fsm_state)
    mask = full_like(logits, NEG_INF)
    mask[allowed] = 0.0
    return sample(logits + mask)

提供方原生结构化输出

现代 API 提供带有严格 JSON 模式的 response_format。提供方保证响应符合该模式,因此您无需编写防御性代码即可进行反序列化。

client.chat.completions.create(
    model='gpt-4o',
    messages=[{'role': 'user', 'content': 'Extract the invoice fields.'}],
    response_format={
        'type': 'json_schema',
        'json_schema': {
            'name': 'invoice',
            'strict': True,
            'schema': {
                'type': 'object',
                'properties': {
                    'total': {'type': 'number'},
                    'currency': {'type': 'string'}
                },
                'required': ['total', 'currency'],
                'additionalProperties': False
            }
        }
    }
)

可靠性即契约

请将模式视为模型与您的系统之间的应用程序接口契约。它就像类型化函数签名一样,能够记录意图,并提供类似编译时的保证。

这会将 LLM 输出从代码必须解释的建议,转变为代码可以信任的类型化值。

确定性与创造性的权衡

结构约束的是形状,不一定是内容。带有自由文本 summary: string 字段的模式,仍然允许模型在该字段中生成具有创造性的文字。

最佳实践是:严格约束封装结构(字段、类型、枚举),只在指定的字符串字段中保留创造空间。

枚举可以消除整类失败

自由文本分类(sentiment: 'kind of positive')无法解析。枚举会强制从固定集合中选择一个值,从而消除整类规范化错误。

{
  'type': 'object',
  'properties': {
    'sentiment': {
      'type': 'string',
      'enum': ['positive', 'neutral', 'negative']
    }
  },
  'required': ['sentiment'],
  'additionalProperties': False
}

可观测性与模式版本管理

结构化输出更容易记录日志、比较差异和监控。您可以计算字段级指标、检测偏移,并在字段缺失时发出警报。

请将模式视为有版本的制品:先将新增字段设为可选,在移除字段前先弃用它,并为每个响应标注生成该响应的模式版本。

何时不应强制结构化 NOT

过度约束可能会降低质量。在推理步骤中强制使用复杂模式,可能会抑制思维链。

  • 先让模型使用自由文本进行推理。
  • 然后再进行第二次结构化调用,以格式化结论。

将推理与格式化分开,通常优于一次过度约束的调用。

成本与延迟考量

结构化输出通常会降低总成本:重试次数更少,用于铺陈文字的令牌更少,也不需要单独的解析服务。不过,严格模式可能会增加少量服务器端开销,并且可能拒绝第一次尝试,因此请始终配合修复策略使用(后文会介绍)。

快速检查

哪种技术能让格式错误的 JSON 在结构上不可能产生,而不只是受到劝阻?

回顾

现在您已经了解结构化输出为何重要:

  • 它用类型化契约替代脆弱的解析。
  • 约束方式涵盖从软提示到受约束解码的不同层级。
  • 枚举和严格的封装结构可以消除整类错误。
  • 结构化有助于可观测性和版本管理。
  • 将推理与格式化分开,以避免质量损失。

接下来:如何在提示中使用 JSON 模式准确表达这一契约。

常见问题解答

「结构化输出的意义」课时是免费的吗?

是的 — 「结构化输出的意义」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Prompt Engineering 课程的其余内容,请升级到 CoddyKit PRO。 AI Prompt Engineering 课程共包含 4 节课。

「结构化输出的意义」这节课中我会学到什么?

可靠且机器可读的结果。 你通过在浏览器中直接运行的动手代码来练习 AI Prompt Engineering,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 AI Prompt Engineering 需要有经验吗?

无需任何先前经验。CoddyKit 上的 AI Prompt Engineering 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 1 节课,共 4 节。

「结构化输出的意义」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 AI Prompt Engineering 课中编写并运行代码吗?

能。每节 AI Prompt Engineering 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 结构化输出的意义
  2. 提示中的 JSON Schema
  3. 工具与函数模式
  4. 修复与验证循环
← 返回 AI Prompt Engineering