结构化输出的意义
可靠且机器可读的结果。
结构化输出的意义 是 CoddyKit 上的免费 AI Prompt Engineering 课时。 这是第 1 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Prompt Engineering 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Prompt Engineering 课程共包含 4 节课。
自由文本问题
自然语言 LLM 输出难以明确解析。模型可能这次回答 The price is $42,下次却回答 It costs forty-two dollars。期望得到数字的下游代码就会崩溃。
结构化输出是指约束模型以机器可读的形状(JSON、类型化对象)输出数据,使解析具有确定性,而不是依赖启发式方法。
解析是隐性成本
团队在脆弱文本的后处理上投入的工程工作,往往比提示词设计还多。正则表达式提取、模糊字符串匹配以及解析失败后重试的循环,都是非结构化输出的症状。
- 措辞发生变化时,正则表达式就会失效。
- 模糊匹配会引入不易察觉的错误。
- 每增加一个字段,解析范围都会成倍扩大。
结构化生成将这一契约前移到请求中。
结构化的三个层级
约束强度可以分为以下几个层级:
- 软提示——在提示中要求输出 JSON;不提供保证。
- 模式引导——传入 JSON 模式;由提供方进行验证。
- 受约束解码——语法或 FSM 会屏蔽无效令牌,因此只能生成有效的 JSON。
每个层级都在灵活性和可靠性之间进行权衡。
受约束解码的内部机制
在最强的约束层级中,解码器会在每一步应用令牌掩码。语法(通常会编译为有限状态机)会计算哪些下一个令牌能够保持输出有效,而采样器只能从这些令牌中进行选择。
这样一来,格式错误的 JSON 在结构上不可能产生,而不只是受到劝阻。
# Conceptual: logit masking against a grammar FSM
def masked_sample(logits, fsm_state, grammar):
allowed = grammar.allowed_token_ids(fsm_state)
mask = full_like(logits, NEG_INF)
mask[allowed] = 0.0
return sample(logits + mask)提供方原生结构化输出
现代 API 提供带有严格 JSON 模式的 response_format。提供方保证响应符合该模式,因此您无需编写防御性代码即可进行反序列化。
client.chat.completions.create(
model='gpt-4o',
messages=[{'role': 'user', 'content': 'Extract the invoice fields.'}],
response_format={
'type': 'json_schema',
'json_schema': {
'name': 'invoice',
'strict': True,
'schema': {
'type': 'object',
'properties': {
'total': {'type': 'number'},
'currency': {'type': 'string'}
},
'required': ['total', 'currency'],
'additionalProperties': False
}
}
}
)可靠性即契约
请将模式视为模型与您的系统之间的应用程序接口契约。它就像类型化函数签名一样,能够记录意图,并提供类似编译时的保证。
这会将 LLM 输出从代码必须解释的建议,转变为代码可以信任的类型化值。
确定性与创造性的权衡
结构约束的是形状,不一定是内容。带有自由文本 summary: string 字段的模式,仍然允许模型在该字段中生成具有创造性的文字。
最佳实践是:严格约束封装结构(字段、类型、枚举),只在指定的字符串字段中保留创造空间。
枚举可以消除整类失败
自由文本分类(sentiment: 'kind of positive')无法解析。枚举会强制从固定集合中选择一个值,从而消除整类规范化错误。
{
'type': 'object',
'properties': {
'sentiment': {
'type': 'string',
'enum': ['positive', 'neutral', 'negative']
}
},
'required': ['sentiment'],
'additionalProperties': False
}可观测性与模式版本管理
结构化输出更容易记录日志、比较差异和监控。您可以计算字段级指标、检测偏移,并在字段缺失时发出警报。
请将模式视为有版本的制品:先将新增字段设为可选,在移除字段前先弃用它,并为每个响应标注生成该响应的模式版本。
何时不应强制结构化 NOT
过度约束可能会降低质量。在推理步骤中强制使用复杂模式,可能会抑制思维链。
- 先让模型使用自由文本进行推理。
- 然后再进行第二次结构化调用,以格式化结论。
将推理与格式化分开,通常优于一次过度约束的调用。
成本与延迟考量
结构化输出通常会降低总成本:重试次数更少,用于铺陈文字的令牌更少,也不需要单独的解析服务。不过,严格模式可能会增加少量服务器端开销,并且可能拒绝第一次尝试,因此请始终配合修复策略使用(后文会介绍)。
快速检查
哪种技术能让格式错误的 JSON 在结构上不可能产生,而不只是受到劝阻?
回顾
现在您已经了解结构化输出为何重要:
- 它用类型化契约替代脆弱的解析。
- 约束方式涵盖从软提示到受约束解码的不同层级。
- 枚举和严格的封装结构可以消除整类错误。
- 结构化有助于可观测性和版本管理。
- 将推理与格式化分开,以避免质量损失。
接下来:如何在提示中使用 JSON 模式准确表达这一契约。
常见问题解答
「结构化输出的意义」课时是免费的吗?
是的 — 「结构化输出的意义」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Prompt Engineering 课程的其余内容,请升级到 CoddyKit PRO。 AI Prompt Engineering 课程共包含 4 节课。
「结构化输出的意义」这节课中我会学到什么?
可靠且机器可读的结果。 你通过在浏览器中直接运行的动手代码来练习 AI Prompt Engineering,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 AI Prompt Engineering 需要有经验吗?
无需任何先前经验。CoddyKit 上的 AI Prompt Engineering 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 1 节课,共 4 节。
「结构化输出的意义」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 AI Prompt Engineering 课中编写并运行代码吗?
能。每节 AI Prompt Engineering 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- 结构化输出的意义
- 提示中的 JSON Schema
- 工具与函数模式
- 修复与验证循环