0Pricing
AI Prompt Engineering · 课时

跨模态建立依据

在文本中引用视觉证据。

跨模态建立依据 是 CoddyKit 上的免费 AI Prompt Engineering 课时。 这是第 2 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Prompt Engineering 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Prompt Engineering 课程共包含 4 节课。

什么是证据锚定

证据锚定要求每条文本主张都能追溯到另一种模态中的具体证据。没有证据锚定的多模态答案只是流畅的猜测;完成证据锚定的答案则是有依据的断言,并且附带指向能够证明它的像素(或音频帧)的指针。

  • 证据锚定会将不透明的输出转变为可审计的输出。
  • 这是抑制自信的视觉幻觉最有效的单一手段。

证据优先的推理顺序

请强制模型在得出结论之前提取证据。如果先生成结论,“证据”就会变成事后合理化,只是为了匹配那个可能错误的答案。

请按以下顺序组织响应:先列出观察到的区域,再进行解释,最后给出答案。

schema = {
  'observations': '[{region: str, text_read: str}]',
  'inference': 'str — reasoning over observations only',
  'answer': 'str'
}
# Order in the prompt enforces order in generation.

边界框与区域引用

请要求模型为每条视觉主张输出近似的归一化坐标。即使边界框并不完美,也很有价值:下游系统可以据此裁剪并重新 verify,而严重错误的方框会立即暴露幻觉。

  • 使用 0..1 范围内的归一化 [x0,y0,x1,y1],这样就不受分辨率影响。
  • 请将方框视为定位提示,而不是像素级精确检测结果。
instruction = (
  'For each extracted field, return '
  '{"field": str, "value": str, "box": [x0,y0,x1,y1]}. '
  'Coordinates normalized 0..1. If you cannot locate it, omit the field.'
)

逐字引用像素内容进行验证

对于图像中可见的任何文字,请要求模型逐字引用它读到的内容。逐字引用是可检查的:您可以通过 OCR 进行抽查,而且模型必须同时准确转录该值,因此不太可能编造数值。

这种“读回原文”的约束成本很低,但对于文档、图表和标牌尤其有效。

跨模态一致性检查

当同一个事实出现在两种模态中时(例如幻灯片图像及其口头讲解),请提示模型对两者进行交叉检查。一致会提高可信度;不一致本身就是值得呈现的信号。

  • “图表的说明文字是否与图表所显示的内容一致?”
  • “讲解内容是否与屏幕上的数字一致?”
prompt = (
  'You have a slide image and its transcript. '
  'For each numeric claim, state: value_on_slide, value_in_transcript, agree(bool). '
  'Flag any disagreement explicitly.'
)

将拒答作为证据锚定结果

完成证据锚定的系统必须可以回答“不可见”。如果没有明确的退出选项,模型就会用看似合理的编造来填补空白。请提供这个选项,并对模型使用它给予正向反馈。

请指示:“如果证据不存在或无法辨认,请返回 NOT_FOUND,不要猜测。”然后在您的流水线中将 NOT_FOUND 设为一等输出,不因其出现而惩罚模型。

锚定空间关系

关系性主张(“阀门在仪表的左侧”)比对象是否存在更难完成证据锚定。请要求模型分别用方框锚定两个指称对象,然后根据坐标推导关系,而不是直接断言关系。

这种分解会将脆弱的关系判断转变为两个更简单的定位任务,再加上算术运算。

# Derive relation from grounded boxes, not from vibes
# left_of(a, b) := a.x1 < b.x0
def left_of(a, b):
    return a['box'][2] < b['box'][0]

音频与时间证据锚定

证据锚定并不局限于图像。对于音频或视频,请要求提供时间戳作为证据:“请引用这句话出现的 [mm:ss] 时间点。”时间指针让您可以根据源片段抽查该主张。

  • 时间戳可以为转录和说话人分离主张提供锚点。
  • 它们可以暴露偏离实际内容的摘要。

文本覆盖陷阱

文本通道中的自信断言可能会压制正确的视觉证据——模型会服从您提供的先验。如果您的上下文写着“发票总额是 $400”,而图像显示的是 $450,那么没有证据锚定的模型可能会照搬 $400。

防范方法:指示模型先完全根据图像推导结论,然后再与所提供的文本进行比较,并标记不匹配之处,而不是静默地协调两者。

在下游验证证据锚定

只有实际使用证据锚定,它才有价值。请构建一个能够处理结构化证据的验证器:

  • 重新 crop 每个方框,并对引用的文字再次进行 OCR;如果不匹配,则拒绝。
  • 通过第二次 ASR 处理重放所引用的时间戳。
  • 将 NOT_FOUND 和冲突标记视为把任务路由给人工审核的信号。

提示会生成证据;您的系统负责执行验证。

def verify(field):
    crop = image.crop(field['box'])
    read = ocr(crop)
    return similar(read, field['value']) > 0.9

证据锚定契约模板

可复用的证据锚定契约将所有技术组合在一起:

  • 先观察,后下结论。
  • 每条主张都提供方框和逐字引用。
  • 提供 NOT_FOUND 退出选项,绝不猜测。
  • 先根据图像推导,再与所提供的文本协调并标记冲突。
  • 任何音频或视频主张都提供时间戳。

请将其一次性编码,并在每个多模态任务中复用。

快速检查

您的上下文元数据称订单总额为 $400,但您怀疑扫描图像中的金额可能不同。

回顾:跨模态证据锚定

证据锚定让多模态输出变得可审计:先观察后下结论,为每条主张提供方框和逐字引用,为音频或视频提供时间戳,提供 NOT_FOUND 退出选项,并先根据图像推导、同时标记与所提供文本之间的冲突。将证据锚定契约与下游验证器配合使用,重新裁剪、重新读取,并将标记路由给审核人员。提示中提供证据,系统中执行验证——两者结合,就能消除自信的幻觉。

常见问题解答

「跨模态建立依据」课时是免费的吗?

是的 — 「跨模态建立依据」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Prompt Engineering 课程的其余内容,请升级到 CoddyKit PRO。 AI Prompt Engineering 课程共包含 4 节课。

「跨模态建立依据」这节课中我会学到什么?

在文本中引用视觉证据。 你通过在浏览器中直接运行的动手代码来练习 AI Prompt Engineering,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 AI Prompt Engineering 需要有经验吗?

无需任何先前经验。CoddyKit 上的 AI Prompt Engineering 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 2 节课,共 4 节。

「跨模态建立依据」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 AI Prompt Engineering 课中编写并运行代码吗?

能。每节 AI Prompt Engineering 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 结合文本与图像
  2. 跨模态建立依据
  3. 音频、文本与视觉协同
  4. 多模态输出控制
← 返回 AI Prompt Engineering