0Pricing
AI Prompt Engineering · 课时

阅读和评估人工智能输出

判断人工智能响应的相关性、准确性和完整性的标准。

阅读和评估人工智能输出 是 CoddyKit 上的免费 AI Prompt Engineering 课时。 这是第 1 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Prompt Engineering 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Prompt Engineering 课程共包含 4 节课。

为什么评估很重要

获得人工智能响应只是工作的一半,另一半是判断该响应是否真正优秀。

如果没有清晰的评估框架,您可能会接受一份看似 polished 却回答了错误问题的响应,也可能因为响应没有按照您预期的格式呈现,而拒绝一份确实有用的响应。

培养可靠地判断人工智能输出质量的能力,是提示词工程中最实用的技能之一。

四项评估标准

阅读人工智能响应时,请从四个维度进行判断:

  • 相关性——它是否回答了您实际提出的问题?
  • 准确性——信息在事实层面是否正确?
  • 完整性——它是否涵盖了请求的所有部分?
  • 格式——它是否按照您需要的方式组织?

一份响应可能在三项标准上得分很高,却在第四项上失败。每项标准都独立重要。

标准 1:相关性

相关性要问的是:模型回答的是您实际提出的问题,还是回答了一个相关但不同的问题?

例如:您问“使用 LLM 会给医疗保健带来哪些风险?”,模型却回答了 LLM 的工作原理概述。这份响应可能是准确的,但并不相关——它没有抓住重点。

要检查相关性,请重新阅读您最初的提示词,并问自己:响应是否直接回答了我的问题?

标准 2:准确性

准确性要问的是:响应中的事实、数据和断言是否正确?

人工智能模型可能产生幻觉——它们可能会自信地陈述一些完全错误的内容。常见的准确性问题包括:

  • 错误的统计数据或日期
  • 引用归属错误
  • 将过时信息当作当前信息呈现
  • 虚构的参考资料或引文

对于事实性主题,在使用输出之前,请务必通过可信来源核实关键断言。

标准 3:完整性

完整性要问的是:响应是否涵盖了您请求中的所有部分?

如果您的提示词包含多个部分——“解释 X、列出三个示例,并建议下一步”——请检查模型是否回答了全部三部分,而不只是第一部分。

模型有时会遗漏多部分请求的最后一部分,尤其是在提示词较长时。将响应与提示词逐点对照阅读,是检查完整性最可靠的方法。

标准 4:格式

格式要问的是:响应是否按照您需要的方式组织?

即使响应完全准确且完整,如果格式不正确,也可能难以使用。常见的格式不匹配包括:

  • 您需要项目符号时却提供了叙述性文字
  • 您需要摘要时却提供了长篇文章
  • 缺少有助于导航的标题
  • 只有代码没有说明,或只有说明没有代码

格式问题通常最容易通过后续提示词修复。

简单的评估清单

收到任何人工智能响应后,请在心中逐项检查:

  • 相关性:它回答了我的实际问题吗?
  • 准确性:我可以相信这些事实吗?我需要核实什么?
  • 完整性:它涵盖了我请求中的所有部分吗?
  • 格式:它的组织方式便于我使用吗?

如果任何标准未通过,您就能明确知道应该编写哪种后续提示词。每项标准都会 points to 一种具体的校正类型。

代码中的评估:为响应评分

您可以在 Python 中构建一个轻量级评估封装,通过第二次 LLM 调用,按照每项标准为响应评分:

import openai

client = openai.OpenAI(api_key='sk-...')

def evaluate_response(original_prompt, response_text):
    eval_prompt = f'''You are an evaluator. Score the following AI response on a scale of 1-5 for each criterion.

Original prompt: {original_prompt}

AI response: {response_text}

Score each:
- Relevance (1-5): Did it answer the actual question?
- Accuracy (1-5): Are the facts correct? (flag any concerns)
- Completeness (1-5): Did it cover all parts of the request?
- Format (1-5): Is it structured appropriately?

Return your scores as: Relevance: X, Accuracy: X, Completeness: X, Format: X
Then a one-sentence note for any score below 4.'''

    result = client.chat.completions.create(
        model='gpt-4o-mini',
        messages=[{'role': 'user', 'content': eval_prompt}]
    )
    return result.choices[0].message.content

相关性问题:常见模式

相关性问题往往遵循一些可预测的模式。识别这些模式可以加快评估速度:

  • 主题偏移——模型一开始回答正确,随后却转向相关主题
  • 偷换问题——模型回答的是您问题的一个更简单或更容易的版本
  • 过度概括——您询问的是具体案例,模型回答的却是一般情况
  • 忽略约束——您指定了上下文(例如“面向初学者”),模型却忽略了它

每种模式都提示您应在后续提示词中采取特定的修正措施。

需要留意的准确性危险信号

即使您无法立即核实某个断言,某些信号也可能表明其准确性较低:

  • 引用了非常具体的数字,却没有提供来源
  • 断言看起来过于顺利或恰好完全切题
  • 提及了有具体标题和作者的研究、论文或书籍
  • 日期和版本号(这些内容经常变化)
  • 法律、医疗或金融方面的具体内容

这些并不能证明存在错误,但在高风险场景中使用输出之前,值得对这些内容进行再次核查。

利用评估编写更好的后续提示词

评估的真正价值在于,每个未通过的标准都能直接对应一种后续提示词类型:

  • 相关性未通过 → “您回答的是 X,但我问的是 Y。请聚焦于 Y。”
  • 对准确性的担忧 → “请再次核查关于 Z 的断言,并说明您的依据。”
  • 完整性未通过 → “您没有回答我问题的第三部分。请补充这一部分。”
  • 格式未通过 → “请将其改写为项目符号列表,并在顶部添加一行摘要。”

评估和后续提示词可以形成反馈循环。

知识检查:评估标准

您向模型提问:“列出排名前 5 的 Python 网页框架,并分别用一句话描述。”模型却给出了一篇关于 Python 历史及其在网页开发领域崛起的通顺文章,只简略提到了 Flask 和 Django,却没有列出 5 个框架。

这份响应最严重地未通过哪项标准?

回顾:阅读和评估人工智能输出

高质量的提示词设计是一个两步过程:编写提示词并评估响应。

四项标准——相关性、准确性、完整性、格式——为您评估任何人工智能输出提供了一套系统方法。每个未通过的标准都会明确告诉您应该编写哪种后续提示词。

在下一课中,您将练习编写这些后续提示词,以修正特定类型的问题。

常见问题解答

「阅读和评估人工智能输出」课时是免费的吗?

是的 — 「阅读和评估人工智能输出」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Prompt Engineering 课程的其余内容,请升级到 CoddyKit PRO。 AI Prompt Engineering 课程共包含 4 节课。

「阅读和评估人工智能输出」这节课中我会学到什么?

判断人工智能响应的相关性、准确性和完整性的标准。 你通过在浏览器中直接运行的动手代码来练习 AI Prompt Engineering,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 AI Prompt Engineering 需要有经验吗?

无需任何先前经验。CoddyKit 上的 AI Prompt Engineering 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 1 节课,共 4 节。

「阅读和评估人工智能输出」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 AI Prompt Engineering 课中编写并运行代码吗?

能。每节 AI Prompt Engineering 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 阅读和评估人工智能输出
  2. 编写有效的后续提示
  3. 基于之前的响应继续操作
  4. 何时优化,何时重新开始
← 返回 AI Prompt Engineering