0Pricing
AI Agents · 课时

LLM 作为评判者的陷阱

评判者倾向于偏爱冗长答案,难以准确评估自身输出,因此需要仔细校准。

LLM 作为评判者的陷阱 是 CoddyKit 上的免费 AI Agents 课时。 这是第 3 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。

本课时的部分内容尚未翻译,以英文显示。

为什么使用 LLM 评审?

对于开放式输出(文章、代码审查、对话式答案),不存在唯一正确的答案。雇用人工为数千条输出评分的成本很高。

LLM 评审——使用强大的模型为输出评分——填补了这一空缺。

Basic LLM Judge

judge_prompt = '''
You are an evaluator. On a scale of 1-5, rate the following answer
for accuracy and helpfulness. Return JSON: {score: int, reason: str}.

Question: {question}
Answer: {answer}
'''

问题 1:位置偏差

评审者在成对比较中偏好 FIRST 个答案。请始终随机化顺序,并运行两次:

def fair_compare(a, b):
    score_ab = compare(a, b)
    score_ba = compare(b, a)   # swapped
    return (score_ab + score_ba) / 2

问题 2:长度偏差

评审者偏好更 LONGER 的答案,即使较短的答案更好。请通过标准化长度或向评审者提供指示来校准:

judge_prompt = '... Penalize answers that are verbose without adding value ...'

问题 3:自我偏好

模型偏好自己的输出。如果由 GPT-4 评审自己的工作,它给自己的评分会高于应有水平。请使用不同的模型系列进行评审:

  • GPT-4 的输出 -> 由 Claude 评审
  • Claude 的输出 -> 由 GPT-4 评审

问题 4:迎合

评审者会认同答案中的强烈观点。“我 100% 确定……”获得的评分高于“我认为……”。评审前请去除表示自信程度的词语。

问题 5:评分膨胀

在 1-5 分的量表上,评审者的评分会集中在 4 分左右。请使用二元评分(正确/错误),以获得更清晰的信号:

judge_prompt = '... Return PASS or FAIL only ...'

问题 6:格式偏差

无论正确与否,项目符号列表形式的答案都比散文形式的答案得分更高。请注意这一点;有时可以强制规定格式来消除这个变量。

与人工评分进行校准

在一个样本上衡量评审者的评分与人工评分的相关程度:

from scipy.stats import pearsonr

human_scores = [...]
llm_scores = [...]
rho, _ = pearsonr(human_scores, llm_scores)
print(f'Correlation: {rho}')
# Below ~0.6 — judge unreliable for this task

尽可能使用成对比较

“A 比 B 好吗?”比“给 A 打 1-5 分”更可靠。在两个提示词之间进行选择时,成对比较优于绝对评分。

思维链评审

先让评审者进行推理:

judge_prompt = '''
First list the factual claims in the answer.
Then check each against the reference.
Then produce a score.

Question: {q}
Reference: {r}
Answer: {a}
'''

成本

使用 GPT-4 进行评审会使评测成本翻倍。对于例行检查,请使用更便宜的评审者(gpt-4o-mini 或 claude-haiku),并将大型评审模型留给版本发布。

结合规则

不要只依赖评审者。请结合使用:

  • 规则(“包含‘30 天’”)
  • 启发式方法(长度范围)
  • LLM 评审开放式部分

校准 LLM 评审者

如何检查您的 LLM 评审者是否可靠?

回顾

LLM 评审者很有用,但存在偏差。随机化位置,标准化长度,使用不同的模型系列,与人工评分进行校准,并结合硬性规则。

常见问题解答

「LLM 作为评判者的陷阱」课时是免费的吗?

是的 — 「LLM 作为评判者的陷阱」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。

「LLM 作为评判者的陷阱」这节课中我会学到什么?

评判者倾向于偏爱冗长答案,难以准确评估自身输出,因此需要仔细校准。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 AI Agents 需要有经验吗?

无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 3 节课,共 4 节。

「LLM 作为评判者的陷阱」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 AI Agents 课中编写并运行代码吗?

能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 面向评估的智能体开发
  2. 构建黄金测试集
  3. LLM 作为评判者的陷阱
  4. 基准测试套件:SWE-Bench、GAIA、ToolBench
← 返回 AI Agents