0Pricing
AI Agents · 课时

评估调优模型与基础模型

在您的评估集上将模型与基础模型进行 A/B 对比——微调有时弊大于利。

评估调优模型与基础模型 是 CoddyKit 上的免费 AI Agents 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。

本课时的部分内容尚未翻译,以英文显示。

不要相信训练损失

较低的训练损失并不意味着生产环境中的效果更好。模型可能过拟合、丧失通用能力,或损害未见过的任务。

请始终在留出的评估集上评估调优后的模型。

评估必须具备的三个划分

  1. 训练集——用于微调
  2. 验证集——用于选择最佳检查点
  3. 测试集——训练期间从未见过;ONLY 用于最终评估

A/B Against Base

results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')

警惕灾难性遗忘

使用狭窄的数据进行微调,可能会让模型在 OTHER 任务上的表现变差。还要在广泛的评估集上测试,而不只是测试新的专业能力。

按类别报告

为评估集添加标签;按类别报告得分:

Category 'extraction': base 0.78 -> tuned 0.91  (+0.13)
Category 'reasoning':  base 0.85 -> tuned 0.78  (-0.07)   <-- regression
Category 'chat':       base 0.82 -> tuned 0.83  (+0.01)

校准

调优后的模型通常会变得过度自信。比较预测的正确概率与实际正确概率——必要时进行校准。

长度和风格漂移

调优后的模型会向训练分布漂移。如果训练数据更短,输出也会变短。有时这是理想结果,有时则不是。

真实环境中的 A/B 测试

除了离线评估,还要在生产环境中进行 A/B 测试:

if user.bucket == 'tuned':
    response = tuned_model.run(...)
else:
    response = base_model.run(...)

log_metric('thumbs_up', response.feedback)

比较质量与成本

调优后的模型可能更小、更便宜。总成本与质量如下:

  • 基础 GPT-4o:每次调用 X 美元,质量为 Y
  • 调优后的 Llama 8B(自行托管):每次调用成本为 X/10 美元,质量为 0.9Y
  • 只要 Y 保持足够高,就很可能胜出

隐藏的失败模式

尝试对抗性输入:

  • 试图绕过安全防护的提示
  • 分布外输入
  • 边缘情况提示

有时微调会削弱安全性;发布前请进行验证。

LLM 作为评判者的注意事项

如果使用 LLM 评判者,请使用与调优模型 DIFFERENT 的模型系列。否则评判者会带有偏见地给出过高分数。

何时迭代数据集

如果评估显示某些特定类别出现回归:

  1. 在生产环境轨迹中找到相似示例
  2. 将它们添加到训练集
  3. 重新训练
  4. 重新评估

回滚没问题

如果调优结果不佳,就放弃它并重新尝试。沉没成本不是发布更差模型的理由。

灾难性遗忘

微调中的灾难性遗忘是什么?

回顾

在 YOUR 黄金数据集上将调优后的模型与基础模型进行评估。关注各类别的回归。在生产环境中进行 A/B 测试。如果模型表现下降就回滚;如果只在部分方面胜出,就迭代数据集。

常见问题解答

「评估调优模型与基础模型」课时是免费的吗?

是的 — 「评估调优模型与基础模型」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。

「评估调优模型与基础模型」这节课中我会学到什么?

在您的评估集上将模型与基础模型进行 A/B 对比——微调有时弊大于利。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 AI Agents 需要有经验吗?

无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。

「评估调优模型与基础模型」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 AI Agents 课中编写并运行代码吗?

能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 何时微调优于提示
  2. 数据收集:轨迹与跟踪回放
  3. 使用 LoRA 和 QLoRA 进行高性价比调优
  4. 评估调优模型与基础模型
← 返回 AI Agents