评估调优模型与基础模型
在您的评估集上将模型与基础模型进行 A/B 对比——微调有时弊大于利。
评估调优模型与基础模型 是 CoddyKit 上的免费 AI Agents 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 AI Agents 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 AI Agents 课程共包含 4 节课。
本课时的部分内容尚未翻译,以英文显示。
不要相信训练损失
较低的训练损失并不意味着生产环境中的效果更好。模型可能过拟合、丧失通用能力,或损害未见过的任务。
请始终在留出的评估集上评估调优后的模型。
评估必须具备的三个划分
- 训练集——用于微调
- 验证集——用于选择最佳检查点
- 测试集——训练期间从未见过;ONLY 用于最终评估
A/B Against Base
results_base = run_eval(base_model, eval_set)
results_tuned = run_eval(tuned_model, eval_set)
print(f'Base: {results_base.score}')
print(f'Tuned: {results_tuned.score}')
print(f'Delta: {results_tuned.score - results_base.score:+.2f}')警惕灾难性遗忘
使用狭窄的数据进行微调,可能会让模型在 OTHER 任务上的表现变差。还要在广泛的评估集上测试,而不只是测试新的专业能力。
按类别报告
为评估集添加标签;按类别报告得分:
Category 'extraction': base 0.78 -> tuned 0.91 (+0.13)
Category 'reasoning': base 0.85 -> tuned 0.78 (-0.07) <-- regression
Category 'chat': base 0.82 -> tuned 0.83 (+0.01)校准
调优后的模型通常会变得过度自信。比较预测的正确概率与实际正确概率——必要时进行校准。
长度和风格漂移
调优后的模型会向训练分布漂移。如果训练数据更短,输出也会变短。有时这是理想结果,有时则不是。
真实环境中的 A/B 测试
除了离线评估,还要在生产环境中进行 A/B 测试:
if user.bucket == 'tuned':
response = tuned_model.run(...)
else:
response = base_model.run(...)
log_metric('thumbs_up', response.feedback)比较质量与成本
调优后的模型可能更小、更便宜。总成本与质量如下:
- 基础 GPT-4o:每次调用 X 美元,质量为 Y
- 调优后的 Llama 8B(自行托管):每次调用成本为 X/10 美元,质量为 0.9Y
- 只要 Y 保持足够高,就很可能胜出
隐藏的失败模式
尝试对抗性输入:
- 试图绕过安全防护的提示
- 分布外输入
- 边缘情况提示
有时微调会削弱安全性;发布前请进行验证。
LLM 作为评判者的注意事项
如果使用 LLM 评判者,请使用与调优模型 DIFFERENT 的模型系列。否则评判者会带有偏见地给出过高分数。
何时迭代数据集
如果评估显示某些特定类别出现回归:
- 在生产环境轨迹中找到相似示例
- 将它们添加到训练集
- 重新训练
- 重新评估
回滚没问题
如果调优结果不佳,就放弃它并重新尝试。沉没成本不是发布更差模型的理由。
灾难性遗忘
微调中的灾难性遗忘是什么?
回顾
在 YOUR 黄金数据集上将调优后的模型与基础模型进行评估。关注各类别的回归。在生产环境中进行 A/B 测试。如果模型表现下降就回滚;如果只在部分方面胜出,就迭代数据集。
常见问题解答
「评估调优模型与基础模型」课时是免费的吗?
是的 — 「评估调优模型与基础模型」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 AI Agents 课程的其余内容,请升级到 CoddyKit PRO。 AI Agents 课程共包含 4 节课。
「评估调优模型与基础模型」这节课中我会学到什么?
在您的评估集上将模型与基础模型进行 A/B 对比——微调有时弊大于利。 你通过在浏览器中直接运行的动手代码来练习 AI Agents,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 AI Agents 需要有经验吗?
无需任何先前经验。CoddyKit 上的 AI Agents 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。
「评估调优模型与基础模型」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 AI Agents 课中编写并运行代码吗?
能。每节 AI Agents 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- 何时微调优于提示
- 数据收集:轨迹与跟踪回放
- 使用 LoRA 和 QLoRA 进行高性价比调优
- 评估调优模型与基础模型