金丝雀发布:先部署给少量用户
将少量流量转移到新模型
金丝雀发布:先部署给少量用户 是 CoddyKit 上的免费 MLOps Academy 课时。 这是第 1 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 MLOps Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 MLOps Academy 课程共包含 4 节课。
什么是金丝雀发布
金丝雀发布会先将新模型发送给一小部分真实流量,因此您可以在观察期间将任何问题的影响控制在很小范围内。🐤
为什么不直接面向所有用户发布
一次性将全部流量切换到新模型,属于大爆炸式部署:如果模型有问题,每个用户都会立即受到影响。
有意从小规模开始
金丝雀发布通常从5% 的流量开始。这足以收集真实反馈,同时又足够小,即使模型有问题,对用户的影响也很有限。
主模型与挑战模型
稳定的模型是主模型;金丝雀模型则是挑战模型。两者会同时在线运行,这样您就能使用相同的真实请求进行比较。
扩大范围前先观察
金丝雀模型处理分配给它的流量时,您需要并排对比主模型,监控错误率、延迟和关键业务指标。
分阶段逐步增加
如果金丝雀模型运行正常,就分阶段提升其流量比例,例如 5%、25%、50%,最后达到 100%,并在每个阶段暂停检查。
拆分流量
路由器或代理会决定每个请求访问哪个模型。通过这种简单的拆分,每 20 次调用中会有 1 次发送到金丝雀版本。
import random
def route(request, canary_pct=5):
if random.uniform(0, 100) < canary_pct:
return canary_model.predict(request)
return champion_model.predict(request)标记由哪个模型提供服务
记录每个请求由哪个模型处理。如果每次预测都没有版本标签,之后您就无法判断各项指标分别属于哪个模型。
log.info("prediction", extra={
"model_version": "v2-canary",
"latency_ms": latency,
})保持各流量切片可比较
根据用户 ID 的稳定哈希值进行路由,让同一个人始终使用同一个模型。按请求随机拆分会使公平比较更加困难。
快速退出
关键在于快速退出。如果金丝雀模型出现异常,就将其流量降回 0%,用户甚至不会察觉发生过任何问题。
金丝雀发布与蓝绿发布
蓝绿发布会保留两个完整环境,并在两者之间切换。金丝雀发布则逐步导入流量,让您拥有更精细的控制和更早的预警。
快速检查
让我们检查一下金丝雀发布背后的核心理念。
回顾
金丝雀发布会先将新模型发送给一小部分流量,与主模型进行比较;只有运行正常才会逐步扩大范围,否则就立即回滚。✅
用 AI 导师学习 Python — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 30
- 课程
- 120
常见问题解答
「金丝雀发布:先部署给少量用户」课时是免费的吗?
是的 — 「金丝雀发布:先部署给少量用户」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 MLOps Academy 课程的其余内容,请升级到 CoddyKit PRO。 MLOps Academy 课程共包含 4 节课。
「金丝雀发布:先部署给少量用户」这节课中我会学到什么?
将少量流量转移到新模型 你通过在浏览器中直接运行的动手代码来练习 MLOps Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 MLOps Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 MLOps Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 1 节课,共 4 节。
「金丝雀发布:先部署给少量用户」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 MLOps Academy 课中编写并运行代码吗?
能。每节 MLOps Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- 金丝雀发布:先部署给少量用户
- 在不影响用户的情况下进行影子流量测试
- 定义自动回滚标准
- 使用 Argo Rollouts 渐进式交付