配置自动扩缩容和并发
调整实例数量以匹配传入流量
配置自动扩缩容和并发 是 CoddyKit 上的免费 MLOps Academy 课时。 这是第 3 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 MLOps Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 MLOps Academy 课程共包含 4 节课。
让容量匹配需求
自动扩缩容会在流量上升时增加容器实例,在流量下降时移除实例。这样,您可以应对流量峰值,而不必为闲置机器付费。📈
每个实例的并发数
并发数表示一个实例同时处理的请求数量。它决定平台何时增加实例。
扩缩容计算
平台会用传入负载除以您的并发数,以确定所需的实例规模。对于相同的流量,并发数越低,所需实例越多。
设置最大并发数
在 Cloud Run 中,您可以通过 --concurrency 限制每个实例处理的请求数。请根据模型在不降低速度的情况下能够处理的调用数进行调整。
gcloud run deploy model-api --concurrency 8大型模型适合较低数值
如果每次预测都非常耗用 CPU,较高的并发数会使每个请求都得不到足够资源。请将其设为较低的值,让平台把负载分散到更多实例上。
限制最大值
流量激增可能会生成无穷多实例,并产生巨额账单。最大实例数上限可以保护您的预算和下游数据库。
gcloud run deploy model-api --max-instances 20缩容到零可节省费用
将最小实例数设为零后,平台会在空闲时移除所有容器。这样请求之间无需付费,但代价是会出现冷启动。
合理配置 CPU 和内存
每个实例都会获得您请求的 CPU 和内存。大型模型需要足够的内存才能加载,否则容器会在启动时崩溃。
gcloud run deploy model-api --memory 2Gi --cpu 2关注请求队列
当所有实例都达到并发上限时,新请求会在队列中等待。队列等待时间不断增加,说明您需要更快地扩展实例。
通过负载测试找到最佳点
请通过测量而不是猜测来选择设置。对不断增长的流量进行负载测试并观察延迟,以找到能够满足您的 SLA 的并发数。
两个调节项,一个目标
并发数和实例限制共同作用,在延迟与成本之间取得平衡。请同时调整二者,在不过度支出的情况下快速为用户提供服务。
快速检查
让我们检查一下并发数究竟控制什么。
回顾
您调整了并发数,限制了最大实例数,合理配置了资源,并进行了负载测试。现在,您的服务会根据需求和预算进行扩缩容。⚖️
用 AI 导师学习 Python — 免费
在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。
- 课程
- 30
- 课程
- 120
常见问题解答
「配置自动扩缩容和并发」课时是免费的吗?
是的 — 「配置自动扩缩容和并发」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 MLOps Academy 课程的其余内容,请升级到 CoddyKit PRO。 MLOps Academy 课程共包含 4 节课。
「配置自动扩缩容和并发」这节课中我会学到什么?
调整实例数量以匹配传入流量 你通过在浏览器中直接运行的动手代码来练习 MLOps Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。
学习 MLOps Academy 需要有经验吗?
无需任何先前经验。CoddyKit 上的 MLOps Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 3 节课,共 4 节。
「配置自动扩缩容和并发」课时需要多长时间?
大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。
我能在这节 MLOps Academy 课中编写并运行代码吗?
能。每节 MLOps Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。
此课程中的所有课时
- 将镜像推送到注册表
- 部署到无服务器容器运行时
- 配置自动扩缩容和并发
- 在云端管理密钥和配置