MLOps Academy · 课时

配置自动扩缩容和并发

调整实例数量以匹配传入流量

第 3 / 4 课13 个步骤

配置自动扩缩容和并发 是 CoddyKit 上的免费 MLOps Academy 课时。 这是第 3 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 MLOps Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 MLOps Academy 课程共包含 4 节课。

让容量匹配需求

自动扩缩容会在流量上升时增加容器实例,在流量下降时移除实例。这样,您可以应对流量峰值,而不必为闲置机器付费。📈

每个实例的并发数

并发数表示一个实例同时处理的请求数量。它决定平台何时增加实例。

扩缩容计算

平台会用传入负载除以您的并发数,以确定所需的实例规模。对于相同的流量,并发数越低,所需实例越多。

设置最大并发数

在 Cloud Run 中,您可以通过 --concurrency 限制每个实例处理的请求数。请根据模型在不降低速度的情况下能够处理的调用数进行调整。

gcloud run deploy model-api --concurrency 8

大型模型适合较低数值

如果每次预测都非常耗用 CPU,较高的并发数会使每个请求都得不到足够资源。请将其设为较低的值,让平台把负载分散到更多实例上。

限制最大值

流量激增可能会生成无穷多实例,并产生巨额账单。最大实例数上限可以保护您的预算和下游数据库。

gcloud run deploy model-api --max-instances 20

缩容到零可节省费用

将最小实例数设为零后,平台会在空闲时移除所有容器。这样请求之间无需付费,但代价是会出现冷启动。

合理配置 CPU 和内存

每个实例都会获得您请求的 CPU 和内存。大型模型需要足够的内存才能加载,否则容器会在启动时崩溃。

gcloud run deploy model-api --memory 2Gi --cpu 2

关注请求队列

当所有实例都达到并发上限时,新请求会在队列中等待。队列等待时间不断增加,说明您需要更快地扩展实例。

通过负载测试找到最佳点

请通过测量而不是猜测来选择设置。对不断增长的流量进行负载测试并观察延迟,以找到能够满足您的 SLA 的并发数。

两个调节项,一个目标

并发数和实例限制共同作用,在延迟与成本之间取得平衡。请同时调整二者,在不过度支出的情况下快速为用户提供服务。

快速检查

让我们检查一下并发数究竟控制什么。

回顾

您调整了并发数,限制了最大实例数,合理配置了资源,并进行了负载测试。现在,您的服务会根据需求和预算进行扩缩容。⚖️

免费开始

用 AI 导师学习 Python — 免费

在浏览器中编写并运行真实代码,获得全天候 AI 导师的即时帮助,并在网页或应用中继续学习。

课程
30
课程
120

常见问题解答

「配置自动扩缩容和并发」课时是免费的吗?

是的 — 「配置自动扩缩容和并发」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 MLOps Academy 课程的其余内容,请升级到 CoddyKit PRO。 MLOps Academy 课程共包含 4 节课。

「配置自动扩缩容和并发」这节课中我会学到什么?

调整实例数量以匹配传入流量 你通过在浏览器中直接运行的动手代码来练习 MLOps Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 MLOps Academy 需要有经验吗?

无需任何先前经验。CoddyKit 上的 MLOps Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 3 节课,共 4 节。

「配置自动扩缩容和并发」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 MLOps Academy 课中编写并运行代码吗?

能。每节 MLOps Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 将镜像推送到注册表
  2. 部署到无服务器容器运行时
  3. 配置自动扩缩容和并发
  4. 在云端管理密钥和配置
← 返回 MLOps Academy