Escale a cero y vuelva a activar
Ahorre costes con autoescalado basado en solicitudes.
Escale a cero y vuelva a activar es una lección gratuita de MLOps Academy en CoddyKit. Esta es la lección 2 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de MLOps Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de MLOps Academy incluye 4 lecciones en total.
Partes de esta lección aún no han sido traducidas y se muestran en inglés.
Idle Models Cost Money
A model pod sitting with no traffic still burns CPU, memory, and cloud bills. KServe can shrink an idle service all the way down. Scale to zero stops that waste. 💸
Powered by Knative
KServe's serverless mode rides on Knative, which watches request volume and adjusts replicas. When traffic stops, it can remove every pod for that service.
Request-Driven Autoscaling
Replicas track demand, not a fixed schedule. As requests rise, KServe adds pods, and as they fade it scales back. This is request-driven autoscaling in action.
Setting minReplicas to Zero
To allow full scale down, you set minReplicas to 0 in the predictor spec. With zero allowed, an idle service drops to no running pods at all.
spec:
predictor:
minReplicas: 0
model:
modelFormat:
name: sklearnThe Concurrency Target
The autoscaler aims for a target number of in-flight requests per pod. This concurrency target decides how aggressively KServe adds replicas under load.
metadata:
annotations:
autoscaling.knative.dev/target: "10"Scaling Back Up
When a request arrives at a zero-scaled service, Knative spins a pod up on demand. Traffic resumes the moment the pod is ready, so the scale up is automatic.
The Cold Start Cost
That first request after zero must wait for the pod to start and load the model. This delay is the cold start, the main trade-off of scaling to zero. ⏱️
When Zero Makes Sense
Scale to zero shines for bursty or rare workloads where idle time dominates. For steady, latency-critical traffic, the cold start penalty may not be worth it.
Keep One Warm Instead
If cold starts hurt, set minReplicas to 1 so one pod always stays alive. You trade a little cost for a guaranteed warm instance ready to serve.
spec:
predictor:
minReplicas: 1Cap the Upper End
You can also bound growth with maxReplicas so a traffic spike never overruns your cluster budget. It puts a ceiling on the autoscaler.
spec:
predictor:
minReplicas: 0
maxReplicas: 5Watch It Scale
You can confirm the behavior by watching pods appear and vanish with traffic. The pod count drops to zero when idle and climbs back when calls come in.
kubectl get pods -l serving.kserve.io/inferenceservice=sklearn-iris -wQuick Check
What is the main downside of letting a service scale to zero?
Recap
You saw how minReplicas: 0 lets KServe scale idle models to zero and back on demand. Cap with maxReplicas, and keep one warm if cold starts hurt. Great progress! 🎉
Preguntas frecuentes
¿La lección «Escale a cero y vuelva a activar» es gratis?
Sí — el texto completo de «Escale a cero y vuelva a activar» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de MLOps Academy, actualiza a CoddyKit PRO. El curso de MLOps Academy incluye 4 lecciones en total.
¿Qué aprenderé en «Escale a cero y vuelva a activar»?
Ahorre costes con autoescalado basado en solicitudes. Practicas MLOps Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar MLOps Academy?
No se requiere experiencia previa. MLOps Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 2 de 4.
¿Cuánto tiempo toma la lección «Escale a cero y vuelva a activar»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de MLOps Academy?
Sí. Cada lección de MLOps Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- El recurso InferenceService
- Escale a cero y vuelva a activar
- Escriba un predictor personalizado
- KServe frente a Seldon Core