0Pricing
MLOps Academy · Lección

Ejecute varias instancias del modelo por GPU

Use la ejecución simultánea para aumentar la utilización.

Ejecute varias instancias del modelo por GPU es una lección gratuita de MLOps Academy en CoddyKit. Esta es la lección 3 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de MLOps Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de MLOps Academy incluye 4 lecciones en total.

Una copia puede bloquearse

Con una sola copia del modelo, la solicitud dos debe esperar mientras se ejecuta la solicitud uno. Incluso una GPU rápida puede quedar inactiva entre llamadas, lo que reduce el throughput.

Ejecutar varias copias

Triton puede cargar varias instancias del mismo modelo para que varias solicitudes se ejecuten simultáneamente y solapen su trabajo en la GPU.

El bloque instance_group

Las copias se declaran con un instance_group en config.pbtxt. El campo count indica cuántas instancias debe crear Triton para ese modelo.

instance_group {
  count: 2
  kind: KIND_GPU
}

Elegir GPU o CPU

El campo kind elige el dispositivo. KIND_GPU ejecuta las instancias en la GPU, mientras que KIND_CPU las ejecuta en el procesador del host.

Colocarlas en las GPU

Puede asignar instancias a tarjetas concretas mediante una lista de gpus. Esto permite distribuir las copias de un modelo entre varias GPU del mismo servidor.

instance_group {
  count: 2
  kind: KIND_GPU
  gpus: [ 0, 1 ]
}

Por qué ayuda

Mientras una instancia realiza cálculos, otra puede cargar entradas o copiar resultados. Esta superposición oculta los intervalos de inactividad y aumenta la utilización general.

Se combina con el batching

Las instancias y el batching dinámico funcionan conjuntamente. El batching llena cada llamada, mientras que varias instancias mantienen más de una llamada en curso a la vez.

Vigilar la memoria

Cada instancia mantiene su propia copia de los pesos en la memoria de la GPU. Si hay demasiadas copias, se queda sin VRAM; por eso, aumente el número gradualmente.

Más no siempre es más rápido

A partir de cierto punto, las instancias adicionales simplemente compiten por la misma capacidad de cómputo. El throughput se estanca o disminuye, así que el número óptimo se obtiene midiendo, no adivinando.

Tener en cuenta la concurrencia

El número adecuado de instancias depende de cuántas solicitudes llegan a la vez. Ajuste las instancias a su concurrencia real para evitar tanto bloqueos como desperdicio.

Un punto de partida razonable

Dos instancias por GPU es un punto de partida habitual. Pruebe con una carga realista y ajuste después el número al alza o a la baja según lo que observe.

Comprobación rápida

¿Qué ocurre al establecer count en 2 dentro de un instance_group?

Resumen

Ha aprendido a ejecutar varias copias del modelo mediante instance_group, combinando las instancias con el batching para obtener paralelismo, mientras vigila la VRAM y ajusta el número mediante mediciones. 🙌

Preguntas frecuentes

¿La lección «Ejecute varias instancias del modelo por GPU» es gratis?

Sí — el texto completo de «Ejecute varias instancias del modelo por GPU» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de MLOps Academy, actualiza a CoddyKit PRO. El curso de MLOps Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Ejecute varias instancias del modelo por GPU»?

Use la ejecución simultánea para aumentar la utilización. Practicas MLOps Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar MLOps Academy?

No se requiere experiencia previa. MLOps Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 3 de 4.

¿Cuánto tiempo toma la lección «Ejecute varias instancias del modelo por GPU»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de MLOps Academy?

Sí. Cada lección de MLOps Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Por qué las GPU necesitan batching
  2. Configure el batching dinámico en Triton
  3. Ejecute varias instancias del modelo por GPU
  4. Perfíle y ajuste la latencia de inferencia
← Volver a MLOps Academy