MLOps Academy · Lección

Perfíle y ajuste la latencia de inferencia

Use perf_analyzer para encontrar el punto óptimo.

Lección 4 de 413 pasos

Perfíle y ajuste la latencia de inferencia es una lección gratuita de MLOps Academy en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de MLOps Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de MLOps Academy incluye 4 lecciones en total.

Ajustar mediante mediciones

No puede ajustar lo que no mide. Antes de cambiar la configuración, recopile cifras reales de latencia y throughput con una carga fiable. 📏

Conozca perf_analyzer

Triton incluye perf_analyzer, una herramienta que bombardea su modelo con solicitudes e informa de la latencia y el throughput para que pueda comparar configuraciones.

Ejecutar una prueba básica

Indica un modelo a perf_analyzer y este envía solicitudes sintéticas; después muestra las inferencias por segundo y el desglose de la latencia.

perf_analyzer -m my_model

Variar la concurrencia

El indicador más útil varía la concurrencia, es decir, el número de solicitudes en curso. Muestra cómo cambian el throughput y la latencia al aumentar la carga.

perf_analyzer -m my_model --concurrency-range 1:8

Leer la curva

A medida que aumenta la concurrencia, el throughput crece y después se aplana, mientras la latencia sigue aumentando. El punto de inflexión de esa curva es su punto de operación práctico.

Usar percentiles

Los promedios ocultan los problemas. Observe la latencia p95, el valor que supera el 95 por ciento de las solicitudes, porque la latencia de cola es lo que realmente perciben los usuarios.

Ajustar el retraso de la cola

Si la latencia es demasiado alta, reduzca max_queue_delay_microseconds. Si el throughput es demasiado bajo con mucha carga, auméntelo para formar batches más completos.

Ajustar las instancias

Si la GPU está infrautilizada, añada una instance. Si la memoria es escasa o el throughput se estanca, elimine una. Cambie un solo parámetro cada vez y vuelva a medir.

Cambiar una sola cosa

El ajuste es un ciclo, no un salto. Modifique un único parámetro individual, vuelva a ejecutar perf_analyzer, compare y conserve el cambio solo si las cifras mejoran realmente.

Establecer un presupuesto de latencia

Decida primero su presupuesto, por ejemplo, p95 por debajo de 50 ms. Después, aumente el tamaño de los batches y las instancias tanto como pueda sin superar ese límite.

Tener en cuenta todo el recorrido

Las cifras del servidor no cuentan toda la historia. Los saltos de red y el código del cliente añaden tiempo, así que mida también la latencia de extremo a extremo desde la ubicación del usuario.

Comprobación rápida

¿Por qué se prefiere la latencia p95 a la latencia media al ajustar el sistema?

Resumen

Ha utilizado perf_analyzer para variar la concurrencia, ha leído la curva de throughput y latencia en p95 y ha ajustado el retraso de la cola y las instancias dentro de un presupuesto, cambiando una sola cosa cada vez. 🙌

Gratis para empezar

Aprende Python con un tutor de IA — gratis

Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.

Cursos
30
Lecciones
120

Preguntas frecuentes

¿La lección «Perfíle y ajuste la latencia de inferencia» es gratis?

Sí — el texto completo de «Perfíle y ajuste la latencia de inferencia» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de MLOps Academy, actualiza a CoddyKit PRO. El curso de MLOps Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Perfíle y ajuste la latencia de inferencia»?

Use perf_analyzer para encontrar el punto óptimo. Practicas MLOps Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar MLOps Academy?

No se requiere experiencia previa. MLOps Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.

¿Cuánto tiempo toma la lección «Perfíle y ajuste la latencia de inferencia»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de MLOps Academy?

Sí. Cada lección de MLOps Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Por qué las GPU necesitan batching
  2. Configure el batching dinámico en Triton
  3. Ejecute varias instancias del modelo por GPU
  4. Perfíle y ajuste la latencia de inferencia
← Volver a MLOps Academy