Perfíle y ajuste la latencia de inferencia
Use perf_analyzer para encontrar el punto óptimo.
Perfíle y ajuste la latencia de inferencia es una lección gratuita de MLOps Academy en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de MLOps Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de MLOps Academy incluye 4 lecciones en total.
Ajustar mediante mediciones
No puede ajustar lo que no mide. Antes de cambiar la configuración, recopile cifras reales de latencia y throughput con una carga fiable. 📏
Conozca perf_analyzer
Triton incluye perf_analyzer, una herramienta que bombardea su modelo con solicitudes e informa de la latencia y el throughput para que pueda comparar configuraciones.
Ejecutar una prueba básica
Indica un modelo a perf_analyzer y este envía solicitudes sintéticas; después muestra las inferencias por segundo y el desglose de la latencia.
perf_analyzer -m my_modelVariar la concurrencia
El indicador más útil varía la concurrencia, es decir, el número de solicitudes en curso. Muestra cómo cambian el throughput y la latencia al aumentar la carga.
perf_analyzer -m my_model --concurrency-range 1:8Leer la curva
A medida que aumenta la concurrencia, el throughput crece y después se aplana, mientras la latencia sigue aumentando. El punto de inflexión de esa curva es su punto de operación práctico.
Usar percentiles
Los promedios ocultan los problemas. Observe la latencia p95, el valor que supera el 95 por ciento de las solicitudes, porque la latencia de cola es lo que realmente perciben los usuarios.
Ajustar el retraso de la cola
Si la latencia es demasiado alta, reduzca max_queue_delay_microseconds. Si el throughput es demasiado bajo con mucha carga, auméntelo para formar batches más completos.
Ajustar las instancias
Si la GPU está infrautilizada, añada una instance. Si la memoria es escasa o el throughput se estanca, elimine una. Cambie un solo parámetro cada vez y vuelva a medir.
Cambiar una sola cosa
El ajuste es un ciclo, no un salto. Modifique un único parámetro individual, vuelva a ejecutar perf_analyzer, compare y conserve el cambio solo si las cifras mejoran realmente.
Establecer un presupuesto de latencia
Decida primero su presupuesto, por ejemplo, p95 por debajo de 50 ms. Después, aumente el tamaño de los batches y las instancias tanto como pueda sin superar ese límite.
Tener en cuenta todo el recorrido
Las cifras del servidor no cuentan toda la historia. Los saltos de red y el código del cliente añaden tiempo, así que mida también la latencia de extremo a extremo desde la ubicación del usuario.
Comprobación rápida
¿Por qué se prefiere la latencia p95 a la latencia media al ajustar el sistema?
Resumen
Ha utilizado perf_analyzer para variar la concurrencia, ha leído la curva de throughput y latencia en p95 y ha ajustado el retraso de la cola y las instancias dentro de un presupuesto, cambiando una sola cosa cada vez. 🙌
Aprende Python con un tutor de IA — gratis
Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.
- Cursos
- 30
- Lecciones
- 120
Preguntas frecuentes
¿La lección «Perfíle y ajuste la latencia de inferencia» es gratis?
Sí — el texto completo de «Perfíle y ajuste la latencia de inferencia» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de MLOps Academy, actualiza a CoddyKit PRO. El curso de MLOps Academy incluye 4 lecciones en total.
¿Qué aprenderé en «Perfíle y ajuste la latencia de inferencia»?
Use perf_analyzer para encontrar el punto óptimo. Practicas MLOps Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar MLOps Academy?
No se requiere experiencia previa. MLOps Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.
¿Cuánto tiempo toma la lección «Perfíle y ajuste la latencia de inferencia»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de MLOps Academy?
Sí. Cada lección de MLOps Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Por qué las GPU necesitan batching
- Configure el batching dinámico en Triton
- Ejecute varias instancias del modelo por GPU
- Perfíle y ajuste la latencia de inferencia