Observabilidad y supervisión de sistemas de IA
Paneles de rendimiento de modelos, alertas de drift de datos, bucles de feedback y despliegue en shadow mode.
Observabilidad y supervisión de sistemas de IA es una lección gratuita de Learn AI with Python en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Learn AI with Python, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Learn AI with Python incluye 4 lecciones en total.
Por qué monitorizar los sistemas de ML
Un modelo desplegado no está terminado. El tráfico aumenta bruscamente, la latencia se eleva y el mundo cambia, por lo que los datos se alejan de los utilizados durante el entrenamiento. La observabilidad le indica si el sistema funciona correctamente y si el modelo sigue siendo preciso, antes de que los usuarios sufran las consecuencias.
Dos tipos de monitorización
La observabilidad de ML abarca dos capas:
- Operativa: latencia, rendimiento, errores y uso de recursos, como en cualquier servicio
- Del modelo: deriva de datos, distribución de predicciones y precisión a lo largo del tiempo, aspectos específicos de ML
Prometheus para las métricas
Prometheus es el sistema estándar para recopilar métricas de series temporales. Su servicio expone un endpoint de métricas; Prometheus lo consulta periódicamente y almacena los valores para realizar consultas y configurar alertas.
Instrumentación de la latencia
Registra la latencia de inferencia con un histograma de Prometheus. Los histogramas permiten calcular percentiles, la forma adecuada de resumir la latencia, en lugar de utilizar un promedio engañoso.
from prometheus_client import Histogram
INFER_LATENCY = Histogram(
"inference_latency_seconds",
"Model inference latency",
)
@INFER_LATENCY.time()
def predict(x):
return model(x)Latencia P50 y P95
Informe de la latencia mediante percentiles. P50 (la mediana) representa la experiencia habitual; P95 es la cola lenta que supera el 5 % de las solicitudes. Vigilar P95 detecta problemas que un promedio oculta, ya que unas pocas solicitudes lentas siguen perjudicando a los usuarios.
Paneles de Grafana
Grafana visualiza las métricas de Prometheus en paneles en tiempo real. Un panel de modelo suele mostrar en una sola pantalla la tasa de solicitudes, la tasa de errores, la latencia P50/P95 y la distribución de predicciones para comprobar el estado de un vistazo.
¿Qué es la deriva de datos?
La deriva de datos ocurre cuando la distribución de las entradas en producción se aleja de la distribución de entrenamiento. El modelo se ajustó a patrones antiguos, por lo que, a medida que las entradas cambian, su precisión se degrada silenciosamente aunque no haya cambiado ningún código.
Índice de estabilidad poblacional
El índice de estabilidad poblacional (PSI) cuantifica la deriva comparando la distribución actual de una característica con la que tenía durante el entrenamiento. Divide ambas distribuciones en intervalos y suma una razón logarítmica ponderada entre ellos.
# PSI = sum over bins of
# (actual_pct - expected_pct) * ln(actual_pct / expected_pct)Interpretación del PSI
Umbrales convencionales del PSI:
- PSI < 0.1: no hay una deriva significativa
- 0.1 a 0.2: deriva moderada; debe investigarse
- PSI > 0.2: deriva significativa; probablemente sea necesario reentrenar el modelo
Es habitual generar una alerta cuando el PSI supera 0.2.
El ciclo de retroalimentación
La señal de monitorización más valiosa son los resultados reales. Un ciclo de retroalimentación captura las correcciones de los usuarios y las etiquetas de referencia (por ejemplo, si se hizo clic en la recomendación o si la detección de fraude fue correcta) y las incorpora como datos de entrenamiento nuevos.
Cerrar el ciclo mediante el reentrenamiento
La detección de deriva y el ciclo de retroalimentación activan conjuntamente el reentrenamiento: cuando el PSI supera el umbral o la precisión con etiquetas nuevas disminuye, el flujo de trabajo vuelve a entrenar el modelo con datos recientes y lo vuelve a implementar. Así, el modelo se mantiene alineado con un mundo cambiante.
Comprobación rápida
Compruebe sus conocimientos sobre observabilidad.
Repaso
Ha aprendido sobre la observabilidad y la monitorización de sistemas de IA:
- Prometheus recopila métricas; informe de la latencia de inferencia como P50/P95
- Los paneles de Grafana permiten visualizar el estado general de un vistazo
- La deriva de datos se mide con PSI; un PSI > 0.2 indica que se debe reentrenar el modelo
- Un ciclo de retroalimentación convierte las correcciones de los usuarios en datos para el reentrenamiento
Preguntas frecuentes
¿La lección «Observabilidad y supervisión de sistemas de IA» es gratis?
Sí — el texto completo de «Observabilidad y supervisión de sistemas de IA» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Learn AI with Python, actualiza a CoddyKit PRO. El curso de Learn AI with Python incluye 4 lecciones en total.
¿Qué aprenderé en «Observabilidad y supervisión de sistemas de IA»?
Paneles de rendimiento de modelos, alertas de drift de datos, bucles de feedback y despliegue en shadow mode. Practicas Learn AI with Python con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar Learn AI with Python?
No se requiere experiencia previa. Learn AI with Python en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.
¿Cuánto tiempo toma la lección «Observabilidad y supervisión de sistemas de IA»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de Learn AI with Python?
Sí. Cada lección de Learn AI with Python incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Patrones de arquitectura de sistemas de IA
- Pipelines de ML escalables con Airflow
- Almacenes de características: Feast y Tecton
- Observabilidad y supervisión de sistemas de IA