Por qué la exactitud engaña con datos desequilibrados
La trampa de la clase minoritaria.
Por qué la exactitud engaña con datos desequilibrados es una lección gratuita de Data Science Academy en CoddyKit. Esta es la lección 1 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Data Science Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Data Science Academy incluye 4 lecciones en total.
La mentira reconfortante
La exactitud parece la métrica obvia: cuántas predicciones acertó. Con datos equilibrados funciona bien, pero el desequilibrio la rompe silenciosamente.
Qué significa el desequilibrio
Un conjunto de datos está desequilibrado cuando una clase es mucho menos frecuente que las demás. Piense en fraude, enfermedades o abandono: el evento interesante es el menos frecuente.
La trampa del 99 %
Imagine 99 transacciones normales por cada fraude. Un modelo que siempre grita «normal» obtiene una magnífica exactitud del 99 %. ⚠️
Y no detectó nada
Ese modelo del 99 % nunca marcó un solo fraude. El número parece excelente, pero el modelo es inútil para el trabajo exacto para el que lo contrató.
La exactitud oculta la clase minoritaria
La exactitud promedia todas las filas, por lo que la enorme mayoría ahoga a la diminuta minoría. La clase minoritaria puede ser un fracaso total y apenas afectar a la puntuación.
La línea base que debe superar
Compare siempre con la línea base de la clase mayoritaria: prediga simplemente la etiqueta más común. Si su modelo no puede superarla, no ha aprendido nada útil.
Una comprobación rápida de la realidad
Antes de celebrarlo, pregúntese una cosa: ¿qué proporción de las filas pertenece a la clase mayoritaria? Ese número es la exactitud que un modelo perezoso obtiene gratis.
Compruébelo con value_counts
Una sola línea revela hasta qué punto sus etiquetas están desequilibradas. Si un valor eclipsa a los demás, la exactitud por sí sola le llevará a conclusiones erróneas.
counts = y.value_counts(normalize=True)
print(counts) # share of each classDónde está realmente el coste
No detectar la clase minoritaria suele ser lo más perjudicial: un tumor o un fraude no detectados resultan costosos. La exactitud trata todos los errores como iguales, pero la realidad no.
Mire más allá de un solo número
La solución todavía no es una métrica mágica, sino una forma de pensar. Deje de confiar en un único número y empiece a preguntarse cómo le fue realmente a la clase minoritaria.
Prepárese para mejores métricas
Pronto conocerá la precisión, la exhaustividad y las curvas PR, diseñadas para eventos poco frecuentes. Primero, asimile por qué aquí la exactitud se ganó su desconfianza.
Comprobación rápida
¿Por qué puede inducir a error la exactitud con datos desequilibrados?
Repaso
Con datos desequilibrados, la exactitud favorece a los modelos perezosos que ignoran la clase minoritaria. Supere la línea base mayoritaria y evalúe cómo le fue realmente a la clase minoritaria. 🎯
Aprende Python con un tutor de IA — gratis
Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.
- Cursos
- 30
- Lecciones
- 120
Preguntas frecuentes
¿La lección «Por qué la exactitud engaña con datos desequilibrados» es gratis?
Sí — el texto completo de «Por qué la exactitud engaña con datos desequilibrados» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Data Science Academy, actualiza a CoddyKit PRO. El curso de Data Science Academy incluye 4 lecciones en total.
¿Qué aprenderé en «Por qué la exactitud engaña con datos desequilibrados»?
La trampa de la clase minoritaria. Practicas Data Science Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar Data Science Academy?
No se requiere experiencia previa. Data Science Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 1 de 4.
¿Cuánto tiempo toma la lección «Por qué la exactitud engaña con datos desequilibrados»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de Data Science Academy?
Sí. Cada lección de Data Science Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Por qué la exactitud engaña con datos desequilibrados
- Remuestreo: SMOTE y submuestreo
- Pesos de clase y umbrales
- Elegir métricas para eventos poco frecuentes