Data Science Academy · Lección

Por qué la exactitud engaña con datos desequilibrados

La trampa de la clase minoritaria.

Lección 1 de 413 pasos

Por qué la exactitud engaña con datos desequilibrados es una lección gratuita de Data Science Academy en CoddyKit. Esta es la lección 1 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de Data Science Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de Data Science Academy incluye 4 lecciones en total.

La mentira reconfortante

La exactitud parece la métrica obvia: cuántas predicciones acertó. Con datos equilibrados funciona bien, pero el desequilibrio la rompe silenciosamente.

Qué significa el desequilibrio

Un conjunto de datos está desequilibrado cuando una clase es mucho menos frecuente que las demás. Piense en fraude, enfermedades o abandono: el evento interesante es el menos frecuente.

La trampa del 99 %

Imagine 99 transacciones normales por cada fraude. Un modelo que siempre grita «normal» obtiene una magnífica exactitud del 99 %. ⚠️

Y no detectó nada

Ese modelo del 99 % nunca marcó un solo fraude. El número parece excelente, pero el modelo es inútil para el trabajo exacto para el que lo contrató.

La exactitud oculta la clase minoritaria

La exactitud promedia todas las filas, por lo que la enorme mayoría ahoga a la diminuta minoría. La clase minoritaria puede ser un fracaso total y apenas afectar a la puntuación.

La línea base que debe superar

Compare siempre con la línea base de la clase mayoritaria: prediga simplemente la etiqueta más común. Si su modelo no puede superarla, no ha aprendido nada útil.

Una comprobación rápida de la realidad

Antes de celebrarlo, pregúntese una cosa: ¿qué proporción de las filas pertenece a la clase mayoritaria? Ese número es la exactitud que un modelo perezoso obtiene gratis.

Compruébelo con value_counts

Una sola línea revela hasta qué punto sus etiquetas están desequilibradas. Si un valor eclipsa a los demás, la exactitud por sí sola le llevará a conclusiones erróneas.

counts = y.value_counts(normalize=True)
print(counts)  # share of each class

Dónde está realmente el coste

No detectar la clase minoritaria suele ser lo más perjudicial: un tumor o un fraude no detectados resultan costosos. La exactitud trata todos los errores como iguales, pero la realidad no.

Mire más allá de un solo número

La solución todavía no es una métrica mágica, sino una forma de pensar. Deje de confiar en un único número y empiece a preguntarse cómo le fue realmente a la clase minoritaria.

Prepárese para mejores métricas

Pronto conocerá la precisión, la exhaustividad y las curvas PR, diseñadas para eventos poco frecuentes. Primero, asimile por qué aquí la exactitud se ganó su desconfianza.

Comprobación rápida

¿Por qué puede inducir a error la exactitud con datos desequilibrados?

Repaso

Con datos desequilibrados, la exactitud favorece a los modelos perezosos que ignoran la clase minoritaria. Supere la línea base mayoritaria y evalúe cómo le fue realmente a la clase minoritaria. 🎯

Gratis para empezar

Aprende Python con un tutor de IA — gratis

Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.

Cursos
30
Lecciones
120

Preguntas frecuentes

¿La lección «Por qué la exactitud engaña con datos desequilibrados» es gratis?

Sí — el texto completo de «Por qué la exactitud engaña con datos desequilibrados» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de Data Science Academy, actualiza a CoddyKit PRO. El curso de Data Science Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Por qué la exactitud engaña con datos desequilibrados»?

La trampa de la clase minoritaria. Practicas Data Science Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar Data Science Academy?

No se requiere experiencia previa. Data Science Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 1 de 4.

¿Cuánto tiempo toma la lección «Por qué la exactitud engaña con datos desequilibrados»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de Data Science Academy?

Sí. Cada lección de Data Science Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Por qué la exactitud engaña con datos desequilibrados
  2. Remuestreo: SMOTE y submuestreo
  3. Pesos de clase y umbrales
  4. Elegir métricas para eventos poco frecuentes
← Volver a Data Science Academy