Data Science Academy · Aula

Por que a acurácia engana em dados desbalanceados

A armadilha da classe rara.

Aula 1 de 413 etapas

Por que a acurácia engana em dados desbalanceados é uma aula grátis de Data Science Academy no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de Data Science Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de Data Science Academy inclui 4 aulas no total.

A mentira confortável

A acurácia parece a medida óbvia: quantas previsões você acertou. Em dados equilibrados, ela funciona bem, mas o desbalanceamento a invalida silenciosamente.

O que significa desbalanceamento

Um conjunto de dados é desbalanceado quando uma classe é muito mais rara que as outras. Pense em fraude, doença ou cancelamento: o evento interessante é o raro.

A armadilha dos 99%

Imagine 99 transações normais para cada fraude. Um modelo que sempre grita “normal” obtém gloriosos 99% de acurácia. ⚠️

Mas não detectou nada

Esse modelo com 99% nunca sinalizou uma única fraude. O número parece excelente, mas o modelo é inútil para exatamente a tarefa para a qual foi criado.

A acurácia esconde a classe rara

A acurácia calcula a média de todas as linhas, então a enorme maioria abafa a minoria pequena. A classe rara pode ser um fracasso total e quase não alterar a pontuação.

A linha de base que você precisa superar

Sempre compare com a linha de base da classe majoritária: basta prever o rótulo mais comum. Se o seu modelo não consegue superá-la, ele não aprendeu nada útil.

Uma verificação rápida da realidade

Antes de comemorar, pergunte uma coisa: qual fração das linhas pertence à classe majoritária? Esse número é a acurácia que um modelo preguiçoso obtém de graça.

Veja com value_counts

Uma linha revela o quanto seus rótulos estão desequilibrados. Se um valor for muito maior que os demais, a acurácia sozinha irá induzi-lo ao erro.

counts = y.value_counts(normalize=True)
print(counts)  # share of each class

Onde o custo realmente está

Não detectar a classe rara geralmente é o que mais prejudica: um tumor ou uma fraude não detectados custam caro. A acurácia trata todos os erros como iguais, mas a realidade não.

Não olhe apenas para um número

A solução ainda não é uma métrica mágica, mas uma mudança de mentalidade. Pare de confiar em um único número e comece a perguntar como a classe minoritária realmente se saiu.

Prepare-se para métricas melhores

Em breve, você conhecerá precisão, revocação e curvas PR criadas para eventos raros. Primeiro, entenda por que a acurácia conquistou sua desconfiança neste caso.

Verificação rápida

Por que a acurácia pode induzir ao erro em dados desbalanceados?

Recapitulação

Em situações de desbalanceamento, a acurácia favorece modelos preguiçosos que ignoram a classe rara. Supere a linha de base majoritária e avalie como a classe minoritária realmente se saiu. 🎯

Grátis para começar

Aprenda Python com um tutor de IA — grátis

Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.

Cursos
30
Aulas
120

Perguntas Frequentes

A aula “Por que a acurácia engana em dados desbalanceados” é grátis?

Sim — o texto completo de “Por que a acurácia engana em dados desbalanceados” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de Data Science Academy, atualize para CoddyKit PRO. O curso de Data Science Academy inclui 4 aulas no total.

O que vou aprender em “Por que a acurácia engana em dados desbalanceados”?

A armadilha da classe rara. Você pratica Data Science Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar Data Science Academy?

Nenhuma experiência prévia é necessária. Data Science Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.

Quanto tempo leva a aula “Por que a acurácia engana em dados desbalanceados”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de Data Science Academy?

Sim. Cada aula de Data Science Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Por que a acurácia engana em dados desbalanceados
  2. Reamostragem: SMOTE e subamostragem
  3. Pesos de classe e limiares
  4. Escolher métricas para eventos raros
← Voltar para Data Science Academy