Data Science Academy · Les

Waarom accuracy misleidt bij ongebalanceerde data

De valkuil van de zeldzame klasse

Les 1 van 413 stappen

Waarom accuracy misleidt bij ongebalanceerde data is een gratis Data Science Academy-les op CoddyKit. Dit is les 1 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Data Science Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Data Science Academy bevat in totaal 4 lessen.

De comfortabele leugen

Nauwkeurigheid voelt als de vanzelfsprekende score: hoeveel voorspellingen je goed had. Bij gebalanceerde gegevens werkt dat prima, maar onbalans maakt deze maatstaf ongemerkt onbetrouwbaar.

Wat onbalans betekent

Een gegevensverzameling is onevenwichtig wanneer één klasse veel zeldzamer is dan de andere. Denk aan fraude, ziekte of opzeggingen: de interessante gebeurtenis is de zeldzame.

De val van 99%

Stel je 99 normale transacties voor tegenover 1 frauduleuze transactie. Een model dat elke keer normaal voorspelt, behaalt een indrukwekkende nauwkeurigheid van 99%. ⚠️

Toch ontdekte het niets

Dat model van 99% markeerde geen enkele frauduleuze transactie. Het getal ziet er geweldig uit, maar het model is nutteloos voor precies de taak waarvoor je het hebt ingezet.

Nauwkeurigheid verbergt de zeldzame klasse

Nauwkeurigheid wordt over alle rijen berekend, waardoor de grote meerderheid de kleine minderheid overstemt. De zeldzame klasse kan volledig mislukken zonder dat de score merkbaar verandert.

De basislijn die je moet overtreffen

Vergelijk altijd met de basislijn van de meerderheidsklasse: voorspel simpelweg het meest voorkomende label. Als je model die niet kan overtreffen, heeft het niets nuttigs geleerd.

Een snelle realiteitscontrole

Vraag jezelf vóór je gaat vieren één ding af: welk deel van de rijen behoort tot de meerderheidsklasse? Dat is de nauwkeurigheid die een lui model gratis behaalt.

Bekijk het met value_counts

Met één regel zie je hoe scheef je labels verdeeld zijn. Als één waarde de rest ver overtreft, zal alleen nauwkeurigheid je misleiden.

counts = y.value_counts(normalize=True)
print(counts)  # share of each class

Waar de kosten echt zitten

De zeldzame klasse missen doet meestal het meeste pijn: een onontdekte tumor of fraude is kostbaar. Nauwkeurigheid behandelt elke fout gelijk, maar de werkelijkheid doet dat niet.

Kijk verder dan één getal

De oplossing is nog geen magische maatstaf, maar een andere manier van denken. Vertrouw niet langer op één getal en vraag hoe de minderheidsklasse het werkelijk deed.

Bereid je voor op betere maatstaven

Maak binnenkort kennis met precisie, volledigheid en PR-curves voor zeldzame gebeurtenissen. Begrijp eerst waarom nauwkeurigheid hier je wantrouwen verdient.

Korte controle

Waarom kan nauwkeurigheid misleiden bij onevenwichtige gegevens?

Samenvatting

Bij onbalans vleit nauwkeurigheid luie modellen die de zeldzame klasse negeren. Overtref de basislijn van de meerderheid en beoordeel hoe de minderheidsklasse het echt deed. 🎯

Gratis beginnen

Leer Python met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
30
Lessen
120

Veelgestelde vragen

Is de les “Waarom accuracy misleidt bij ongebalanceerde data” gratis?

Ja — de volledige tekst van “Waarom accuracy misleidt bij ongebalanceerde data” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus Data Science Academy wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus Data Science Academy bevat in totaal 4 lessen.

Wat leer ik in “Waarom accuracy misleidt bij ongebalanceerde data”?

De valkuil van de zeldzame klasse Je oefent met Data Science Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met Data Science Academy te beginnen?

Ervaring vooraf is niet nodig. Data Science Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 1 van 4.

Hoe lang duurt de les “Waarom accuracy misleidt bij ongebalanceerde data”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over Data Science Academy?

Ja. Elke les over Data Science Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Waarom accuracy misleidt bij ongebalanceerde data
  2. Resamplen: SMOTE en undersampling
  3. Klassegewichten en drempels
  4. Metrieken kiezen voor zeldzame gebeurtenissen
← Terug naar Data Science Academy