Hvorfor accuracy snyder ved ubalance
Fælden med den sjældne klasse.
Hvorfor accuracy snyder ved ubalance er en gratis Data Science Academy-lektion på CoddyKit. Dette er lektion 1 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i Data Science Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Data Science Academy-kurset indeholder 4 lektioner i alt.
Den behagelige løgn
Nøjagtighed føles som det oplagte mål: hvor mange forudsigelser du ramte rigtigt. På afbalancerede data fungerer det fint, men ubalance ødelægger det i stilhed.
Hvad ubalance betyder
Et datasæt er ubalanceret, når én klasse er langt sjældnere end de andre. Tænk på svindel, sygdom eller kundefrafald: den interessante hændelse er den sjældne.
99 %-fælden
Forestil dig 99 normale transaktioner for hver svindeltransaktion. En model, der hver eneste gang siger normal, opnår imponerende 99 % nøjagtighed. ⚠️
Men den fandt intet
Modellen med 99 % markerede aldrig en eneste svindeltransaktion. Tallet ser fremragende ud, men modellen er ubrugelig til netop den opgave, du ansatte den til.
Nøjagtighed skjuler den sjældne klasse
Nøjagtighed beregnes på tværs af alle rækker, så det store flertal overdøver det lille mindretal. Den sjældne klasse kan være en total fiasko uden næsten at påvirke resultatet.
Udgangspunktet, du skal slå
Sammenlign altid med udgangspunktet for flertalsklassen: forudsig blot den hyppigste etiket. Hvis din model ikke kan slå det, har den ikke lært noget nyttigt.
Et hurtigt realitetstjek
Før du fejrer, skal du spørge om én ting: Hvor stor en andel af rækkerne tilhører flertalsklassen? Det tal er den nøjagtighed, en doven model får gratis.
Se det med value_counts
Én linje viser, hvor skævt dine etiketter er fordelt. Hvis én værdi er langt større end resten, vil nøjagtighed alene vildlede dig.
counts = y.value_counts(normalize=True)
print(counts) # share of each classHvor omkostningen virkelig ligger
Det gør som regel mest ondt at overse den sjældne klasse: en uopdaget svulst eller svindel er dyrt. Nøjagtighed behandler alle fejl ens, men virkeligheden gør ikke.
Se ud over ét tal
Løsningen er endnu ikke et magisk mål, men en ny tilgang. Stol ikke længere på ét tal, men spørg, hvordan mindretalsklassen faktisk klarede sig.
Gør dig klar til bedre mål
Snart møder du præcision, genkaldelse og PR-kurver, som er udviklet til sjældne hændelser. Først skal du forstå, hvorfor nøjagtighed fortjener din mistillid her.
Hurtigt tjek
Hvorfor kan nøjagtighed vildlede på ubalancerede data?
Opsummering
Ved ubalance smigrer nøjagtighed dovne modeller, der ignorerer den sjældne klasse. Slå flertalsklassens udgangspunkt, og vurder, hvordan mindretalsklassen faktisk klarede sig. 🎯
Lær Python med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 30
- Lektioner
- 120
Ofte stillede spørgsmål
Er lektionen “Hvorfor accuracy snyder ved ubalance” gratis?
Ja — hele teksten til “Hvorfor accuracy snyder ved ubalance” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af Data Science Academy-kurset, skal du opgradere til CoddyKit PRO. Data Science Academy-kurset indeholder 4 lektioner i alt.
Hvad lærer jeg i “Hvorfor accuracy snyder ved ubalance”?
Fælden med den sjældne klasse. Du øver dig i Data Science Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på Data Science Academy?
Der kræves ingen tidligere erfaring. Data Science Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 1 af 4.
Hvor lang tid tager lektionen “Hvorfor accuracy snyder ved ubalance”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne Data Science Academy-lektion?
Ja. Alle Data Science Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- Hvorfor accuracy snyder ved ubalance
- Resampling: SMOTE og undersampling
- Klassevægte og tærskler
- Vælg mål for sjældne hændelser