Data Science Academy · Lektion

Hvorfor accuracy snyder ved ubalance

Fælden med den sjældne klasse.

Lektion 1 af 413 trin

Hvorfor accuracy snyder ved ubalance er en gratis Data Science Academy-lektion på CoddyKit. Dette er lektion 1 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i Data Science Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Data Science Academy-kurset indeholder 4 lektioner i alt.

Den behagelige løgn

Nøjagtighed føles som det oplagte mål: hvor mange forudsigelser du ramte rigtigt. På afbalancerede data fungerer det fint, men ubalance ødelægger det i stilhed.

Hvad ubalance betyder

Et datasæt er ubalanceret, når én klasse er langt sjældnere end de andre. Tænk på svindel, sygdom eller kundefrafald: den interessante hændelse er den sjældne.

99 %-fælden

Forestil dig 99 normale transaktioner for hver svindeltransaktion. En model, der hver eneste gang siger normal, opnår imponerende 99 % nøjagtighed. ⚠️

Men den fandt intet

Modellen med 99 % markerede aldrig en eneste svindeltransaktion. Tallet ser fremragende ud, men modellen er ubrugelig til netop den opgave, du ansatte den til.

Nøjagtighed skjuler den sjældne klasse

Nøjagtighed beregnes på tværs af alle rækker, så det store flertal overdøver det lille mindretal. Den sjældne klasse kan være en total fiasko uden næsten at påvirke resultatet.

Udgangspunktet, du skal slå

Sammenlign altid med udgangspunktet for flertalsklassen: forudsig blot den hyppigste etiket. Hvis din model ikke kan slå det, har den ikke lært noget nyttigt.

Et hurtigt realitetstjek

Før du fejrer, skal du spørge om én ting: Hvor stor en andel af rækkerne tilhører flertalsklassen? Det tal er den nøjagtighed, en doven model får gratis.

Se det med value_counts

Én linje viser, hvor skævt dine etiketter er fordelt. Hvis én værdi er langt større end resten, vil nøjagtighed alene vildlede dig.

counts = y.value_counts(normalize=True)
print(counts)  # share of each class

Hvor omkostningen virkelig ligger

Det gør som regel mest ondt at overse den sjældne klasse: en uopdaget svulst eller svindel er dyrt. Nøjagtighed behandler alle fejl ens, men virkeligheden gør ikke.

Se ud over ét tal

Løsningen er endnu ikke et magisk mål, men en ny tilgang. Stol ikke længere på ét tal, men spørg, hvordan mindretalsklassen faktisk klarede sig.

Gør dig klar til bedre mål

Snart møder du præcision, genkaldelse og PR-kurver, som er udviklet til sjældne hændelser. Først skal du forstå, hvorfor nøjagtighed fortjener din mistillid her.

Hurtigt tjek

Hvorfor kan nøjagtighed vildlede på ubalancerede data?

Opsummering

Ved ubalance smigrer nøjagtighed dovne modeller, der ignorerer den sjældne klasse. Slå flertalsklassens udgangspunkt, og vurder, hvordan mindretalsklassen faktisk klarede sig. 🎯

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
30
Lektioner
120

Ofte stillede spørgsmål

Er lektionen “Hvorfor accuracy snyder ved ubalance” gratis?

Ja — hele teksten til “Hvorfor accuracy snyder ved ubalance” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af Data Science Academy-kurset, skal du opgradere til CoddyKit PRO. Data Science Academy-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Hvorfor accuracy snyder ved ubalance”?

Fælden med den sjældne klasse. Du øver dig i Data Science Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Data Science Academy?

Der kræves ingen tidligere erfaring. Data Science Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 1 af 4.

Hvor lang tid tager lektionen “Hvorfor accuracy snyder ved ubalance”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Data Science Academy-lektion?

Ja. Alle Data Science Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Hvorfor accuracy snyder ved ubalance
  2. Resampling: SMOTE og undersampling
  3. Klassevægte og tærskler
  4. Vælg mål for sjældne hændelser
← Tilbage til Data Science Academy