Data Science Academy · Lektion

Warum Accuracy bei unausgeglichenen Daten täuscht

Die Falle seltener Klassen

Lektion 1 von 413 Schritte

Warum Accuracy bei unausgeglichenen Daten täuscht ist eine kostenlose Data Science Academy-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Data Science Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Data Science Academy-Kurs umfasst insgesamt 4 Lektionen.

Die bequeme Lüge

Accuracy wirkt wie die naheliegende Kennzahl: Wie viele Vorhersagen waren richtig? Bei ausgeglichenen Daten funktioniert sie gut, aber ein Ungleichgewicht macht sie unbemerkt unbrauchbar.

Was Ungleichgewicht bedeutet

Ein Datensatz ist unausgeglichen, wenn eine Klasse wesentlich seltener ist als die anderen. Denken Sie an Betrug, Krankheiten oder Kündigungen: Das interessante Ereignis ist das seltene.

Die 99-%-Falle

Stellen Sie sich 99 normale Transaktionen auf einen Betrugsfall vor. Ein Modell, das jedes Mal „normal“ meldet, erreicht beeindruckende 99 % Accuracy. ⚠️

Trotzdem wurde nichts erkannt

Dieses Modell mit 99 % hat keinen einzigen Betrugsfall markiert. Die Zahl wirkt herausragend, aber für die eigentliche Aufgabe ist das Modell unbrauchbar.

Accuracy verbirgt die seltene Klasse

Accuracy wird über alle Zeilen gemittelt, sodass die große Mehrheit die kleine Minderheit überdeckt. Die seltene Klasse kann vollständig falsch erkannt werden, ohne den Wert nennenswert zu verändern.

Die Baseline, die Sie übertreffen müssen

Vergleichen Sie immer mit der Baseline der Mehrheitsklasse: Prognostizieren Sie einfach das häufigste Label. Wenn Ihr Modell sie nicht übertrifft, hat es nichts Nützliches gelernt.

Ein kurzer Realitätscheck

Bevor Sie feiern, fragen Sie sich: Welcher Anteil der Zeilen gehört zur Mehrheitsklasse? Diese Zahl erreicht ein bequemes Modell mit minimalem Aufwand als Accuracy.

Mit value_counts sichtbar machen

Eine einzige Zeile zeigt, wie unausgewogen Ihre Labels sind. Wenn ein Wert die übrigen weit übertrifft, wird Accuracy allein Sie in die Irre führen.

counts = y.value_counts(normalize=True)
print(counts)  # share of each class

Wo die Kosten wirklich entstehen

Die seltene Klasse zu übersehen, ist meist besonders schädlich: Ein nicht erkannter Tumor oder Betrug verursacht hohe Kosten. Accuracy behandelt jeden Fehler gleich, die Realität jedoch nicht.

Blicken Sie über eine einzelne Zahl hinaus

Die Lösung ist noch keine magische Kennzahl, sondern eine andere Denkweise. Vertrauen Sie nicht länger auf eine einzelne Zahl, sondern fragen Sie, wie die Minderheitsklasse tatsächlich abgeschnitten hat.

Vorbereitung auf bessere Kennzahlen

Bald lernen Sie Precision, Recall und PR-Kurven kennen, die für seltene Ereignisse entwickelt wurden. Verinnerlichen Sie zunächst, warum Accuracy hier Ihr Misstrauen verdient.

Kurztest

Warum kann Accuracy bei unausgeglichenen Daten irreführend sein?

Zusammenfassung

Bei unausgeglichenen Daten schmeichelt Accuracy bequemen Modellen, die die seltene Klasse ignorieren. Übertreffen Sie die Mehrheits-Baseline und beurteilen Sie, wie die Minderheitsklasse tatsächlich abgeschnitten hat. 🎯

Kostenlos starten

Lerne Python mit einem KI-Tutor — kostenlos

Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.

Kurse
30
Lektionen
120

Häufig gestellte Fragen

Ist die Lektion „Warum Accuracy bei unausgeglichenen Daten täuscht“ kostenlos?

Ja — der vollständige Text von „Warum Accuracy bei unausgeglichenen Daten täuscht“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Data Science Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Data Science Academy-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Warum Accuracy bei unausgeglichenen Daten täuscht“?

Die Falle seltener Klassen Du übst Data Science Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Data Science Academy zu starten?

Keine Vorkenntnisse erforderlich. Data Science Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.

Wie lange dauert die Lektion „Warum Accuracy bei unausgeglichenen Daten täuscht“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Data Science Academy-Lektion Code schreiben und ausführen?

Ja. Jede Data Science Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Warum Accuracy bei unausgeglichenen Daten täuscht
  2. Resampling: SMOTE und Undersampling
  3. Klassengewichte und Schwellenwerte
  4. Metriken für seltene Ereignisse auswählen
← Zurück zu Data Science Academy