NLP Academy · Lektion

Merkmale skalieren und auswählen

Die Merkmale behalten, die tatsächlich helfen

Lektion 4 von 413 Schritte

Merkmale skalieren und auswählen ist eine kostenlose NLP Academy-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des NLP Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der NLP Academy-Kurs umfasst insgesamt 4 Lektionen.

Zu viele Features schaden

Textmodelle können auf Zehntausende von Features anwachsen. Viele davon fügen nur Rauschen hinzu, daher verbessert das Kürzen der Liste oft sowohl die Geschwindigkeit als auch die Genauigkeit.

Warum überhaupt skalieren?

Einige Modelle vergleichen Feature-Größen direkt. Wenn ein Feature Werte von 0 bis 1000 annimmt, kann es die übrigen überlagern, sofern Sie sie nicht zuerst skalieren.

Zahlen standardisieren

StandardScaler verschiebt jedes Feature auf einen Mittelwert von null und eine Varianz von eins. Nun liegen alle numerischen Features auf derselben Skala.

from sklearn.preprocessing import StandardScaler
scaled = StandardScaler().fit_transform(numeric_features)

Vorsicht bei dünnbesetzten Daten

Das Zentrieren einer dünnbesetzten TF-IDF-Matrix füllt sie mit Nichtnullwerten und verschwendet Speicher. Verwenden Sie MaxAbsScaler, der skaliert, ohne die Dünnbesetztheit zu zerstören.

from sklearn.preprocessing import MaxAbsScaler
scaled = MaxAbsScaler().fit_transform(tfidf_matrix)

Entfernen Sie unnötigen Ballast

Features, die sich kaum verändern, liefern dem Modell keine Informationen. Ein VarianceThreshold-Filter entfernt nahezu konstante Spalten in einem schnellen Durchlauf.

Die nützlichsten auswählen

SelectKBest behält anhand eines Bewertungsverfahrens wie dem Chi-Quadrat-Test die besten Features. Sie geben k als Anzahl der gewünschten Features an, und es entfernt den Rest.

from sklearn.feature_selection import SelectKBest, chi2
best = SelectKBest(chi2, k=2000).fit_transform(X, y)

Lassen Sie das Modell auswählen

Ein L1-regularisiertes Modell setzt nutzlose Gewichte selbstständig auf null. Diese integrierte Auswahl wird häufig als eingebettete Feature-Auswahl bezeichnet.

Nur mit den Trainingsdaten fitten

Fitten Sie Skalierer und Selektoren immer ausschließlich mit den Trainingsdaten und wenden Sie sie anschließend auf die Testdaten an. Eine Vermischung verursacht Data Leakage und unrealistisch gute Scheinscores.

Alles in einer Pipeline halten

Wenn Sie Skalierung und Auswahl in eine Pipeline aufnehmen, werden sie jedes Mal in der richtigen Reihenfolge ausgeführt. Außerdem verhindert dies versehentliches Data Leakage während der Validierung.

from sklearn.pipeline import Pipeline
pipe = Pipeline([("select", SelectKBest(chi2, k=2000)), ("clf", model)])

Weniger Features, schnelleres Modell

Ein schlankerer Feature-Satz wird schneller trainiert, benötigt weniger Speicher und lässt sich leichter erklären. Weniger ist oft besser, sobald das Rauschen entfernt ist. ⚡

Messen statt raten

Probieren Sie einige k-Werte aus und vergleichen Sie die Validierungs-Scores. Lassen Sie die Zahlen statt eines Bauchgefühls entscheiden, wie viele Features Sie behalten.

Schnelltest

Welcher Skalierer erhält die Dünnbesetztheit einer Matrix?

Zusammenfassung

Skalieren Sie numerische Features und wählen Sie mit SelectKBest oder L1 die nützlichen aus. Verwenden Sie für dünnbesetzte Daten MaxAbsScaler und fitten Sie alles innerhalb einer Pipeline. ✅

Kostenlos starten

Lerne Python mit einem KI-Tutor — kostenlos

Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.

Kurse
30
Lektionen
120

Häufig gestellte Fragen

Ist die Lektion „Merkmale skalieren und auswählen“ kostenlos?

Ja — der vollständige Text von „Merkmale skalieren und auswählen“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des NLP Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der NLP Academy-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Merkmale skalieren und auswählen“?

Die Merkmale behalten, die tatsächlich helfen Du übst NLP Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um NLP Academy zu starten?

Keine Vorkenntnisse erforderlich. NLP Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.

Wie lange dauert die Lektion „Merkmale skalieren und auswählen“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser NLP Academy-Lektion Code schreiben und ausführen?

Ja. Jede NLP Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Über Bag-of-Words hinaus
  2. Zeichen-N-Grams für Robustheit
  3. Mehrere Merkmalstypen kombinieren
  4. Merkmale skalieren und auswählen
← Zurück zu NLP Academy