Merkmale skalieren und auswählen
Die Merkmale behalten, die tatsächlich helfen
Merkmale skalieren und auswählen ist eine kostenlose NLP Academy-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des NLP Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der NLP Academy-Kurs umfasst insgesamt 4 Lektionen.
Zu viele Features schaden
Textmodelle können auf Zehntausende von Features anwachsen. Viele davon fügen nur Rauschen hinzu, daher verbessert das Kürzen der Liste oft sowohl die Geschwindigkeit als auch die Genauigkeit.
Warum überhaupt skalieren?
Einige Modelle vergleichen Feature-Größen direkt. Wenn ein Feature Werte von 0 bis 1000 annimmt, kann es die übrigen überlagern, sofern Sie sie nicht zuerst skalieren.
Zahlen standardisieren
StandardScaler verschiebt jedes Feature auf einen Mittelwert von null und eine Varianz von eins. Nun liegen alle numerischen Features auf derselben Skala.
from sklearn.preprocessing import StandardScaler
scaled = StandardScaler().fit_transform(numeric_features)Vorsicht bei dünnbesetzten Daten
Das Zentrieren einer dünnbesetzten TF-IDF-Matrix füllt sie mit Nichtnullwerten und verschwendet Speicher. Verwenden Sie MaxAbsScaler, der skaliert, ohne die Dünnbesetztheit zu zerstören.
from sklearn.preprocessing import MaxAbsScaler
scaled = MaxAbsScaler().fit_transform(tfidf_matrix)Entfernen Sie unnötigen Ballast
Features, die sich kaum verändern, liefern dem Modell keine Informationen. Ein VarianceThreshold-Filter entfernt nahezu konstante Spalten in einem schnellen Durchlauf.
Die nützlichsten auswählen
SelectKBest behält anhand eines Bewertungsverfahrens wie dem Chi-Quadrat-Test die besten Features. Sie geben k als Anzahl der gewünschten Features an, und es entfernt den Rest.
from sklearn.feature_selection import SelectKBest, chi2
best = SelectKBest(chi2, k=2000).fit_transform(X, y)Lassen Sie das Modell auswählen
Ein L1-regularisiertes Modell setzt nutzlose Gewichte selbstständig auf null. Diese integrierte Auswahl wird häufig als eingebettete Feature-Auswahl bezeichnet.
Nur mit den Trainingsdaten fitten
Fitten Sie Skalierer und Selektoren immer ausschließlich mit den Trainingsdaten und wenden Sie sie anschließend auf die Testdaten an. Eine Vermischung verursacht Data Leakage und unrealistisch gute Scheinscores.
Alles in einer Pipeline halten
Wenn Sie Skalierung und Auswahl in eine Pipeline aufnehmen, werden sie jedes Mal in der richtigen Reihenfolge ausgeführt. Außerdem verhindert dies versehentliches Data Leakage während der Validierung.
from sklearn.pipeline import Pipeline
pipe = Pipeline([("select", SelectKBest(chi2, k=2000)), ("clf", model)])Weniger Features, schnelleres Modell
Ein schlankerer Feature-Satz wird schneller trainiert, benötigt weniger Speicher und lässt sich leichter erklären. Weniger ist oft besser, sobald das Rauschen entfernt ist. ⚡
Messen statt raten
Probieren Sie einige k-Werte aus und vergleichen Sie die Validierungs-Scores. Lassen Sie die Zahlen statt eines Bauchgefühls entscheiden, wie viele Features Sie behalten.
Schnelltest
Welcher Skalierer erhält die Dünnbesetztheit einer Matrix?
Zusammenfassung
Skalieren Sie numerische Features und wählen Sie mit SelectKBest oder L1 die nützlichen aus. Verwenden Sie für dünnbesetzte Daten MaxAbsScaler und fitten Sie alles innerhalb einer Pipeline. ✅
Lerne Python mit einem KI-Tutor — kostenlos
Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.
- Kurse
- 30
- Lektionen
- 120
Häufig gestellte Fragen
Ist die Lektion „Merkmale skalieren und auswählen“ kostenlos?
Ja — der vollständige Text von „Merkmale skalieren und auswählen“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des NLP Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der NLP Academy-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Merkmale skalieren und auswählen“?
Die Merkmale behalten, die tatsächlich helfen Du übst NLP Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um NLP Academy zu starten?
Keine Vorkenntnisse erforderlich. NLP Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.
Wie lange dauert die Lektion „Merkmale skalieren und auswählen“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser NLP Academy-Lektion Code schreiben und ausführen?
Ja. Jede NLP Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Über Bag-of-Words hinaus
- Zeichen-N-Grams für Robustheit
- Mehrere Merkmalstypen kombinieren
- Merkmale skalieren und auswählen