Feature Engineering mit recipes
Definieren Sie Vorverarbeitungsschritte für Normalisierung, Kodierung und Imputation
Feature Engineering mit recipes ist eine kostenlose R Academy-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des R Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der R Academy-Kurs umfasst insgesamt 4 Lektionen.
Was ist ein Rezept?
In tidymodels ist ein Rezept ein Plan für die Vorverarbeitung Ihrer Daten. Es hält die Schritte fest, die erforderlich sind, um Rohdaten in für ein Modell geeignete Merkmale umzuwandeln – ohne sie sofort anzuwenden.
Die zentrale Funktion ist recipe(outcome ~ ., data = train). Sie definiert die Formel und den Referenzdatensatz, aus dem alle für die Vorverarbeitung benötigten Statistiken geschätzt werden.
library(recipes)
library(tidymodels)
# Create a recipe using the training data
rec <- recipe(price ~ ., data = train_data)
print(rec)step_normalize()
step_normalize(all_numeric_predictors()) zentriert jeden numerischen Prädiktor auf einen Mittelwert von 0 und skaliert ihn auf eine Standardabweichung von 1. Das ist für Algorithmen wichtig, die empfindlich auf die Merkmalsskalierung reagieren, etwa logistische Regression, SVM oder neuronale Netze.
Mittelwert und Standardabweichung werden aus dem Trainingsdatensatz berechnet und über bake() konsistent auf Testdaten angewendet.
rec <- recipe(price ~ ., data = train_data) |>
step_normalize(all_numeric_predictors())
# Check what steps are recorded
print(rec)step_dummy()
step_dummy(all_nominal_predictors()) wandelt kategoriale (Factor-/Character-)Variablen in numerische Dummyspalten (One-Hot-Codierung) um. Standardmäßig werden für einen Faktor mit k Ausprägungen k-1 Spalten erstellt, wodurch perfekte Multikollinearität vermieden wird.
Verwenden Sie one_hot = TRUE für baumbasierte Modelle, die von einer vollständigen One-Hot-Codierung profitieren.
rec <- recipe(price ~ ., data = train_data) |>
step_dummy(all_nominal_predictors())
# After prep and bake, factor columns become 0/1 numeric columns
prepped <- prep(rec)
baked <- bake(prepped, new_data = NULL)
names(baked)step_impute_median()
Fehlende Werte führen bei den meisten Modell-Engines zu Fehlern. step_impute_median(all_numeric_predictors()) ersetzt NA-Werte durch den aus dem Trainingsdatensatz berechneten Median. Im Vergleich zur Imputation mit dem Mittelwert ist der Median gegenüber Ausreißern robust.
Verwenden Sie für kategoriale Variablen step_impute_mode(), um fehlende Werte durch den häufigsten Wert zu ersetzen.
rec <- recipe(price ~ ., data = train_data) |>
step_impute_median(all_numeric_predictors()) |>
step_impute_mode(all_nominal_predictors())
print(rec)step_zv() – Varianz von null entfernen
step_zv(all_predictors()) entfernt alle Prädiktoren, die nur einen einzigen eindeutigen Wert haben (Varianz von null). Solche Spalten enthalten keine Informationen und können bei einigen Modell-Engines Fehler verursachen.
Verwenden Sie für eine annähernd null betragende Varianz step_nzv(all_predictors()). Damit werden auch Spalten entfernt, in denen ein Wert deutlich überwiegt.
rec <- recipe(price ~ ., data = train_data) |>
step_impute_median(all_numeric_predictors()) |>
step_dummy(all_nominal_predictors()) |>
step_zv(all_predictors()) |>
step_normalize(all_numeric_predictors())
print(rec)prep() – Das Rezept trainieren
prep(recipe) schätzt anhand der Trainingsdaten alle von den Schritten benötigten Parameter – zum Beispiel Mittelwert und Standardabweichung für die Normalisierung sowie Mediane für die Imputation. Das Ergebnis ist ein vorbereitetes Rezept, das alle Transformationsparameter kennt.
Führen Sie prep immer nur mit Trainingsdaten aus, um einen Datenabfluss aus dem Testdatensatz zu vermeiden.
# Build the full recipe
rec <- recipe(price ~ ., data = train_data) |>
step_impute_median(all_numeric_predictors()) |>
step_dummy(all_nominal_predictors()) |>
step_zv(all_predictors()) |>
step_normalize(all_numeric_predictors())
# Estimate parameters from training data
prepped_rec <- prep(rec)
print(prepped_rec)bake() – Auf neue Daten anwenden
bake(prepped_recipe, new_data = test_data) wendet alle Vorverarbeitungsschritte mit den bereits geschätzten Parametern auf einen beliebigen Datensatz an. Dadurch sind die Transformationen für Trainings- und Testdaten konsistent.
Übergeben Sie new_data = NULL, um die während prep() verwendeten Trainingsdaten zu verarbeiten.
# Apply recipe to test data
baked_test <- bake(prepped_rec, new_data = test_data)
head(baked_test)
# Apply to training data (same as juice())
baked_train <- bake(prepped_rec, new_data = NULL)
dim(baked_train)juice() – Vorverarbeitete Trainingsdaten extrahieren
juice(prepped_recipe) ist eine Komfortfunktion, die bake(prepped_recipe, new_data = NULL) entspricht. Sie gibt die vorverarbeitete Version der Trainingsdaten zurück, die für prep() verwendet wurden.
Hinweis: juice() ist zugunsten von bake(prep, new_data = NULL) leicht veraltet, Sie werden es jedoch in älterem tidymodels-Code sehen.
# juice() extracts the processed training data
train_processed <- juice(prepped_rec)
glimpse(train_processed)
# Equivalent modern approach
train_modern <- bake(prepped_rec, new_data = NULL)
identical(train_processed, train_modern) # TRUEMehrere Schritte kombinieren
Die Schritte werden in der Reihenfolge angewendet, in der sie hinzugefügt wurden. Ein typisches Produktionsrezept folgt dieser Reihenfolge:
- Imputation (zuerst NAs beheben)
- Merkmalserstellung (Interaktionen, Polynome)
- Dummy-Codierung (Faktoren umwandeln)
- Entfernen von Merkmalen mit null Varianz
- Normalisierung (am Ende skalieren)
Diese Reihenfolge ist wichtig – eine Normalisierung vor der Dummy-Codierung würde beispielsweise falsche Ergebnisse liefern.
full_rec <- recipe(sale_price ~ ., data = housing_train) |>
step_impute_median(all_numeric_predictors()) |>
step_impute_mode(all_nominal_predictors()) |>
step_log(sale_price, base = 10) |>
step_other(all_nominal_predictors(), threshold = 0.05) |>
step_dummy(all_nominal_predictors()) |>
step_zv(all_predictors()) |>
step_normalize(all_numeric_predictors())
print(full_rec)Ergebnisse von prep untersuchen
Nach dem Aufruf von prep() können Sie mit tidy(prepped_rec) untersuchen, was die einzelnen Schritte bewirkt haben. Jeder Schritt hat eine numerische ID. Mit tidy(prepped_rec, number = 1) können Sie die geschätzten Parameter eines bestimmten Schritts anzeigen.
prepped_rec <- prep(full_rec)
# View all steps and their status
tidy(prepped_rec)
# Inspect normalization parameters (mean, sd per column)
tidy(prepped_rec, number = 5) # step_normalize is step 5Rezepte in der Praxis
Rezepte spielen ihre Stärken in Kombination mit Workflows aus. Statt prep() und bake() manuell aufzurufen, fügen Sie das Rezept einem Workflow hinzu; tidymodels übernimmt prep/bake dann automatisch während fit() und predict().
Dadurch entfällt eine häufige Fehlerquelle, bei der die Vorverarbeitung beim Training anders angewendet wird als zur Inferenzzeit.
library(workflows)
# Recipe + model spec combined in a workflow
wf <- workflow() |>
add_recipe(full_rec) |>
add_model(linear_reg() |> set_engine('lm'))
# fit() internally calls prep() + bake() on training data
fitted_wf <- fit(wf, data = housing_train)
# predict() applies bake() to new data automatically
predictions <- predict(fitted_wf, new_data = housing_test)
head(predictions)Schnelltest
Was bewirkt der Aufruf von prep(recipe) im tidymodels-Rezepte-Framework?
Rückblick: Rezepte
Wichtigste Erkenntnisse aus dem Feature Engineering mit Recipes:
recipe(outcome ~ ., data = train)definiert den Plan für die Vorverarbeitung.step_normalize(),step_dummy(),step_impute_median()undstep_zv()sind die am häufigsten verwendeten Schritte.prep()schätzt Parameter ausschließlich aus den Trainingsdaten – niemals aus Testdaten.bake(prepped, new_data)wendet das trainierte Rezept auf einen beliebigen Datensatz an.- Die Reihenfolge der Schritte ist wichtig: imputieren → erstellen → codieren → entfernen → skalieren.
- Verpacken Sie das Rezept in der Produktion in einen
workflow(), um prep/bake während fit und predict zu automatisieren.
# Full pipeline in 6 lines
rec <- recipe(target ~ ., data = train) |>
step_impute_median(all_numeric_predictors()) |>
step_dummy(all_nominal_predictors()) |>
step_zv(all_predictors()) |>
step_normalize(all_numeric_predictors())
prepped <- prep(rec)
train_baked <- bake(prepped, new_data = NULL)
test_baked <- bake(prepped, new_data = test)Lerne R mit einem KI-Tutor — kostenlos
Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.
- Kurse
- 43
- Lektionen
- 159
Häufig gestellte Fragen
Ist die Lektion „Feature Engineering mit recipes“ kostenlos?
Ja — der vollständige Text von „Feature Engineering mit recipes“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des R Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der R Academy-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Feature Engineering mit recipes“?
Definieren Sie Vorverarbeitungsschritte für Normalisierung, Kodierung und Imputation Du übst R Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um R Academy zu starten?
Keine Vorkenntnisse erforderlich. R Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.
Wie lange dauert die Lektion „Feature Engineering mit recipes“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser R Academy-Lektion Code schreiben und ausführen?
Ja. Jede R Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Feature Engineering mit recipes
- Modellspezifikationen mit parsnip
- Workflows: Rezepte und Modelle kombinieren
- Resampling und Cross-Validation mit rsample