Data Science Academy · Les

ColumnTransformer voor gemengde typen

Verschillende voorbereiding per kolomgroep

Les 2 van 413 stappen

ColumnTransformer voor gemengde typen is een gratis Data Science Academy-les op CoddyKit. Dit is les 2 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Data Science Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Data Science Academy bevat in totaal 4 lessen.

Kolommen zijn niet gelijk

Echte tabellen bevatten getallen en categorieën, en elk type heeft een andere voorbereiding nodig. Eén scaler voor alles werkt simpelweg niet. 🧩

Maak kennis met ColumnTransformer

Een ColumnTransformer past verschillende transformers toe op verschillende kolomgroepen, allemaal in één stap die je in een pipeline kunt opnemen.

Vermeld je kolomgroepen

Bepaal eerst welke kolommen numeriek en welke categorisch zijn. Vervolgens geef je elke groep op naam een eigen transformer.

num_cols = ['age', 'income']
cat_cols = ['city', 'plan']

Schaal de getallen

Numerieke kolommen hebben meestal een StandardScaler nodig, zodat grote en kleine waarden vóór het modelleren op gelijke voet komen te staan.

from sklearn.preprocessing import StandardScaler

Codeer de categorieën

Categorische kolommen hebben getallen nodig. Gebruik daarom OneHotEncoder om elke categorie om te zetten in een eigen kolom met 0/1-waarden.

from sklearn.preprocessing import OneHotEncoder

Verbind alles

Elke invoer is een tuple met een naam, transformer en de kolommen waarop die werkt. De ColumnTransformer voert ze naast elkaar uit.

from sklearn.compose import ColumnTransformer
prep = ColumnTransformer([('num', StandardScaler(), num_cols), ('cat', OneHotEncoder(), cat_cols)])

Plaats het in een pijplijn

Plaats de transformator als eerste stap en een model als laatste. Nu staan de voorbereidingen voor gemengde typen en het modelleren in één pijplijn.

pipe = Pipeline([('prep', prep), ('model', LogisticRegression())])

Overgebleven kolommen

Kolommen die je niet opgeeft, worden standaard verwijderd. Stel remainder in op passthrough als je de rest ongewijzigd wilt behouden.

ColumnTransformer([...], remainder='passthrough')

Niet eerder geziene categorieën verwerken

Testgegevens kunnen een categorie bevatten die tijdens het trainen niet is gezien. Stel handle_unknown in op ignore, zodat de encoder rustig blijft in plaats van vast te lopen.

OneHotEncoder(handle_unknown='ignore')

Kolommen op type selecteren

Ben je het typen van kolomnamen zat? make_column_selector pakt kolommen op basis van dtype, zodat je voorbereiding zich aanpast wanneer de tabel verandert.

from sklearn.compose import make_column_selector as selector

Eén fit, beide paden

Door één keer fit aan te roepen, train je de scaler en de encoder samen op de juiste kolommen. Elk pad leert alleen van zijn eigen kolommen.

Snelle controle

Je hebt numerieke en categorische kolommen die verschillende voorbereidingen nodig hebben. Wat kan dit afhandelen?

Samenvatting

Je kunt numerieke en categorische kolommen nu naar hun eigen transformatoren leiden met een ColumnTransformer binnen één pijplijn. Als volgende stap gaan we tunen. 🔧

Gratis beginnen

Leer Python met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
30
Lessen
120

Veelgestelde vragen

Is de les “ColumnTransformer voor gemengde typen” gratis?

Ja — de volledige tekst van “ColumnTransformer voor gemengde typen” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus Data Science Academy wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus Data Science Academy bevat in totaal 4 lessen.

Wat leer ik in “ColumnTransformer voor gemengde typen”?

Verschillende voorbereiding per kolomgroep Je oefent met Data Science Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met Data Science Academy te beginnen?

Ervaring vooraf is niet nodig. Data Science Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 2 van 4.

Hoe lang duurt de les “ColumnTransformer voor gemengde typen”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over Data Science Academy?

Ja. Elke les over Data Science Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Waarom pipelines beter zijn dan handmatige stappen
  2. ColumnTransformer voor gemengde typen
  3. Tunen met GridSearchCV
  4. Een getrainde pipeline opslaan en opnieuw laden
← Terug naar Data Science Academy