ColumnTransformer для смешанных типов
Отдельная подготовка для каждой группы столбцов
«ColumnTransformer для смешанных типов» — бесплатный урок Data Science Academy на CoddyKit. Это урок 2 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Data Science Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Data Science Academy содержит 4 уроков всего.
Части этого урока еще не переведены и отображаются на английском.
Columns Are Not Equal
Real tables mix numbers and categories, and each kind needs different prep. One scaler for everything simply will not work. 🧩
Meet ColumnTransformer
A ColumnTransformer applies different transformers to different column groups, all in one step you can drop inside a pipeline.
List Your Column Groups
First decide which columns are numeric and which are categorical. You will hand each group its own transformer by name.
num_cols = ['age', 'income']
cat_cols = ['city', 'plan']Scale the Numbers
Numeric columns usually want a StandardScaler so large and small values share a fair footing before modeling.
from sklearn.preprocessing import StandardScalerEncode the Categories
Categorical columns need numbers, so reach for OneHotEncoder to turn each category into its own 0/1 column.
from sklearn.preprocessing import OneHotEncoderWire It Together
Each entry is a tuple of name, transformer, and the columns it touches. The ColumnTransformer runs them side by side.
from sklearn.compose import ColumnTransformer
prep = ColumnTransformer([('num', StandardScaler(), num_cols), ('cat', OneHotEncoder(), cat_cols)])Slot It Into a Pipeline
Place the transformer as the first step and a model as the last. Now mixed-type prep and modeling live in one pipeline.
pipe = Pipeline([('prep', prep), ('model', LogisticRegression())])Leftover Columns
Columns you did not list are dropped by default. Set remainder to passthrough if you want to keep the rest untouched.
ColumnTransformer([...], remainder='passthrough')Handle Unseen Categories
Test data may contain a category training never saw. Set handle_unknown to ignore so the encoder stays calm instead of crashing.
OneHotEncoder(handle_unknown='ignore')Select Columns by Type
Tired of typing column names? make_column_selector grabs columns by dtype so your prep adapts as the table changes.
from sklearn.compose import make_column_selector as selectorOne Fit, Both Paths
Calling fit once trains the scaler and the encoder together on the right columns. Each path learns only from its own columns.
Quick Check
You have numeric and categorical columns needing different prep. What handles that?
Recap
You can now route numeric and categorical columns to their own transformers with a ColumnTransformer inside one pipeline. Next, tuning. 🔧
Часто задаваемые вопросы
Урок «ColumnTransformer для смешанных типов» бесплатный?
Да — полный текст урока «ColumnTransformer для смешанных типов» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Data Science Academy, подпишись на CoddyKit PRO. Курс Data Science Academy содержит 4 уроков всего.
Чему я научусь в уроке «ColumnTransformer для смешанных типов»?
Отдельная подготовка для каждой группы столбцов Ты практикуешь Data Science Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать Data Science Academy?
Предыдущий опыт не требуется. Data Science Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 4.
Сколько времени занимает урок «ColumnTransformer для смешанных типов»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке Data Science Academy?
Да. Каждый урок Data Science Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Почему конвейеры лучше ручных шагов
- ColumnTransformer для смешанных типов
- Настройка с помощью GridSearchCV
- Сохранение и повторная загрузка обученного конвейера