Объединение нескольких типов признаков
Объедините текстовые и числовые признаки
«Объединение нескольких типов признаков» — бесплатный урок NLP Academy на CoddyKit. Это урок 3 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения NLP Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс NLP Academy содержит 4 уроков всего.
Части этого урока еще не переведены и отображаются на английском.
One Type Is Rarely Enough
TF-IDF captures words, your hand-built numbers capture style. The best models often combine several feature types into one input.
Text and Numbers Together
Imagine a review's TF-IDF vector plus its length and star rating. Stacking these gives the model both word and numeric signal at once.
The Shape Problem
TF-IDF outputs a sparse matrix, while your custom features are a small dense array. You must join them along the same rows.
Side by Side, Not Stacked
We glue features as new columns for the same documents, not new rows. This horizontal join is called concatenation.
Stacking Sparse Matrices
SciPy offers hstack to place matrices side by side efficiently. It keeps everything sparse, so memory stays under control.
from scipy.sparse import hstack
combined = hstack([tfidf_matrix, numeric_features])ColumnTransformer to the Rescue
scikit-learn's ColumnTransformer applies different steps to different columns. It is the clean way to route text and numbers through one pipeline.
Wiring It Up
You give ColumnTransformer a list of named transformers and the columns each one handles. It builds a single feature matrix for you.
from sklearn.compose import ColumnTransformer
ct = ColumnTransformer([("text", TfidfVectorizer(), "review"), ("num", "passthrough", ["length"])])FeatureUnion for Parallel Steps
When several transformers read the same input, FeatureUnion runs them in parallel and joins the outputs. It is built for combining feature extractors.
Mind the Scales
Raw word counts and a 0-to-1000 length live on very different ranges. Mixing them often calls for scaling so no feature dominates.
Let Data Decide
Adding feature types should be a measured experiment. Compare a validation score before and after to confirm the combo actually helps.
More Is Not Always Better
Throwing in every feature can add noise and slow training. Aim for a small, well-chosen mix over a giant kitchen sink. 🧹
Quick Check
How should TF-IDF and numeric features be merged?
Recap
Strong models combine text and numeric features by concatenating columns. Use hstack, ColumnTransformer, or FeatureUnion, and scale before mixing. ✅
Часто задаваемые вопросы
Урок «Объединение нескольких типов признаков» бесплатный?
Да — полный текст урока «Объединение нескольких типов признаков» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс NLP Academy, подпишись на CoddyKit PRO. Курс NLP Academy содержит 4 уроков всего.
Чему я научусь в уроке «Объединение нескольких типов признаков»?
Объедините текстовые и числовые признаки Ты практикуешь NLP Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать NLP Academy?
Предыдущий опыт не требуется. NLP Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 3 из 4.
Сколько времени занимает урок «Объединение нескольких типов признаков»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке NLP Academy?
Да. Каждый урок NLP Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- За пределами модели «мешка слов»
- Символьные N-граммы для повышения устойчивости
- Объединение нескольких типов признаков
- Масштабирование и отбор признаков