0Pricing
Data Science Academy · Урок

Зачем откладывать тестовую выборку

Оценка качества на ранее не виденных данных

«Зачем откладывать тестовую выборку» — бесплатный урок Data Science Academy на CoddyKit. Это урок 1 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Data Science Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Data Science Academy содержит 4 уроков всего.

Части этого урока еще не переведены и отображаются на английском.

The Real Question

A model that memorizes your data looks brilliant on it. The real question is how it does on data it has never seen.

Hold Some Data Back

So you set aside part of your data and never train on it. This locked-away slice is your test set, kept for the very end.

Train Here, Judge There

The model learns only from the training set. You then judge it on the untouched test set to see how it truly generalizes. 🎯

Why Not Score on Training

Scoring on the same rows it learned from is like grading a test with the answer key open. That number flatters the model and overstates its skill.

Generalization Is the Goal

You do not care how well it fits old data. You care about generalization: making good predictions on tomorrow's fresh, unseen rows.

Meet Overfitting

When a model nails training data but flops on the test set, it is overfitting. It memorized noise instead of learning the real pattern.

A Common Split

A simple, popular choice is to train on about 80% of rows and test on the remaining 20%. More data to learn, enough left to judge fairly.

Touch It Only Once

The test set is sacred. If you keep peeking and tweaking until the score looks good, you have quietly leaked it into your decisions.

Where the Split Happens

In scikit-learn, one helper does the splitting for you. It shuffles and carves your data into train and test parts in a single call.

from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)

The Honest Number

The score on the test set is your honest estimate of real-world performance. Trust it more than any glowing training score.

More Than a Formality

Holding out data is not red tape. It is the one habit that stops you from shipping a model that only ever worked on paper.

Quick Check

Why do you keep a separate test set?

Recap

You split data, learn on the train part, and judge on a sacred test set. That untouched slice is your honest read on real-world skill. 🎯

Часто задаваемые вопросы

Урок «Зачем откладывать тестовую выборку» бесплатный?

Да — полный текст урока «Зачем откладывать тестовую выборку» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Data Science Academy, подпишись на CoddyKit PRO. Курс Data Science Academy содержит 4 уроков всего.

Чему я научусь в уроке «Зачем откладывать тестовую выборку»?

Оценка качества на ранее не виденных данных Ты практикуешь Data Science Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать Data Science Academy?

Предыдущий опыт не требуется. Data Science Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 4.

Сколько времени занимает урок «Зачем откладывать тестовую выборку»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке Data Science Academy?

Да. Каждый урок Data Science Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Зачем откладывать тестовую выборку
  2. Правильное использование train_test_split
  3. Перекрёстная проверка по K блокам
  4. Остановите утечку данных до её появления
← Назад к Data Science Academy