Warum Sie einen Testsatz zurückhalten
Die Leistung auf unbekannten Daten schätzen
Warum Sie einen Testsatz zurückhalten ist eine kostenlose Data Science Academy-Lektion auf CoddyKit. Dies ist Lektion 1 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Data Science Academy-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Data Science Academy-Kurs umfasst insgesamt 4 Lektionen.
Teile dieser Lektion wurden noch nicht übersetzt und werden auf Englisch angezeigt.
The Real Question
A model that memorizes your data looks brilliant on it. The real question is how it does on data it has never seen.
Hold Some Data Back
So you set aside part of your data and never train on it. This locked-away slice is your test set, kept for the very end.
Train Here, Judge There
The model learns only from the training set. You then judge it on the untouched test set to see how it truly generalizes. 🎯
Why Not Score on Training
Scoring on the same rows it learned from is like grading a test with the answer key open. That number flatters the model and overstates its skill.
Generalization Is the Goal
You do not care how well it fits old data. You care about generalization: making good predictions on tomorrow's fresh, unseen rows.
Meet Overfitting
When a model nails training data but flops on the test set, it is overfitting. It memorized noise instead of learning the real pattern.
A Common Split
A simple, popular choice is to train on about 80% of rows and test on the remaining 20%. More data to learn, enough left to judge fairly.
Touch It Only Once
The test set is sacred. If you keep peeking and tweaking until the score looks good, you have quietly leaked it into your decisions.
Where the Split Happens
In scikit-learn, one helper does the splitting for you. It shuffles and carves your data into train and test parts in a single call.
from sklearn.model_selection import train_test_split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2)The Honest Number
The score on the test set is your honest estimate of real-world performance. Trust it more than any glowing training score.
More Than a Formality
Holding out data is not red tape. It is the one habit that stops you from shipping a model that only ever worked on paper.
Quick Check
Why do you keep a separate test set?
Recap
You split data, learn on the train part, and judge on a sacred test set. That untouched slice is your honest read on real-world skill. 🎯
Häufig gestellte Fragen
Ist die Lektion „Warum Sie einen Testsatz zurückhalten“ kostenlos?
Ja — der vollständige Text von „Warum Sie einen Testsatz zurückhalten“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Data Science Academy-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Data Science Academy-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Warum Sie einen Testsatz zurückhalten“?
Die Leistung auf unbekannten Daten schätzen Du übst Data Science Academy mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um Data Science Academy zu starten?
Keine Vorkenntnisse erforderlich. Data Science Academy auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 1 von 4.
Wie lange dauert die Lektion „Warum Sie einen Testsatz zurückhalten“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser Data Science Academy-Lektion Code schreiben und ausführen?
Ja. Jede Data Science Academy-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Warum Sie einen Testsatz zurückhalten
- train_test_split richtig einsetzen
- K-Fold-Kreuzvalidierung
- Datenlecks verhindern, bevor sie entstehen