scikit-learn-API'et: fit, transform, predict
Forstå estimator-interfacet og arbejdsgangen for train/test-opdeling.
scikit-learn-API'et: fit, transform, predict er en gratis Python Academy-lektion på CoddyKit. Dette er lektion 1 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i Python Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Python Academy-kurset indeholder 4 lektioner i alt.
Hvad er scikit-learn?
scikit-learn er det foretrukne Python-bibliotek til klassisk maskinlæring. Det har en ensartet API: Alle estimatorer har fit(), og de fleste har predict() eller transform().
from sklearn.linear_model import LinearRegression
import numpy as np
X = np.array([[1],[2],[3],[4],[5]])
y = np.array([2, 4, 6, 8, 10])
model = LinearRegression().fit(X, y)
print(model.predict([[6]])) # [12.]Opdeling i trænings- og testdata
Opdel altid data før træning, så du kan evaluere, hvor godt modellen generaliserer til data, den ikke har set.
from sklearn.model_selection import train_test_split
import numpy as np
X = np.random.rand(100, 5)
y = (X[:,0] > 0.5).astype(int)
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.2, random_state=42
)
print(X_train.shape, X_test.shape) # (80,5) (20,5)fit() — træning
estimator.fit(X, y) træner modellen på X (egenskaber) og y (etiketter). For uovervågede metoder sendes kun X.
from sklearn.linear_model import LogisticRegression
from sklearn.datasets import make_classification
X, y = make_classification(n_samples=200, random_state=0)
model = LogisticRegression()
model.fit(X, y)
print("Trained:", model.classes_)predict() og predict_proba()
predict(X) returnerer klasseetiketter, og predict_proba(X) returnerer klassesandsynligheder for klassifikatorer.
from sklearn.linear_model import LogisticRegression
from sklearn.datasets import make_classification
X, y = make_classification(random_state=0)
model = LogisticRegression().fit(X, y)
print(model.predict(X[:5])) # [0 1 0 ...]
print(model.predict_proba(X[:2])) # [[0.7 0.3] ...]Transformere: fit og transform
Transformere (skalere, kodere) har fit(X) + transform(X). Tilpas altid kun på træningsdata, og transformér derefter både trænings- og testdata.
from sklearn.preprocessing import StandardScaler
import numpy as np
X_train = np.array([[1,2],[3,4],[5,6]])
X_test = np.array([[2,3],[4,5]])
scaler = StandardScaler()
X_train_s = scaler.fit_transform(X_train) # fit + transform
X_test_s = scaler.transform(X_test) # transform only (using train stats)Pipeline
En Pipeline kæder transformere og en estimator sammen til ét objekt. Den forhindrer datalækage ved at anvende transformationer korrekt under krydsvalidering.
from sklearn.pipeline import Pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.svm import SVC
pipe = Pipeline([
("scaler", StandardScaler()),
("clf", SVC())
])
pipe.fit(X_train, y_train)
print(pipe.score(X_test, y_test))Nøjagtighed og andre måltal
Brug accuracy_score, f1_score og classification_report til at evaluere klassifikatorer.
from sklearn.metrics import accuracy_score, classification_report
y_pred = model.predict(X_test)
print(accuracy_score(y_test, y_pred))
print(classification_report(y_test, y_pred))Krydsvalidering
cross_val_score evaluerer en model ved hjælp af k-fold-krydsvalidering uden at opdele data manuelt.
from sklearn.model_selection import cross_val_score
from sklearn.linear_model import LogisticRegression
from sklearn.datasets import make_classification
X, y = make_classification(random_state=0)
scores = cross_val_score(LogisticRegression(), X, y, cv=5)
print(f"CV scores: {scores.mean():.3f} ± {scores.std():.3f}")Justering af hyperparametre med GridSearchCV
GridSearchCV søger systematisk gennem et parametergitter ved hjælp af krydsvalidering for at finde de bedste hyperparametre.
from sklearn.model_selection import GridSearchCV
from sklearn.svm import SVC
from sklearn.datasets import make_classification
X, y = make_classification(random_state=0)
param_grid = {"C": [0.1, 1, 10], "kernel": ["rbf", "linear"]}
gs = GridSearchCV(SVC(), param_grid, cv=5)
gs.fit(X, y)
print(gs.best_params_, gs.best_score_)Forbehandling: LabelEncoder og OneHotEncoder
Kod kategoriske etiketter med LabelEncoder og kategoriske egenskaber med OneHotEncoder eller ColumnTransformer.
from sklearn.preprocessing import LabelEncoder, OneHotEncoder
import numpy as np
le = LabelEncoder()
print(le.fit_transform(["cat","dog","cat","fish"])) # [0 1 0 2]
ohe = OneHotEncoder(sparse_output=False)
print(ohe.fit_transform([["red"],["green"],["blue"]]))Lagring og indlæsning af modeller
Gem trænede modeller permanent med joblib (hurtigere end pickle til NumPy-arrays).
import joblib
from sklearn.linear_model import LogisticRegression
from sklearn.datasets import make_classification
X, y = make_classification(random_state=0)
model = LogisticRegression().fit(X, y)
joblib.dump(model, "model.joblib")
loaded = joblib.load("model.joblib")
print(loaded.predict(X[:3]))Hurtigt tjek
Hvorfor bør du kun kalde scaler.fit() på træningsdata og ikke på testdata?
Opsummering
scikit-learns ensartede API: fit() træner, predict() laver forudsigelser, og transform() forbehandler. Brug Pipeline til at kæde trin sammen. Opdel data med train_test_split, evaluer med cross_val_score, og justér med GridSearchCV.
Lær Python med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 76
- Lektioner
- 320
Ofte stillede spørgsmål
Er lektionen “scikit-learn-API'et: fit, transform, predict” gratis?
Ja — hele teksten til “scikit-learn-API'et: fit, transform, predict” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af Python Academy-kurset, skal du opgradere til CoddyKit PRO. Python Academy-kurset indeholder 4 lektioner i alt.
Hvad lærer jeg i “scikit-learn-API'et: fit, transform, predict”?
Forstå estimator-interfacet og arbejdsgangen for train/test-opdeling. Du øver dig i Python Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på Python Academy?
Der kræves ingen tidligere erfaring. Python Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 1 af 4.
Hvor lang tid tager lektionen “scikit-learn-API'et: fit, transform, predict”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne Python Academy-lektion?
Ja. Alle Python Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- scikit-learn-API'et: fit, transform, predict
- Lineære modeller: regression og klassifikation
- Træbaserede modeller: beslutningstræer og random forests
- Modelevaluering og krydsvalidering