Python Academy · Lektion

scikit-learn-API'et: fit, transform, predict

Forstå estimator-interfacet og arbejdsgangen for train/test-opdeling.

Lektion 1 af 413 trin

scikit-learn-API'et: fit, transform, predict er en gratis Python Academy-lektion på CoddyKit. Dette er lektion 1 af 4. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i Python Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Python Academy-kurset indeholder 4 lektioner i alt.

Hvad er scikit-learn?

scikit-learn er det foretrukne Python-bibliotek til klassisk maskinlæring. Det har en ensartet API: Alle estimatorer har fit(), og de fleste har predict() eller transform().

from sklearn.linear_model import LinearRegression
import numpy as np

X = np.array([[1],[2],[3],[4],[5]])
y = np.array([2, 4, 6, 8, 10])

model = LinearRegression().fit(X, y)
print(model.predict([[6]]))   # [12.]

Opdeling i trænings- og testdata

Opdel altid data før træning, så du kan evaluere, hvor godt modellen generaliserer til data, den ikke har set.

from sklearn.model_selection import train_test_split
import numpy as np

X = np.random.rand(100, 5)
y = (X[:,0] > 0.5).astype(int)

X_train, X_test, y_train, y_test = train_test_split(
    X, y, test_size=0.2, random_state=42
)
print(X_train.shape, X_test.shape)   # (80,5) (20,5)

fit() — træning

estimator.fit(X, y) træner modellen på X (egenskaber) og y (etiketter). For uovervågede metoder sendes kun X.

from sklearn.linear_model import LogisticRegression
from sklearn.datasets import make_classification

X, y = make_classification(n_samples=200, random_state=0)
model = LogisticRegression()
model.fit(X, y)
print("Trained:", model.classes_)

predict() og predict_proba()

predict(X) returnerer klasseetiketter, og predict_proba(X) returnerer klassesandsynligheder for klassifikatorer.

from sklearn.linear_model import LogisticRegression
from sklearn.datasets import make_classification

X, y = make_classification(random_state=0)
model = LogisticRegression().fit(X, y)

print(model.predict(X[:5]))          # [0 1 0 ...]
print(model.predict_proba(X[:2]))    # [[0.7 0.3] ...]

Transformere: fit og transform

Transformere (skalere, kodere) har fit(X) + transform(X). Tilpas altid kun på træningsdata, og transformér derefter både trænings- og testdata.

from sklearn.preprocessing import StandardScaler
import numpy as np

X_train = np.array([[1,2],[3,4],[5,6]])
X_test  = np.array([[2,3],[4,5]])

scaler = StandardScaler()
X_train_s = scaler.fit_transform(X_train)   # fit + transform
X_test_s  = scaler.transform(X_test)        # transform only (using train stats)

Pipeline

En Pipeline kæder transformere og en estimator sammen til ét objekt. Den forhindrer datalækage ved at anvende transformationer korrekt under krydsvalidering.

from sklearn.pipeline import Pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.svm import SVC

pipe = Pipeline([
    ("scaler", StandardScaler()),
    ("clf", SVC())
])
pipe.fit(X_train, y_train)
print(pipe.score(X_test, y_test))

Nøjagtighed og andre måltal

Brug accuracy_score, f1_score og classification_report til at evaluere klassifikatorer.

from sklearn.metrics import accuracy_score, classification_report

y_pred = model.predict(X_test)
print(accuracy_score(y_test, y_pred))
print(classification_report(y_test, y_pred))

Krydsvalidering

cross_val_score evaluerer en model ved hjælp af k-fold-krydsvalidering uden at opdele data manuelt.

from sklearn.model_selection import cross_val_score
from sklearn.linear_model import LogisticRegression
from sklearn.datasets import make_classification

X, y = make_classification(random_state=0)
scores = cross_val_score(LogisticRegression(), X, y, cv=5)
print(f"CV scores: {scores.mean():.3f} ± {scores.std():.3f}")

Justering af hyperparametre med GridSearchCV

GridSearchCV søger systematisk gennem et parametergitter ved hjælp af krydsvalidering for at finde de bedste hyperparametre.

from sklearn.model_selection import GridSearchCV
from sklearn.svm import SVC
from sklearn.datasets import make_classification

X, y = make_classification(random_state=0)
param_grid = {"C": [0.1, 1, 10], "kernel": ["rbf", "linear"]}
gs = GridSearchCV(SVC(), param_grid, cv=5)
gs.fit(X, y)
print(gs.best_params_, gs.best_score_)

Forbehandling: LabelEncoder og OneHotEncoder

Kod kategoriske etiketter med LabelEncoder og kategoriske egenskaber med OneHotEncoder eller ColumnTransformer.

from sklearn.preprocessing import LabelEncoder, OneHotEncoder
import numpy as np

le = LabelEncoder()
print(le.fit_transform(["cat","dog","cat","fish"]))   # [0 1 0 2]

ohe = OneHotEncoder(sparse_output=False)
print(ohe.fit_transform([["red"],["green"],["blue"]]))

Lagring og indlæsning af modeller

Gem trænede modeller permanent med joblib (hurtigere end pickle til NumPy-arrays).

import joblib
from sklearn.linear_model import LogisticRegression
from sklearn.datasets import make_classification

X, y = make_classification(random_state=0)
model = LogisticRegression().fit(X, y)

joblib.dump(model, "model.joblib")
loaded = joblib.load("model.joblib")
print(loaded.predict(X[:3]))

Hurtigt tjek

Hvorfor bør du kun kalde scaler.fit() på træningsdata og ikke på testdata?

Opsummering

scikit-learns ensartede API: fit() træner, predict() laver forudsigelser, og transform() forbehandler. Brug Pipeline til at kæde trin sammen. Opdel data med train_test_split, evaluer med cross_val_score, og justér med GridSearchCV.

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
76
Lektioner
320

Ofte stillede spørgsmål

Er lektionen “scikit-learn-API'et: fit, transform, predict” gratis?

Ja — hele teksten til “scikit-learn-API'et: fit, transform, predict” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af Python Academy-kurset, skal du opgradere til CoddyKit PRO. Python Academy-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “scikit-learn-API'et: fit, transform, predict”?

Forstå estimator-interfacet og arbejdsgangen for train/test-opdeling. Du øver dig i Python Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Python Academy?

Der kræves ingen tidligere erfaring. Python Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 1 af 4.

Hvor lang tid tager lektionen “scikit-learn-API'et: fit, transform, predict”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Python Academy-lektion?

Ja. Alle Python Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. scikit-learn-API'et: fit, transform, predict
  2. Lineære modeller: regression og klassifikation
  3. Træbaserede modeller: beslutningstræer og random forests
  4. Modelevaluering og krydsvalidering
← Tilbage til Python Academy