0Pricing
Python Academy · Lezione

L'API di scikit-learn: fit, transform, predict

Comprenda l'interfaccia degli estimator e il flusso di lavoro della suddivisione train/test.

L'API di scikit-learn: fit, transform, predict è una lezione Python Academy gratuita su CoddyKit. Questa è la lezione 1 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento Python Academy, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso Python Academy include 4 lezioni in totale.

Che cos'è scikit-learn

scikit-learn è la libreria Python di riferimento per il machine learning classico. Fornisce un'API coerente: ogni stimatore ha fit() e la maggior parte ha predict() o transform().

from sklearn.linear_model import LinearRegression
import numpy as np

X = np.array([[1],[2],[3],[4],[5]])
y = np.array([2, 4, 6, 8, 10])

model = LinearRegression().fit(X, y)
print(model.predict([[6]]))   # [12.]

Suddivisione tra addestramento e test

Divida sempre i dati prima dell'addestramento per valutare quanto bene il modello generalizza a dati mai visti.

from sklearn.model_selection import train_test_split
import numpy as np

X = np.random.rand(100, 5)
y = (X[:,0] > 0.5).astype(int)

X_train, X_test, y_train, y_test = train_test_split(
    X, y, test_size=0.2, random_state=42
)
print(X_train.shape, X_test.shape)   # (80,5) (20,5)

fit() — Addestramento

estimator.fit(X, y) addestra il modello su X (caratteristiche) e y (etichette). Per i metodi non supervisionati, si passa solo X.

from sklearn.linear_model import LogisticRegression
from sklearn.datasets import make_classification

X, y = make_classification(n_samples=200, random_state=0)
model = LogisticRegression()
model.fit(X, y)
print("Trained:", model.classes_)

predict() e predict_proba()

predict(X) restituisce le etichette delle classi; predict_proba(X) restituisce le probabilità delle classi per i classificatori.

from sklearn.linear_model import LogisticRegression
from sklearn.datasets import make_classification

X, y = make_classification(random_state=0)
model = LogisticRegression().fit(X, y)

print(model.predict(X[:5]))          # [0 1 0 ...]
print(model.predict_proba(X[:2]))    # [[0.7 0.3] ...]

Trasformatori: fit e transform

I trasformatori (scaler, encoder) hanno fit(X) + transform(X). Esegua sempre il fit solo sui dati di addestramento, quindi applichi la trasformazione sia ai dati di addestramento sia a quelli di test.

from sklearn.preprocessing import StandardScaler
import numpy as np

X_train = np.array([[1,2],[3,4],[5,6]])
X_test  = np.array([[2,3],[4,5]])

scaler = StandardScaler()
X_train_s = scaler.fit_transform(X_train)   # fit + transform
X_test_s  = scaler.transform(X_test)        # transform only (using train stats)

Pipeline

Una Pipeline collega trasformatori e uno stimatore in un unico oggetto. Previene la fuga di dati applicando correttamente le trasformazioni durante la convalida incrociata.

from sklearn.pipeline import Pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.svm import SVC

pipe = Pipeline([
    ("scaler", StandardScaler()),
    ("clf", SVC())
])
pipe.fit(X_train, y_train)
print(pipe.score(X_test, y_test))

Accuratezza e altre metriche

Utilizzi accuracy_score, f1_score e classification_report per valutare i classificatori.

from sklearn.metrics import accuracy_score, classification_report

y_pred = model.predict(X_test)
print(accuracy_score(y_test, y_pred))
print(classification_report(y_test, y_pred))

Convalida incrociata

cross_val_score valuta un modello utilizzando la convalida incrociata k-fold senza dover suddividere manualmente i dati.

from sklearn.model_selection import cross_val_score
from sklearn.linear_model import LogisticRegression
from sklearn.datasets import make_classification

X, y = make_classification(random_state=0)
scores = cross_val_score(LogisticRegression(), X, y, cv=5)
print(f"CV scores: {scores.mean():.3f} ± {scores.std():.3f}")

Ottimizzazione degli iperparametri con GridSearchCV

GridSearchCV esplora esaustivamente una griglia di parametri utilizzando la convalida incrociata per trovare gli iperparametri migliori.

from sklearn.model_selection import GridSearchCV
from sklearn.svm import SVC
from sklearn.datasets import make_classification

X, y = make_classification(random_state=0)
param_grid = {"C": [0.1, 1, 10], "kernel": ["rbf", "linear"]}
gs = GridSearchCV(SVC(), param_grid, cv=5)
gs.fit(X, y)
print(gs.best_params_, gs.best_score_)

Pre-elaborazione: LabelEncoder e OneHotEncoder

Codifichi le etichette categoriali con LabelEncoder e le caratteristiche categoriali con OneHotEncoder o ColumnTransformer.

from sklearn.preprocessing import LabelEncoder, OneHotEncoder
import numpy as np

le = LabelEncoder()
print(le.fit_transform(["cat","dog","cat","fish"]))   # [0 1 0 2]

ohe = OneHotEncoder(sparse_output=False)
print(ohe.fit_transform([["red"],["green"],["blue"]]))

Salvataggio e caricamento dei modelli

Renda persistenti i modelli addestrati con joblib (più veloce di pickle per gli array NumPy).

import joblib
from sklearn.linear_model import LogisticRegression
from sklearn.datasets import make_classification

X, y = make_classification(random_state=0)
model = LogisticRegression().fit(X, y)

joblib.dump(model, "model.joblib")
loaded = joblib.load("model.joblib")
print(loaded.predict(X[:3]))

Verifica rapida

Perché dovrebbe chiamare scaler.fit() solo sui dati di addestramento e non sui dati di test?

Riepilogo

L'API uniforme di scikit-learn: fit() addestra, predict() esegue l'inferenza e transform() esegue la pre-elaborazione. Utilizzi Pipeline per concatenare i passaggi. Suddivida i dati con train_test_split, valuti con cross_val_score e ottimizzi con GridSearchCV.

Domande Frequenti

La lezione «L'API di scikit-learn: fit, transform, predict» è gratuita?

Sì — il testo completo di «L'API di scikit-learn: fit, transform, predict» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso Python Academy, passa a CoddyKit PRO. Il corso Python Academy include 4 lezioni in totale.

Cosa imparerò in «L'API di scikit-learn: fit, transform, predict»?

Comprenda l'interfaccia degli estimator e il flusso di lavoro della suddivisione train/test. Eserciti Python Academy con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare Python Academy?

Non è richiesta alcuna esperienza precedente. Python Academy su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 1 di 4.

Quanto tempo richiede la lezione «L'API di scikit-learn: fit, transform, predict»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione Python Academy?

Sì. Ogni lezione Python Academy include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. L'API di scikit-learn: fit, transform, predict
  2. Modelli lineari: regressione e classificazione
  3. Modelli basati su alberi: alberi decisionali e random forest
  4. Valutazione dei modelli e cross-validation
← Torna a Python Academy