Lær AI med Python · Lektion

SVM'er til klassifikation med sklearn

SVC, LinearSVC, valg af kernel, class_weight='balanced', probability=True.

Lektion 3 af 413 trin

SVM'er til klassifikation med sklearn er en gratis Lær AI med Python-lektion på CoddyKit. Dette er lektion 3 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Lær AI med Python, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Lær AI med Python-kurset indeholder 4 lektioner i alt.

SVM'er i scikit-learn

scikit-learn tilbyder flere SVM-klassifikatorer. Den vigtigste er SVC, som understøtter lineære og kernebaserede grænser gennem parameteren kernel.

from sklearn.svm import SVC

model = SVC(kernel="rbf", C=1.0, gamma="scale")
model.fit(Xtr, ytr)
print(model.score(Xte, yte))

De centrale SVC-parametre

Tre parametre styrer SVC's funktion:

  • kernel typen af grænse (lineær, rbf, poly)
  • C fejlstraffen / regulariseringen
  • gamma kernebredden for rbf/poly
from sklearn.svm import SVC

model = SVC(kernel="rbf", C=10, gamma=0.1)

Skalér altid først

SVM'er er følsomme over for skala. Pak skaleringsmetoden og SVC ind i et behandlingsforløb, så skaleringen kun tilpasses på træningsdata, også under krydsvalidering.

from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.svm import SVC

pipe = make_pipeline(StandardScaler(), SVC(kernel="rbf"))
pipe.fit(Xtr, ytr)

LinearSVC til store datasæt

SVC(kernel="linear") skalerer dårligt til mange stikprøver. LinearSVC bruger en hurtigere løsningsalgoritme, der er optimeret til lineære problemer, og håndterer store data med mange dimensioner langt bedre.

from sklearn.svm import LinearSVC

model = LinearSVC(C=1.0, max_iter=5000)
model.fit(Xtr, ytr)

SVC eller LinearSVC

Brug LinearSVC til store eller sparsomme data (f.eks. tekst). Brug SVC, når du har brug for kerner til ikke-lineære grænser. Bemærk, at LinearSVC bruger en lidt anderledes tabsfunktion og mangler predict_proba.

Klasseubalance

Når en klasse er sjælden, har SVM'en tendens til at favorisere flertallet. Indstilling af class_weight="balanced" vægter automatisk klasserne omvendt proportionalt med deres hyppighed.

from sklearn.svm import SVC

model = SVC(kernel="rbf", class_weight="balanced")
model.fit(Xtr, ytr)

Brugerdefinerede klassevægte

Du kan også sende en eksplicit ordbog til class_weight for at vægte en bestemt klasse højere end ved den automatiske balancering.

from sklearn.svm import SVC

model = SVC(class_weight={0: 1, 1: 5})  # class 1 errors cost 5x

Sandsynlighedsestimater

Som standard returnerer SVC entydige etiketter. Sæt probability=True for at aktivere predict_proba (via intern kalibrering), hvilket er nødvendigt til ROC AUC og justering af tærskelværdier. Det gør træningen langsommere.

from sklearn.svm import SVC

model = SVC(probability=True)
model.fit(Xtr, ytr)
proba = model.predict_proba(Xte)[:, 1]

SVM'er til multiklasseklassifikation

SVC håndterer automatisk mere end to klasser ved hjælp af en én-mod-én-metode. Du behøver ikke ændre din kode; træn blot med multiklasseetiketter, så fungerer det.

from sklearn.svm import SVC

model = SVC(decision_function_shape="ovr")
model.fit(X_multiclass, y_multiclass)

Justering af C og gamma med GridSearchCV

Den almindelige fremgangsmåde er en gitter-søgning over C og gamma på en logaritmisk skala, alt sammen i et skaleringsforløb.

from sklearn.model_selection import GridSearchCV
from sklearn.pipeline import make_pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.svm import SVC

pipe = make_pipeline(StandardScaler(), SVC(kernel="rbf"))
param = {
    "svc__C": [0.1, 1, 10, 100],
    "svc__gamma": [0.001, 0.01, 0.1, 1],
}
gs = GridSearchCV(pipe, param, cv=5, scoring="f1")
gs.fit(Xtr, ytr)
print(gs.best_params_)

Praktiske råd

SVM'er fungerer bedst på små til mellemstore datasæt med tydelige marginer. De har det svært med meget store datasæt (brug LinearSVC, eller skift til boosting). Skalér altid, justér C og gamma, og brug class_weight ved ubalancerede klasser.

Hurtig test

Test din viden om sklearn-SVM'er.

Opsummering

Opsummering: Brug SVC med kernel, C og gamma til ikke-lineær klassifikation, altid i et skaleringsforløb. Skift til LinearSVC ved store datasæt eller tekstdata. Håndtér ubalancerede klasser med class_weight="balanced", og justér C og gamma samlet med GridSearchCV.

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
53
Lektioner
225

Ofte stillede spørgsmål

Er lektionen “SVM'er til klassifikation med sklearn” gratis?

Ja — alle 3 lektioner i læringssporet Lær AI med Python, inklusive “SVM'er til klassifikation med sklearn”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Lær AI med Python-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “SVM'er til klassifikation med sklearn”?

SVC, LinearSVC, valg af kernel, class_weight='balanced', probability=True. Du øver dig i Lær AI med Python med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Lær AI med Python?

Der kræves ingen tidligere erfaring. Lær AI med Python på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 3 af 4.

Hvor lang tid tager lektionen “SVM'er til klassifikation med sklearn”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Lær AI med Python-lektion?

Ja. Alle Lær AI med Python-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. SVM-teori: marginer og supportvektorer
  2. Kernel-tricket: RBF, polynomiel og sigmoid
  3. SVM'er til klassifikation med sklearn
  4. SVM'er til regression (SVR)
← Tilbage til Lær AI med Python