Lær AI med Python · Lektion

Gradient boosting: GBM og XGBoost

Boosting sammenlignet med bagging, GradientBoostingClassifier, XGBClassifier og early stopping.

Lektion 3 af 413 trin

Gradient boosting: GBM og XGBoost er en gratis Lær AI med Python-lektion på CoddyKit. Dette er lektion 3 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Lær AI med Python, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Lær AI med Python-kurset indeholder 4 lektioner i alt.

Boosting kontra bagging

Bagging træner træer parallelt og tager gennemsnittet af dem. Boosting træner træer sekventielt, hvor hvert nyt træ korrigerer fejlene fra de tidligere træer.

Boosting reducerer bias og giver ofte højere nøjagtighed end bagging på strukturerede data.

Sekventielle svage læringsmodeller

Gradientbaseret boosting opbygger en ensemblemodel af lave træer (svage læringsmodeller). Hvert træ tilpasses residualerne (gradienterne af tabet), som den aktuelle ensemblemodel har efterladt.

Ved at tilføje mange små korrektioner opbygges en stærk samlet model.

GradientBoostingClassifier

Scikit-learn indeholder GradientBoostingClassifier. Vigtige parametre er n_estimators (antal træer), learning_rate (nedskalering) og max_depth (træets størrelse).

from sklearn.ensemble import GradientBoostingClassifier

gbm = GradientBoostingClassifier(
    n_estimators=200,
    learning_rate=0.1,
    max_depth=3,
    random_state=0,
)
gbm.fit(Xtr, ytr)
print(gbm.score(Xte, yte))

Afvejningen ved læringsraten

learning_rate skalerer hvert træs bidrag. En lavere læringsrate kræver flere træer, men generaliserer normalt bedre.

En almindelig strategi er at vælge en lav læringsrate (f.eks. 0.05) og mange træer og derefter bruge et tidligt stop.

from sklearn.ensemble import GradientBoostingClassifier

gbm = GradientBoostingClassifier(
    n_estimators=1000,
    learning_rate=0.05,
    max_depth=3,
)

Hvorfor max_depth forbliver lav

I boosting er hvert træ en svag læringsmodel, så max_depth er normalt 3 til 6. Dybe træer ville hurtigt overtilpasse residualerne. Ensemblemodellen bliver stærk gennem mange lave træer, ikke gennem nogle få dybe træer.

Introduktion til XGBoost

XGBoost er et optimeret bibliotek til gradientbaseret boosting: hurtigere, regulariseret og med indbygget håndtering af manglende værdier. Det præsterer blandt de bedste i konkurrencer i maskinlæring med tabeldata.

from xgboost import XGBClassifier

model = XGBClassifier(
    n_estimators=300,
    learning_rate=0.1,
    max_depth=4,
    random_state=0,
)
model.fit(Xtr, ytr)
print(model.score(Xte, yte))

Vigtige XGBoost-parametre

De vigtigste parametre svarer til GBM:

  • n_estimators antal boosting-runder
  • learning_rate nedskalering pr. runde
  • max_depth trædybde
  • subsample og colsample_bytree tilføjer tilfældighed som regularisering
from xgboost import XGBClassifier

model = XGBClassifier(
    n_estimators=500,
    learning_rate=0.05,
    max_depth=4,
    subsample=0.8,
    colsample_bytree=0.8,
)

Regularisering i XGBoost

XGBoost tilføjer L1 (reg_alpha)- og L2- (reg_lambda)-straffe samt gamma (den mindste tabreduktion for at foretage en opdeling). Disse styrer kompleksiteten og reducerer overtilpasning ud over det, almindelig GBM tilbyder.

from xgboost import XGBClassifier

model = XGBClassifier(
    reg_alpha=0.1,
    reg_lambda=1.0,
    gamma=0.1,
)

Tidligt stop

early_stopping_rounds standser træningen, når valideringsmetrikken ikke længere forbedres i N runder. Det finder automatisk det rette antal træer og forhindrer overtilpasning.

from xgboost import XGBClassifier

model = XGBClassifier(
    n_estimators=2000,
    learning_rate=0.05,
    early_stopping_rounds=50,
    eval_metric="logloss",
)
model.fit(Xtr, ytr, eval_set=[(Xte, yte)], verbose=False)
print("Best iteration:", model.best_iteration)

Aflæsning af egenskabernes betydning

XGBoost stiller feature_importances_ og den mere detaljerede get_booster().get_score() til rådighed med betydningstyper som gevinst og vægt. Gevinst afspejler, hvor meget en egenskab forbedrede tabet.

model = XGBClassifier(n_estimators=200).fit(Xtr, ytr)
print(model.feature_importances_)

booster = model.get_booster()
print(booster.get_score(importance_type="gain"))

Hvornår du bør vælge boosting

Gradientbaseret boosting slår ofte tilfældige skove på tabeldata, når det er indstillet korrekt. Ulempen er større følsomhed over for hyperparametre og langsommere sekventiel træning. Start med XGBoosts standardindstillinger, juster derefter learning_rate og max_depth, og brug et tidligt stop.

Hurtig kontrol

Test din viden om boosting.

Opsummering

Opsummering: Boosting træner træer sekventielt, hvor hvert træ retter tidligere fejl. Juster n_estimators, learning_rate (lav rate + mange træer) og en lav max_depth. XGBoost tilføjer regularisering (reg_alpha, reg_lambda, gamma) og early_stopping_rounds for automatisk at vælge det optimale antal træer.

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
53
Lektioner
225

Ofte stillede spørgsmål

Er lektionen “Gradient boosting: GBM og XGBoost” gratis?

Ja — alle 3 lektioner i læringssporet Lær AI med Python, inklusive “Gradient boosting: GBM og XGBoost”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Lær AI med Python-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Gradient boosting: GBM og XGBoost”?

Boosting sammenlignet med bagging, GradientBoostingClassifier, XGBClassifier og early stopping. Du øver dig i Lær AI med Python med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Lær AI med Python?

Der kræves ingen tidligere erfaring. Lær AI med Python på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 3 af 4.

Hvor lang tid tager lektionen “Gradient boosting: GBM og XGBoost”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Lær AI med Python-lektion?

Ja. Alle Lær AI med Python-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Beslutningstræer: teori og implementering
  2. Random forests og bagging
  3. Gradient boosting: GBM og XGBoost
  4. LightGBM og CatBoost
← Tilbage til Lær AI med Python