Data Science Academy · Lektion

Random Forest för regression

Ensembler som står emot överanpassning

Lektion 4 av 413 steg

Random Forest för regression är en gratis lektion i Data Science Academy på CoddyKit. Detta är lektion 4 av 4. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för Data Science Academy, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i Data Science Academy innehåller totalt 4 lektioner.

Ett träd, många träd

Ett enskilt träd är instabilt och överanpassar. En random forest bygger hundratals träd och kombinerar dem till en stabilare prediktion. 🌲🌲

Kollektivets visdom

Varje träd gör sin egen gissning och skogen beräknar medelvärdet av dem. Individuella misstag tar ut varandra, vilket ger ett jämnare och mer tillförlitligt tal.

Olika rader för varje träd

Varje träd tränas på ett slumpmässigt urval av rader som dras med återläggning, ett knep som kallas bootstrapping. Det ger varje träd en något annorlunda bild.

Olika egenskaper vid varje uppdelning

Vid varje uppdelning ser trädet dessutom bara en slumpmässig delmängd av egenskaperna. Denna slumpmässighet hindrar träden från att bli likadana.

Varför variation hjälper

Variation är hela poängen: när träden gör olika slags misstag minskar medelvärdet de kraftiga svängningarna hos ett ensamt träd. Det sänker variansen.

Träna den på två rader

Samma kontrakt som alltid. Skapa en RandomForestRegressor, träna den och gör prediktioner utan någon extra ceremoni.

from sklearn.ensemble import RandomForestRegressor
model = RandomForestRegressor().fit(X, y)

Hur många träd

Inställningen n_estimators anger hur många träd som ska byggas. Fler träd hjälper vanligtvis, tills effekten planar ut, men träningen blir långsammare.

RandomForestRegressor(n_estimators=300)

Begränsa fortfarande djupet

Ni kan även begränsa varje träd med max_depth. Tillsammans med många träd förblir skogen träffsäker utan att memorera brus.

RandomForestRegressor(max_depth=8)

Inbyggd egenskapsvikt

En praktisk bonus är att skogen rapporterar feature_importances_, som rangordnar vilka indata som påverkade prediktionerna mest. Utmärkt för att förstå era data.

model.feature_importances_

Stark och förlåtande

Random forests är ett utmärkt standardval: träffsäkra, svåra att överanpassa och kräver lite finjustering. Ofta är de er första starka modell för tabulära data.

Kraftens pris

Kompromissen är tydlighet. Med hundratals träd förlorar ni den enkla, lättlästa vägen genom ett enskilt träd, så en skog är svårare att förklara.

Snabbkontroll

Vad gör att en skog slår ett enda träd?

Sammanfattning

En random forest beräknar medelvärdet av många varierade träd, minskar variansen och motverkar överanpassning. Ett starkt standardval som kräver lite finjustering för tabulära tal. 🎯

Gratis att börja

Lär dig Python med en AI-lärare – gratis

Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.

Kurser
30
Lektioner
120

Vanliga frågor

Är lektionen ”Random Forest för regression” gratis?

Ja – hela texten till ”Random Forest för regression” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i Data Science Academy, kan Ni uppgradera till CoddyKit PRO. Kursen i Data Science Academy innehåller totalt 4 lektioner.

Vad lär jag mig i ”Random Forest för regression”?

Ensembler som står emot överanpassning Ni övar på Data Science Academy med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.

Behöver jag någon erfarenhet för att börja lära mig Data Science Academy?

Du behöver inga förkunskaper. Utbildningen i Data Science Academy på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 4 av 4.

Hur lång tid tar lektionen ”Random Forest för regression”?

De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.

Kan jag skriva och köra kod i den här Data Science Academy-lektionen?

Ja. Varje Data Science Academy-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.

Alla lektioner i den här kursen

  1. Linjär regression i repris
  2. Ridge- och Lasso-regularisering
  3. Beslutsträdsregression
  4. Random Forest för regression
← Tillbaka till Data Science Academy