Grundläggande begrepp inom förstärkningsinlärning
Agent, miljö, belöningar och bestraffningar.
Grundläggande begrepp inom förstärkningsinlärning är en gratis lektion i Python Academy på CoddyKit. Detta är lektion 1 av 5. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för Python Academy, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i Python Academy innehåller totalt 5 lektioner.
Vad är förstärkningsinlärning?
Grundläggande begrepp inom förstärkningsinlärning
Förstärkningsinlärning (RL) är en typ av maskininlärning där en agent lär sig att fatta beslut genom att interagera med en miljö. Målet är att maximera belöningar över tid.
Viktiga komponenter i förstärkningsinlärning är agenter, miljöer, belöningar och bestraffningar.

Viktig terminologi inom RL
Viktiga termer inom förstärkningsinlärning:
- Agent: Beslutsfattaren (t.ex. en robot eller programvara).
- Miljö: Systemet som agenten interagerar med.
- Tillstånd: Miljöns aktuella situation.
- Handling: Beslutet som agenten fattar.
- Belöning: Återkoppling från miljön för en handling.
Interaktion mellan agent och miljö
Interaktionen mellan agent och miljö kan sammanfattas så här:
- Agenten observerar miljöns aktuella tillstånd.
- Agenten utför en handling baserat på en policy.
- Miljön övergår till ett nytt tillstånd och ger en belöning.
Denna loop fortsätter tills ett terminalt tillstånd nås.
Belöningar och bestraffningar
Belöningar är den återkoppling agenten får för sina handlingar. Målet är att maximera den kumulativa belöningen över tid. Bestraffningar är negativa belöningar som motverkar oönskade handlingar.
Till exempel:
- Belöning: +10 för att nå ett mål.
- Bestraffning: -5 för att träffa ett hinder.
Policyer inom RL
En policy är en strategi som agenten använder för att välja handlingar baserat på det aktuella tillståndet.
Typer av policyer:
- Deterministisk: Väljer alltid samma handling för ett givet tillstånd.
- Stokastisk: Väljer handlingar utifrån sannolikheter.
Utforskning kontra exploatering
Agenten måste hantera en avvägning mellan:
- Utforskning: Testa nya handlingar för att lära sig mer om miljön.
- Exploatering: Välja handlingar som ger den högsta hittills kända belöningen.
Att balansera dessa är avgörande för effektiv inlärning.
Markovs beslutsprocess (MDP)
Problem inom förstärkningsinlärning modelleras ofta som en MDP, som definieras av:
- Tillstånd (S): Möjliga konfigurationer hos miljön.
- Handlingar (A): Val som är tillgängliga för agenten.
- Belöningar (R): Återkoppling för handlingar.
- Övergångssannolikheter (P): Sannolikheten för att förflytta sig mellan tillstånd.
Utmaningar inom förstärkningsinlärning
Förstärkningsinlärning medför vissa utmaningar:
- Fördröjda belöningar: Belöningar kan tas emot efter flera handlingar.
- Glesa belöningar: Belöningar kan förekomma sällan.
- Hög dimensionalitet: Komplexa miljöer med många tillstånd och handlingar.
Sammanfattning och nästa steg
I den här lektionen:
- Utforskade vi grundläggande begrepp inom förstärkningsinlärning, inklusive agenter, miljöer och belöningar.
- Diskuterade vi policyer, utforskning kontra exploatering samt MDP:er.
- Lärde vi oss om utmaningarna inom RL.
Härnäst går vi igenom konceptet Q-tabell, en grundläggande metod inom förstärkningsinlärning.

Lär dig Python med en AI-lärare – gratis
Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.
- Kurser
- 76
- Lektioner
- 320
Vanliga frågor
Är lektionen ”Grundläggande begrepp inom förstärkningsinlärning” gratis?
Ja – hela texten till ”Grundläggande begrepp inom förstärkningsinlärning” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i Python Academy, kan Ni uppgradera till CoddyKit PRO. Kursen i Python Academy innehåller totalt 5 lektioner.
Vad lär jag mig i ”Grundläggande begrepp inom förstärkningsinlärning”?
Agent, miljö, belöningar och bestraffningar. Ni övar på Python Academy med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.
Behöver jag någon erfarenhet för att börja lära mig Python Academy?
Du behöver inga förkunskaper. Utbildningen i Python Academy på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 1 av 5.
Hur lång tid tar lektionen ”Grundläggande begrepp inom förstärkningsinlärning”?
De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.
Kan jag skriva och köra kod i den här Python Academy-lektionen?
Ja. Varje Python Academy-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.
Alla lektioner i den här kursen
- Grundläggande begrepp inom förstärkningsinlärning
- Q-tabellens koncept
- Implementera en Q-tabell i Python
- Deep Q-learning
- Utforska OpenAI Gym