Grundlæggende koncepter i reinforcement learning
Agent, miljø, belønninger og straffe
Grundlæggende koncepter i reinforcement learning er en gratis Python Academy-lektion på CoddyKit. Dette er lektion 1 af 5. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i Python Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Python Academy-kurset indeholder 5 lektioner i alt.
Hvad er forstærkende læring?
Grundlæggende begreber i forstærkende læring
Forstærkende læring (RL) er en form for maskinlæring, hvor en agent lærer at træffe beslutninger ved at interagere med et miljø. Målet er at maksimere belønningerne over tid.
De vigtigste komponenter i RL omfatter agenter, miljøer, belønninger og straffe.

Vigtig terminologi i RL
Vigtige begreber inden for forstærkende læring:
- Agent: Den instans, der træffer beslutninger (f.eks. en robot eller software).
- Miljø: Det system, agenten interagerer med.
- Tilstand: Miljøets aktuelle situation.
- Handling: Den beslutning, agenten træffer.
- Belønning: Feedback fra miljøet for en handling.
Interaktion mellem agent og miljø
Interaktionen mellem agenten og miljøet kan opsummeres sådan:
- Agenten observerer miljøets aktuelle tilstand.
- Agenten udfører en handling baseret på en politik.
- Miljøet går over i en ny tilstand og giver en belønning.
Denne løkke fortsætter, indtil en sluttilstand nås.
Belønninger og straffe
Belønninger er den feedback, agenten får for sine handlinger. Målet er at maksimere den kumulerede belønning over tid. Straffe er negative belønninger, der modvirker uønskede handlinger.
For eksempel:
- Belønning: +10 for at nå et mål.
- Straf: -5 for at ramme en forhindring.
Politikker i RL
En politik er en strategi, som agenten bruger til at vælge handlinger ud fra den aktuelle tilstand.
Typer af politikker:
- Deterministisk: Vælger altid den samme handling for en given tilstand.
- Stokastisk: Vælger handlinger ud fra sandsynligheder.
Udforskning over for udnyttelse
Agenten står over for en afvejning mellem:
- Udforskning: At prøve nye handlinger for at lære mere om miljøet.
- Udnyttelse: At vælge de handlinger, der giver den højeste kendte belønning.
Det er afgørende at finde en balance mellem disse for at opnå effektiv indlæring.
Markovs beslutningsproces (MDP)
Problemer inden for forstærkende læring modelleres ofte som en MDP, der defineres af:
- Tilstande (S): Mulige konfigurationer af miljøet.
- Handlinger (A): Valgmuligheder, der er tilgængelige for agenten.
- Belønninger (R): Feedback for handlinger.
- Overgangssandsynligheder (P): Sandsynligheden for at bevæge sig mellem tilstande.
Udfordringer ved forstærkende læring
Forstærkende læring har nogle udfordringer:
- Forsinkede belønninger: Belønninger kan modtages efter flere handlinger.
- Sparsomme belønninger: Belønninger kan forekomme sjældent.
- Høj dimensionalitet: Komplekse miljøer med mange tilstande og handlinger.
Opsummering og næste trin
I denne lektion:
- Undersøgte vi de grundlæggende begreber i forstærkende læring, herunder agenter, miljøer og belønninger.
- Diskuterede vi politikker, udforskning over for udnyttelse samt MDP'er.
- Lærte vi om udfordringerne ved RL.
Derefter går vi i dybden med begrebet Q-tabel, som er en grundlæggende tilgang til forstærkende læring.

Lær Python med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 76
- Lektioner
- 320
Ofte stillede spørgsmål
Er lektionen “Grundlæggende koncepter i reinforcement learning” gratis?
Ja — hele teksten til “Grundlæggende koncepter i reinforcement learning” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af Python Academy-kurset, skal du opgradere til CoddyKit PRO. Python Academy-kurset indeholder 5 lektioner i alt.
Hvad lærer jeg i “Grundlæggende koncepter i reinforcement learning”?
Agent, miljø, belønninger og straffe Du øver dig i Python Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på Python Academy?
Der kræves ingen tidligere erfaring. Python Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 1 af 5.
Hvor lang tid tager lektionen “Grundlæggende koncepter i reinforcement learning”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne Python Academy-lektion?
Ja. Alle Python Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- Grundlæggende koncepter i reinforcement learning
- Q-tabel-konceptet
- Implementering af Q-tabel i Python
- Deep Q-learning
- Udforskning af OpenAI Gym