Python Academy · leksjon

Grunnleggende konsepter i forsterkningslæring

Agent, miljø, belønninger og straffer

Leksjon 1 av 510 trinn

Grunnleggende konsepter i forsterkningslæring er en gratis leksjon i Python Academy på CoddyKit. Dette er leksjon 1 av 5. Du kan lese hele leksjonen gratis nedenfor – og deretter øve praktisk i nettleseren med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i Python Academy, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i Python Academy inneholder totalt 5 leksjoner.

Hva er forsterkende læring?

Grunnleggende konsepter innen forsterkende læring

Forsterkende læring (RL) er en type maskinlæring der en agent lærer å ta beslutninger ved å samhandle med et miljø. Målet er å maksimere belønningene over tid.

Viktige komponenter i RL omfatter agenter, miljøer, belønninger og straffer.

Grunnleggende konsepter i forsterkningslæring — illustrasjon 1

Viktige begreper i RL

Viktige begreper innen forsterkende læring:

  • Agent: Den som tar beslutningene (for eksempel en robot eller programvare).
  • Miljø: Systemet agenten samhandler med.
  • Tilstand: Miljøets nåværende situasjon.
  • Handling: Beslutningen agenten tar.
  • Belønning: Tilbakemelding fra miljøet på en handling.

Samhandling mellom agent og miljø

Samhandlingen mellom agenten og miljøet kan oppsummeres slik:

  1. Agenten observerer miljøets nåværende tilstand.
  2. Agenten utfører en handling basert på en policy.
  3. Miljøet går over i en ny tilstand og gir en belønning.

Denne løkken fortsetter til en slutt- eller terminaltilstand nås.

Belønninger og straffer

Belønninger er tilbakemeldingen agenten får for handlingene sine. Målet er å maksimere den kumulative belønningen over tid. Straffer er negative belønninger som motvirker uønskede handlinger.

For eksempel:

  • Belønning: +10 for å nå et mål.
  • Straff: -5 for å treffe et hinder.

Policyer i RL

En policy er en strategi agenten bruker til å bestemme handlinger basert på den nåværende tilstanden.

Typer policyer:

  • Deterministisk: Velger alltid den samme handlingen for en gitt tilstand.
  • Stokastisk: Velger handlinger sannsynlighetsbasert.

Utforskning kontra utnyttelse

Agenten står overfor en avveining mellom:

  • Utforskning: Å prøve nye handlinger for å lære mer om miljøet.
  • Utnyttelse: Å velge handlinger som gir den høyeste kjente belønningen.

Det er avgjørende å balansere disse for å oppnå effektiv læring.

Markovs beslutningsprosess (MDP)

Problemer innen forsterkende læring modelleres ofte som en MDP, som defineres av:

  • Tilstander (S): Mulige konfigurasjoner av miljøet.
  • Handlinger (A): Valg som er tilgjengelige for agenten.
  • Belønninger (R): Tilbakemelding på handlinger.
  • Overgangssannsynligheter (P): Sannsynligheten for å gå mellom tilstander.

Utfordringer ved forsterkende læring

Forsterkende læring har noen utfordringer:

  • Forsinkede belønninger: Belønninger kan mottas etter flere handlinger.
  • Sparsomme belønninger: Belønninger kan forekomme sjelden.
  • Høy dimensjonalitet: Komplekse miljøer med mange tilstander og handlinger.

Oppsummering og neste trinn

I denne leksjonen har vi:

  • Utforsket de grunnleggende konseptene innen forsterkende læring, inkludert agenter, miljøer og belønninger.
  • Sett på policyer, utforskning kontra utnyttelse og MDP-er.
  • Lært om utfordringene ved RL.

Deretter skal vi gå nærmere inn på Q-tabell-konseptet, en grunnleggende tilnærming til forsterkende læring.

Grunnleggende konsepter i forsterkningslæring — illustrasjon 10
Gratis å komme i gang

Lær deg Python med en AI-veileder – gratis

Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.

Kurs
76
Leksjoner
320

Ofte stilte spørsmål

Er leksjonen «Grunnleggende konsepter i forsterkningslæring» gratis?

Ja – hele teksten i «Grunnleggende konsepter i forsterkningslæring» er gratis å lese her på nettet. For å øve interaktivt med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt, og for å låse opp resten av Python Academy-kurset, kan du oppgradere til CoddyKit PRO. Kurset i Python Academy inneholder totalt 5 leksjoner.

Hva lærer jeg i «Grunnleggende konsepter i forsterkningslæring»?

Agent, miljø, belønninger og straffer Du øver på Python Academy med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.

Trenger jeg erfaring for å begynne med Python Academy?

Ingen tidligere erfaring er nødvendig. Python Academy på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 1 av 5.

Hvor lang tid tar leksjonen «Grunnleggende konsepter i forsterkningslæring»?

De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.

Kan jeg skrive og kjøre kode i denne Python Academy-leksjonen?

Ja. Alle Python Academy-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.

Alle leksjonene i dette kurset

  1. Grunnleggende konsepter i forsterkningslæring
  2. Q-tabell-konseptet
  3. Implementering av Q-tabell i Python
  4. Deep Q-learning
  5. Utforsk OpenAI Gym
← Tilbake til Python Academy