Q-tabell-konseptet
Tabellbasert forsterkningslæring
Q-tabell-konseptet er en gratis leksjon i Python Academy på CoddyKit. Dette er leksjon 2 av 5. Du kan lese hele leksjonen gratis nedenfor – og deretter øve praktisk i nettleseren med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i Python Academy, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i Python Academy inneholder totalt 5 leksjoner.
Hva er en Q-tabell?
Q-tabell-konseptet
Q-tabellen er et sentralt konsept innen forsterkende læring. Det er en oppslagstabell der hver oppføring representerer den forventede belønningen for å utføre en bestemt handling i en gitt tilstand.
Målet er å lære Q-verdiene, som veileder agenten til å utføre de beste handlingene for å oppnå maksimale belønninger.

Strukturen til en Q-tabell
Q-tabellen er strukturert slik:
- Rader: Representerer miljøets tilstander.
- Kolonner: Representerer handlingene som er tilgjengelige for agenten.
- Verdier: Representerer Q-verdien for tilstands-handlingspar.
Agenten oppdaterer disse verdiene under læringen.
Formel for oppdatering av Q-verdi
Q-verdier oppdateres ved hjelp av Bellman-ligningen:
Q(s, a) = Q(s, a) + α [r + γ max(Q(s', a')) - Q(s, a)]
Der:
- s: Nåværende tilstand
- a: Nåværende handling
- r: Belønning for handlingen
- s': Neste tilstand
- α: Læringsrate
- γ: Diskonteringsfaktor
Eksempel på en enkel Q-tabell
Se for deg en Q-tabell for en rutenettverden:
Tilstander: Rutenettposisjoner (for eksempel A1, B1)
Handlinger: Gå opp, ned, til venstre eller til høyre
I utgangspunktet settes alle Q-verdier til null:
| Tilstand | Opp | Ned | Venstre | Høyre |
|---|---|---|---|---|
| A1 | 0 | 0 | 0 | 0 |
| B1 | 0 | 0 | 0 | 0 |
Initialisere en Q-tabell i Python
Vi kan representere en Q-tabell ved hjelp av en NumPy-matrise eller en ordbok:
import numpy as np
# Example: Q-Table for 5 states and 4 actions
num_states = 5
num_actions = 4
q_table = np.zeros((num_states, num_actions))
print("Initial Q-Table:")
print(q_table)Utforskning i Q-læring
Agenten bruker en ε-greedy-policy for å balansere utforskning og utnyttelse:
- Med sannsynlighet ε velges en tilfeldig handling (utforskning).
- Med sannsynlighet 1-ε velges handlingen med den høyeste Q-verdien (utnyttelse).
Fordeler med Q-tabeller
Q-tabeller er enkle og effektive i små miljøer. Fordelene omfatter:
- Enkel implementering og feilsøking.
- Tydelig tolkning av forholdet mellom tilstander og handlinger.
- Lav beregningskostnad for små tilstands- og handlingsrom.
Begrensninger ved Q-tabeller
Q-tabeller har noen begrensninger:
- Skalerer ikke til miljøer med store tilstands- og handlingsrom.
- Krever betydelig minne for problemer med mange dimensjoner.
- Kan ikke generalisere på tvers av lignende tilstander.
Oppsummering og neste steg
I denne leksjonen:
- lærte vi om Q-tabell-konseptet og strukturen til Q-tabellen.
- utforsket vi hvordan Q-verdier oppdateres ved hjelp av Bellman-ligningen.
- diskuterte vi fordelene og begrensningene ved Q-tabeller.
Deretter skal vi implementere en enkel Q-Learning-algoritme i Python for å se Q-tabeller i praksis.

Lær deg Python med en AI-veileder – gratis
Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.
- Kurs
- 76
- Leksjoner
- 320
Ofte stilte spørsmål
Er leksjonen «Q-tabell-konseptet» gratis?
Ja – hele teksten i «Q-tabell-konseptet» er gratis å lese her på nettet. For å øve interaktivt med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt, og for å låse opp resten av Python Academy-kurset, kan du oppgradere til CoddyKit PRO. Kurset i Python Academy inneholder totalt 5 leksjoner.
Hva lærer jeg i «Q-tabell-konseptet»?
Tabellbasert forsterkningslæring Du øver på Python Academy med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.
Trenger jeg erfaring for å begynne med Python Academy?
Ingen tidligere erfaring er nødvendig. Python Academy på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 2 av 5.
Hvor lang tid tar leksjonen «Q-tabell-konseptet»?
De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.
Kan jeg skrive og kjøre kode i denne Python Academy-leksjonen?
Ja. Alle Python Academy-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.
Alle leksjonene i dette kurset
- Grunnleggende konsepter i forsterkningslæring
- Q-tabell-konseptet
- Implementering av Q-tabell i Python
- Deep Q-learning
- Utforsk OpenAI Gym