Q-tabel-konceptet
Tabelbaseret reinforcement learning
Q-tabel-konceptet er en gratis Python Academy-lektion på CoddyKit. Dette er lektion 2 af 5. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i Python Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Python Academy-kurset indeholder 5 lektioner i alt.
Hvad er en Q-tabel?
Begrebet Q-tabel
Q-tabellen er et centralt begreb inden for forstærkende læring. Det er en opslagstabel, hvor hver post repræsenterer den forventede belønning ved at udføre en bestemt handling i en given tilstand.
Målet er at lære Q-værdierne, som hjælper agenten med at vælge de bedste handlinger for at opnå maksimale belønninger.

Q-tabellens struktur
Q-tabellen er struktureret sådan:
- Rækker: Repræsenterer miljøets tilstande.
- Kolonner: Repræsenterer de handlinger, der er tilgængelige for agenten.
- Værdier: Repræsenterer Q-værdien for tilstands-handlingspar.
Agenten opdaterer disse værdier under indlæringen.
Formel til opdatering af Q-værdier
Q-værdier opdateres ved hjælp af Bellman-ligningen:
Q(s, a) = Q(s, a) + α [r + γ max(Q(s', a')) - Q(s, a)]
Hvor:
- s: Aktuel tilstand
- a: Aktuel handling
- r: Belønning for handlingen
- s': Næste tilstand
- α: Indlæringshastighed
- γ: Diskonteringsfaktor
Eksempel på en enkel Q-tabel
Se på en Q-tabel for en gitterverden:
Tilstande: Gitterpositioner (f.eks. A1, B1)
Handlinger: Bevæg op, ned, til venstre eller til højre
Oprindeligt er alle Q-værdier sat til nul:
| Tilstand | Op | Ned | Venstre | Højre |
|---|---|---|---|---|
| A1 | 0 | 0 | 0 | 0 |
| B1 | 0 | 0 | 0 | 0 |
Initialisering af en Q-tabel i Python
Vi kan repræsentere en Q-tabel ved hjælp af et NumPy-array eller en ordbog:
import numpy as np
# Example: Q-Table for 5 states and 4 actions
num_states = 5
num_actions = 4
q_table = np.zeros((num_states, num_actions))
print("Initial Q-Table:")
print(q_table)Udforskning i Q-læring
Agenten bruger en ε-grådig politik til at afveje udforskning og udnyttelse:
- Med sandsynligheden ε vælges en tilfældig handling (udforskning).
- Med sandsynligheden 1-ε vælges den handling, der har den højeste Q-værdi (udnyttelse).
Fordele ved Q-tabeller
Q-tabeller er enkle og effektive i små miljøer. Deres fordele omfatter:
- Nem implementering og fejlfinding.
- Tydelig fortolkning af forholdet mellem tilstande og handlinger.
- Lav beregningsomkostning i små tilstands-handlingsrum.
Begrænsninger ved Q-tabeller
Q-tabeller har nogle begrænsninger:
- De kan ikke skaleres til miljøer med store tilstands-handlingsrum.
- De kræver betydelig hukommelse til problemer med mange dimensioner.
- De kan ikke generalisere på tværs af lignende tilstande.
Opsummering og næste trin
I denne lektion:
- Lærte du om Q-tabelbegrebet og dets struktur.
- Undersøgte du, hvordan Q-værdier opdateres ved hjælp af Bellman-ligningen.
- Gennemgik du fordelene og begrænsningerne ved Q-tabeller.
Derefter implementerer du en simpel Q-learning-algoritme i Python for at se Q-tabeller i praksis.

Lær Python med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 76
- Lektioner
- 320
Ofte stillede spørgsmål
Er lektionen “Q-tabel-konceptet” gratis?
Ja — hele teksten til “Q-tabel-konceptet” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af Python Academy-kurset, skal du opgradere til CoddyKit PRO. Python Academy-kurset indeholder 5 lektioner i alt.
Hvad lærer jeg i “Q-tabel-konceptet”?
Tabelbaseret reinforcement learning Du øver dig i Python Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på Python Academy?
Der kræves ingen tidligere erfaring. Python Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 2 af 5.
Hvor lang tid tager lektionen “Q-tabel-konceptet”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne Python Academy-lektion?
Ja. Alle Python Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- Grundlæggende koncepter i reinforcement learning
- Q-tabel-konceptet
- Implementering af Q-tabel i Python
- Deep Q-learning
- Udforskning af OpenAI Gym