Het concept van de Q-tabel
Reinforcement learning op basis van tabellen
Het concept van de Q-tabel is een gratis Python Academy-les op CoddyKit. Dit is les 2 van 5. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Python Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Python Academy bevat in totaal 5 lessen.
Wat is een Q-tabel?
Concept van de Q-tabel
De Q-tabel is een kernconcept in versterkingsleren. Het is een opzoektabel waarin elke vermelding de verwachte beloning weergeeft voor het uitvoeren van een bepaalde actie in een bepaalde toestand.
Het doel is om de Q-waarden te leren, die de agent aansturen om de beste acties te kiezen voor maximale beloningen.

Structuur van een Q-tabel
De Q-tabel is als volgt opgebouwd:
- Rijen: Geven de toestanden van de omgeving weer.
- Kolommen: Geven de acties weer die voor de agent beschikbaar zijn.
- Waarden: Geven de Q-waarde voor toestand-actieparen weer.
De agent werkt deze waarden tijdens het leren bij.
Formule voor het bijwerken van Q-waarden
Q-waarden worden bijgewerkt met de vergelijking van Bellman:
Q(s, a) = Q(s, a) + α [r + γ max(Q(s', a')) - Q(s, a)]
Waarbij:
- s: Huidige toestand
- a: Huidige actie
- r: Beloning voor de actie
- s': Volgende toestand
- α: Leersnelheid
- γ: Disconteringsfactor
Voorbeeld van een eenvoudige Q-tabel
Bekijk een Q-tabel voor een rasterwereld:
Toestanden: Rasterposities, bijvoorbeeld A1 en B1
Acties: Omhoog, omlaag, links of rechts bewegen
In eerste instantie zijn alle Q-waarden ingesteld op nul:
| Toestand | Omhoog | Omlaag | Links | Rechts |
|---|---|---|---|---|
| A1 | 0 | 0 | 0 | 0 |
| B1 | 0 | 0 | 0 | 0 |
Een Q-tabel initialiseren in Python
We kunnen een Q-tabel weergeven met een NumPy-array of een woordenboek:
import numpy as np
# Example: Q-Table for 5 states and 4 actions
num_states = 5
num_actions = 4
q_table = np.zeros((num_states, num_actions))
print("Initial Q-Table:")
print(q_table)Verkenning in Q-leren
De agent gebruikt een ε-gretig beleid om verkenning en exploitatie in balans te brengen:
- Kies met waarschijnlijkheid ε een willekeurige actie (verkenning).
- Kies met waarschijnlijkheid 1-ε de actie met de hoogste Q-waarde (exploitatie).
Voordelen van Q-tabellen
Q-tabellen zijn eenvoudig en effectief voor kleine omgevingen. Hun voordelen zijn onder andere:
- Eenvoudige implementatie en foutopsporing.
- Duidelijke interpretatie van relaties tussen toestanden en acties.
- Lage berekeningskosten voor kleine toestands-actieruimten.
Beperkingen van Q-tabellen
Q-tabellen hebben enkele beperkingen:
- Niet schaalbaar voor omgevingen met grote toestand-actieruimten.
- Vereisen veel geheugen voor problemen met veel dimensies.
- Kunnen niet generaliseren over vergelijkbare toestanden.
Samenvatting en volgende stappen
In deze les hebben we:
- Het concept van de Q-tabel en de structuur ervan geleerd.
- Onderzocht hoe Q-waarden worden bijgewerkt met de Bellman-vergelijking.
- De voordelen en beperkingen van Q-tabellen besproken.
Vervolgens implementeren we een eenvoudig Q-Learning-algoritme in Python om Q-tabellen in actie te zien.

Leer Python met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 76
- Lessen
- 320
Veelgestelde vragen
Is de les “Het concept van de Q-tabel” gratis?
Ja — de volledige tekst van “Het concept van de Q-tabel” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus Python Academy wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus Python Academy bevat in totaal 5 lessen.
Wat leer ik in “Het concept van de Q-tabel”?
Reinforcement learning op basis van tabellen Je oefent met Python Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met Python Academy te beginnen?
Ervaring vooraf is niet nodig. Python Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 2 van 5.
Hoe lang duurt de les “Het concept van de Q-tabel”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over Python Academy?
Ja. Elke les over Python Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Basisconcepten van reinforcement learning
- Het concept van de Q-tabel
- Een Q-tabel implementeren in Python
- Deep Q-learning
- OpenAI Gym verkennen