Leer AI met Python · Les

Het Q-Table-concept

Reinforcement learning op basis van tabellen.

Les 2 van 510 stappen

Het Q-Table-concept is een gratis Leer AI met Python-les op CoddyKit. Dit is les 2 van 5. Je kunt 3 lessen uit dit leerpad gratis volledig lezen — daarna ontgrendelt CoddyKit PRO alle lessen, plus praktische oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Leer AI met Python. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Leer AI met Python bevat in totaal 5 lessen.

Wat is een Q-tabel?

Het concept van de Q-tabel

De Q-tabel is een kernconcept binnen reinforcement learning. Het is een opzoektabel waarin elke vermelding de verwachte beloning vertegenwoordigt voor het uitvoeren van een specifieke actie in een bepaalde toestand.

Het doel is om de Q-waarden te leren, zodat de agent de beste acties kiest voor maximale beloningen.

Het Q-Table-concept — illustratie 1

Structuur van een Q-tabel

De Q-tabel heeft de volgende structuur:

  • Rijen: vertegenwoordigen toestanden van de omgeving.
  • Kolommen: vertegenwoordigen acties die beschikbaar zijn voor de agent.
  • Waarden: vertegenwoordigen de Q-waarde voor toestand-actieparen.

De agent werkt deze waarden tijdens het leren bij.

Formule voor het bijwerken van Q-waarden

Q-waarden worden bijgewerkt met de vergelijking van Bellman:

Q(s, a) = Q(s, a) + α [r + γ max(Q(s', a')) - Q(s, a)]

Waarbij:

  • s: huidige toestand
  • a: huidige actie
  • r: beloning voor de actie
  • s': volgende toestand
  • α: leersnelheid
  • γ: disconteringsfactor

Voorbeeld van een eenvoudige Q-tabel

Bekijk een Q-tabel voor een rasterwereld:

Toestanden: rasterposities (bijvoorbeeld A1, B1)

Acties: omhoog, omlaag, naar links of naar rechts bewegen

Aanvankelijk zijn alle Q-waarden ingesteld op nul:

Toestand Omhoog Omlaag Links Rechts
A1 0 0 0 0
B1 0 0 0 0

Een Q-tabel initialiseren in Python

Je kunt een Q-tabel weergeven met een NumPy-array of een woordenboek:

import numpy as np

# Example: Q-Table for 5 states and 4 actions
num_states = 5
num_actions = 4
q_table = np.zeros((num_states, num_actions))

print("Initial Q-Table:")
print(q_table)

Exploratie in Q-learning

De agent gebruikt een ε-greedy beleid om exploratie en exploitatie in balans te brengen:

  • Kies met een kans van ε een willekeurige actie (exploratie).
  • Kies met een kans van 1-ε de actie met de hoogste Q-waarde (exploitatie).

Voordelen van Q-tabellen

Q-tabellen zijn eenvoudig en effectief voor kleine omgevingen. De voordelen zijn onder andere:

  • eenvoudig te implementeren en fouten op te sporen;
  • duidelijke interpretatie van relaties tussen toestanden en acties;
  • lage rekenkosten voor kleine toestands-actieruimten.

Beperkingen van Q-tabellen

Q-tabellen hebben enkele beperkingen:

  • niet schaalbaar voor omgevingen met grote toestands-actieruimten;
  • vereisen veel geheugen voor problemen met veel dimensies;
  • kunnen niet generaliseren naar vergelijkbare toestanden.

Samenvatting en volgende stappen

In deze les hebben we:

  • het concept en de structuur van de Q-tabel geleerd;
  • verkend hoe Q-waarden worden bijgewerkt met de vergelijking van Bellman;
  • de voordelen en beperkingen van Q-tabellen besproken.

Vervolgens implementeren we in Python een eenvoudig Q-learningalgoritme om Q-tabellen in actie te zien.

Het Q-Table-concept — illustratie 10
Gratis beginnen

Leer Python met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
53
Lessen
225

Veelgestelde vragen

Is de les “Het Q-Table-concept” gratis?

Ja — je kunt hier op het web alle 3 lessen van het leerpad Leer AI met Python, waaronder “Het Q-Table-concept”, gratis volledig lezen. Daarna ontgrendelt CoddyKit PRO alle lessen, plus interactieve oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. De cursus Leer AI met Python bevat in totaal 5 lessen.

Wat leer ik in “Het Q-Table-concept”?

Reinforcement learning op basis van tabellen. Je oefent met Leer AI met Python door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met Leer AI met Python te beginnen?

Ervaring vooraf is niet nodig. Leer AI met Python op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 2 van 5.

Hoe lang duurt de les “Het Q-Table-concept”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over Leer AI met Python?

Ja. Elke les over Leer AI met Python bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Basisconcepten van reinforcement learning
  2. Het Q-Table-concept
  3. Een Q-tabel implementeren in Python
  4. Deep Q-learning
  5. OpenAI Gym verkennen
← Terug naar Leer AI met Python