Een Q-tabel implementeren in Python
Een eenvoudig voorbeeld van Q-learning
Een Q-tabel implementeren in Python is een gratis Python Academy-les op CoddyKit. Dit is les 3 van 5. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Python Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Python Academy bevat in totaal 5 lessen.
Q-Learning implementeren in Python
In deze les implementeren we een eenvoudig Q-Learning-algoritme in Python. De agent leert door een rasterwereld te navigeren om zijn beloningen te maximaliseren.

De omgeving definiëren
We definiëren een eenvoudige rasterwereld van 4×4 waarin de agent in de linkerbovenhoek begint en de rechterbenedenhoek moet bereiken om een beloning te krijgen.
import numpy as np
# Define the environment
num_states = 16 # 4x4 grid
num_actions = 4 # Up, Down, Left, Right
# Define rewards (-1 for each step, +10 for the goal)
rewards = np.zeros(num_states)
rewards[-1] = 10De Q-tabel initialiseren
De Q-tabel wordt geïnitialiseerd met nullen voor alle toestand-actieparen.
# Initialize the Q-Table
q_table = np.zeros((num_states, num_actions))
print("Initial Q-Table:")
print(q_table)Het Q-Learning-algoritme implementeren
We gebruiken de volgende parameters:
- α (leersnelheid): bepaalt in welke mate nieuwe informatie oude informatie overschrijft.
- γ (disconteringsfactor): weegt toekomstige beloningen af tegen directe beloningen.
- ε (verkenningspercentage): vormt een balans tussen verkennen en benutten.
# Parameters
alpha = 0.1 # Learning rate
gamma = 0.9 # Discount factor
epsilon = 0.1 # Exploration rate
# Q-Learning loop
num_episodes = 1000
for episode in range(num_episodes):
state = 0 # Start at the first state
done = False
while not done:
# Exploration or exploitation
if np.random.rand() < epsilon:
action = np.random.randint(num_actions) # Explore
else:
action = np.argmax(q_table[state]) # Exploit
# Transition to the next state
next_state = (state + action) % num_states # Simplified transition logic
reward = rewards[next_state]
# Update Q-value
q_table[state, action] = q_table[state, action] + alpha * (
reward + gamma * np.max(q_table[next_state]) - q_table[state, action]
)
# Move to the next state
state = next_state
done = state == num_states - 1Het geleerde beleid evalueren
Na het trainen evalueren we het beleid door de optimale acties te volgen die in de Q-tabel zijn opgeslagen:
# Evaluate the policy
state = 0
optimal_path = [state]
while state != num_states - 1:
action = np.argmax(q_table[state])
state = (state + action) % num_states # Simplified transition logic
optimal_path.append(state)
print("Optimal Path:", optimal_path)De Q-tabel visualiseren
We kunnen de Q-tabel visualiseren om de geleerde waarden voor elk toestand-actiepaar te begrijpen:
import matplotlib.pyplot as plt
import seaborn as sns
# Visualize Q-Table
plt.figure(figsize=(10, 8))
sns.heatmap(q_table, annot=True, fmt=".2f", cmap="coolwarm")
plt.title("Q-Table Heatmap")
plt.xlabel("Actions")
plt.ylabel("States")
plt.show()Voordelen van Q-Learning
Q-Learning biedt verschillende voordelen:
- Eenvoudig en gemakkelijk te implementeren.
- Kan omgaan met stochastische omgevingen.
- Convergeert naar het optimale beleid als er voldoende wordt verkend.
Beperkingen van Q-Learning
Q-Learning heeft enkele beperkingen:
- Schaalt niet goed naar omgevingen met grote toestand-actieruimten.
- Het leren kan traag verlopen in complexe omgevingen.
- Vereist een goed gedefinieerde weergave van toestanden en acties.
Samenvatting en volgende stappen
In deze les hebben we:
- Een eenvoudig Q-Learning-algoritme in Python geïmplementeerd.
- Een agent getraind om met een Q-tabel door een rasterwereld te navigeren.
- Het geleerde beleid geëvalueerd en de Q-tabel gevisualiseerd.
Vervolgens verkennen we Deep Q-Learning, dat neurale netwerken gebruikt om omgevingen met grote toestand-actieruimten te verwerken.

Leer Python met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 76
- Lessen
- 320
Veelgestelde vragen
Is de les “Een Q-tabel implementeren in Python” gratis?
Ja — de volledige tekst van “Een Q-tabel implementeren in Python” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus Python Academy wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus Python Academy bevat in totaal 5 lessen.
Wat leer ik in “Een Q-tabel implementeren in Python”?
Een eenvoudig voorbeeld van Q-learning Je oefent met Python Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met Python Academy te beginnen?
Ervaring vooraf is niet nodig. Python Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 3 van 5.
Hoe lang duurt de les “Een Q-tabel implementeren in Python”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over Python Academy?
Ja. Elke les over Python Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Basisconcepten van reinforcement learning
- Het concept van de Q-tabel
- Een Q-tabel implementeren in Python
- Deep Q-learning
- OpenAI Gym verkennen