Deep Q-learning
Neurale netwerken gebruiken voor reinforcement learning
Deep Q-learning is een gratis Leer AI met Python-les op CoddyKit. Dit is les 4 van 5. Je kunt 3 lessen uit dit leerpad gratis volledig lezen — daarna ontgrendelt CoddyKit PRO alle lessen, plus praktische oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Leer AI met Python. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Leer AI met Python bevat in totaal 5 lessen.
Wat is deep Q-learning?
Deep Q-learning
Deep Q-learning is een uitbreiding van Q-learning die een neuraal netwerk gebruikt om de Q-tabel te benaderen. Hierdoor kan leren door bekrachtiging worden opgeschaald naar omgevingen met grote of continue toestand-actieruimten.

Waarom deep Q-learning?
Deep Q-learning pakt de beperkingen van traditioneel Q-learning aan:
- Verwerkt hoogdimensionale toestandsruimten, zoals afbeeldingen.
- Voorkomt dat grote Q-tabellen in het geheugen moeten worden opgeslagen.
- Generaliseert naar verschillende toestanden met behulp van neurale netwerken.
Het DQN-algoritme
Deep Q-learning gebruikt een neuraal netwerk met de naam Q-netwerk om de Q-waarden te benaderen. De belangrijkste stappen zijn:
- Initialiseer het Q-netwerk met willekeurige gewichten.
- Interageer met de omgeving om ervaringstupels
(state, action, reward, next_state)te verzamelen. - Werk het Q-netwerk bij met behulp van de vergelijking van Bellman:
Q(s, a) ≈ r + γ max(Q(s', a'))
Het Q-netwerk bouwen
Het Q-netwerk is een eenvoudig feedforward-neuraal netwerk dat de huidige toestand als invoer neemt en Q-waarden voor alle mogelijke acties als uitvoer geeft:
import tensorflow as tf
from tensorflow.keras.models import Sequential
from tensorflow.keras.layers import Dense
# Define the Q-Network
q_network = Sequential([
Dense(24, activation='relu', input_shape=(state_space_size,)),
Dense(24, activation='relu'),
Dense(action_space_size, activation='linear')
])
q_network.compile(optimizer='adam', loss='mse')Ervaringsherhaling
Deep Q-learning gebruikt een techniek die ervaringsherhaling heet om het leren te verbeteren:
- Sla ervaringen
(state, action, reward, next_state)op in een geheugenbuffer. - Selecteer willekeurig groepen ervaringen om het Q-netwerk te trainen.
from collections import deque
# Initialize replay memory
memory = deque(maxlen=2000)
# Add experience to memory
memory.append((state, action, reward, next_state, done))Het Q-netwerk trainen
We trainen het Q-netwerk met de ervaringen uit de geheugenbuffer:
import numpy as np
# Sample a batch of experiences
batch_size = 32
batch = random.sample(memory, batch_size)
# Train the Q-Network
for state, action, reward, next_state, done in batch:
target = reward
if not done:
target += gamma * np.max(q_network.predict(next_state[np.newaxis, ...]))
q_values = q_network.predict(state[np.newaxis, ...])
q_values[0][action] = target
q_network.fit(state[np.newaxis, ...], q_values, epochs=1, verbose=0)Doelnetwerken
Om het trainen te stabiliseren gebruikt DQN een doelnetwerk:
- Houd een afzonderlijk netwerk bij voor het berekenen van doel-Q-waarden.
- Kopieer periodiek de gewichten van het Q-netwerk naar het doelnetwerk.
Voordelen van deep Q-learning
Deep Q-learning biedt verschillende voordelen:
- Verwerkt hoogdimensionale toestandsruimten, zoals afbeeldingen.
- Generaliseert naar verschillende toestanden met behulp van neurale netwerken.
- Kan complexe taken oplossen, zoals Atari-spellen en robotbesturing.
Samenvatting en volgende stappen
In deze les hebben we:
- De basisprincipes van deep Q-learning verkend.
- Een Q-netwerk gebouwd om Q-waarden te benaderen.
- Ervaringsherhaling en doelnetwerken voor stabiel trainen besproken.
Hierna bekijken we OpenAI Gym en passen we leren door bekrachtiging toe in gesimuleerde omgevingen.

Leer Python met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 53
- Lessen
- 225
Veelgestelde vragen
Is de les “Deep Q-learning” gratis?
Ja — je kunt hier op het web alle 3 lessen van het leerpad Leer AI met Python, waaronder “Deep Q-learning”, gratis volledig lezen. Daarna ontgrendelt CoddyKit PRO alle lessen, plus interactieve oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. De cursus Leer AI met Python bevat in totaal 5 lessen.
Wat leer ik in “Deep Q-learning”?
Neurale netwerken gebruiken voor reinforcement learning Je oefent met Leer AI met Python door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met Leer AI met Python te beginnen?
Ervaring vooraf is niet nodig. Leer AI met Python op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 4 van 5.
Hoe lang duurt de les “Deep Q-learning”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over Leer AI met Python?
Ja. Elke les over Leer AI met Python bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Basisconcepten van reinforcement learning
- Het Q-Table-concept
- Een Q-tabel implementeren in Python
- Deep Q-learning
- OpenAI Gym verkennen