Deep Q-learning
Neurale netwerken gebruiken voor reinforcement learning
Deep Q-learning is een gratis Python Academy-les op CoddyKit. Dit is les 4 van 5. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Python Academy. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Python Academy bevat in totaal 5 lessen.
Wat is Deep Q-Learning?
Deep Q-Learning
Deep Q-Learning is een uitbreiding van Q-Learning die een neuraal netwerk gebruikt om de Q-tabel te benaderen. Hierdoor kan versterkingsleren worden opgeschaald naar omgevingen met grote of continue toestand-actieruimten.

Waarom Deep Q-Learning?
Deep Q-Learning ondervangt de beperkingen van traditioneel Q-Learning:
- Kan omgaan met toestandruimten met veel dimensies, zoals afbeeldingen.
- Maakt het overbodig om grote Q-tabellen in het geheugen op te slaan.
- Generaliseert over toestanden met behulp van neurale netwerken.
Het DQN-algoritme
Deep Q-Learning gebruikt een neuraal netwerk, het Q-Network, om de Q-waarden te benaderen. De belangrijkste stappen zijn:
- Initialiseer het Q-Network met willekeurige gewichten.
- Wissel gegevens uit met de omgeving om ervaringstupels
(state, action, reward, next_state)te verzamelen. - Werk het Q-Network bij met de Bellman-vergelijking:
Q(s, a) ≈ r + γ max(Q(s', a'))
Het Q-Network bouwen
Het Q-Network is een eenvoudig feedforward-neuraal netwerk dat de huidige toestand als invoer neemt en Q-waarden voor alle mogelijke acties uitvoert:
import tensorflow as tf
from tensorflow.keras.models import Sequential
from tensorflow.keras.layers import Dense
# Define the Q-Network
q_network = Sequential([
Dense(24, activation='relu', input_shape=(state_space_size,)),
Dense(24, activation='relu'),
Dense(action_space_size, activation='linear')
])
q_network.compile(optimizer='adam', loss='mse')Ervaringen herhalen
Deep Q-Learning gebruikt een techniek die ervaringen herhalen wordt genoemd om het leren te verbeteren:
- Sla ervaringen
(state, action, reward, next_state)op in een geheugenbuffer. - Neem willekeurige batches van ervaringen om het Q-Network te trainen.
from collections import deque
# Initialize replay memory
memory = deque(maxlen=2000)
# Add experience to memory
memory.append((state, action, reward, next_state, done))Het Q-Network trainen
We trainen het Q-Network met de ervaringen uit de geheugenbuffer:
import numpy as np
# Sample a batch of experiences
batch_size = 32
batch = random.sample(memory, batch_size)
# Train the Q-Network
for state, action, reward, next_state, done in batch:
target = reward
if not done:
target += gamma * np.max(q_network.predict(next_state[np.newaxis, ...]))
q_values = q_network.predict(state[np.newaxis, ...])
q_values[0][action] = target
q_network.fit(state[np.newaxis, ...], q_values, epochs=1, verbose=0)Doelnetwerken
Om het trainen stabieler te maken gebruikt DQN een doelnetwerk:
- Houd een afzonderlijk netwerk bij voor het berekenen van doel-Q-waarden.
- Kopieer periodiek de gewichten van het Q-Network naar het doelnetwerk.
Voordelen van Deep Q-Learning
Deep Q-Learning biedt verschillende voordelen:
- Kan omgaan met toestandruimten met veel dimensies, zoals afbeeldingen.
- Generaliseert over toestanden met behulp van neurale netwerken.
- Kan complexe taken oplossen, zoals Atari-spellen en robotbesturing.
Samenvatting en volgende stappen
In deze les hebben we:
- De basisprincipes van Deep Q-Learning verkend.
- Een Q-Network gebouwd om Q-waarden te benaderen.
- Besproken hoe het herhalen van ervaringen en doelnetwerken zorgen voor stabiel trainen.
Vervolgens verkennen we OpenAI Gym en passen we versterkingsleren toe in gesimuleerde omgevingen.

Leer Python met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 76
- Lessen
- 320
Veelgestelde vragen
Is de les “Deep Q-learning” gratis?
Ja — de volledige tekst van “Deep Q-learning” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus Python Academy wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus Python Academy bevat in totaal 5 lessen.
Wat leer ik in “Deep Q-learning”?
Neurale netwerken gebruiken voor reinforcement learning Je oefent met Python Academy door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met Python Academy te beginnen?
Ervaring vooraf is niet nodig. Python Academy op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 4 van 5.
Hoe lang duurt de les “Deep Q-learning”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over Python Academy?
Ja. Elke les over Python Academy bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Basisconcepten van reinforcement learning
- Het concept van de Q-tabel
- Een Q-tabel implementeren in Python
- Deep Q-learning
- OpenAI Gym verkennen