Deep Q-learning
Brug af neurale netværk til reinforcement learning
Deep Q-learning er en gratis Python Academy-lektion på CoddyKit. Dette er lektion 4 af 5. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i Python Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Python Academy-kurset indeholder 5 lektioner i alt.
Hvad er deep Q-learning?
Deep Q-learning
Deep Q-learning er en udvidelse af Q-learning, der bruger et neuralt netværk til at tilnærme Q-tabellen. Det gør det muligt for reinforcement learning at skalere til miljøer med store eller kontinuerte tilstands-handlingsrum.

Hvorfor deep Q-learning?
Deep Q-learning afhjælper begrænsningerne ved traditionel Q-learning:
- Håndterer tilstandsrum med mange dimensioner, f.eks. billeder.
- Undgår behovet for at gemme store Q-tabeller i hukommelsen.
- Generaliserer på tværs af tilstande ved hjælp af neurale netværk.
DQN-algoritmen
Deep Q-learning bruger et neuralt netværk kaldet Q-netværket til at tilnærme Q-værdierne. De vigtigste trin er:
- Initialiser Q-netværket med tilfældige vægte.
- Interager med miljøet for at indsamle erfarings-tupler
(state, action, reward, next_state). - Opdater Q-netværket ved hjælp af Bellman-ligningen:
Q(s, a) ≈ r + γ max(Q(s', a'))
Opbygning af Q-netværket
Q-netværket er et simpelt neuralt netværk, der sender data fremad. Det tager den aktuelle tilstand som input og giver Q-værdier for alle mulige handlinger som output:
import tensorflow as tf
from tensorflow.keras.models import Sequential
from tensorflow.keras.layers import Dense
# Define the Q-Network
q_network = Sequential([
Dense(24, activation='relu', input_shape=(state_space_size,)),
Dense(24, activation='relu'),
Dense(action_space_size, activation='linear')
])
q_network.compile(optimizer='adam', loss='mse')Genafspilning af erfaringer
Deep Q-learning bruger en teknik kaldet genafspilning af erfaringer til at forbedre læringen:
- Gem erfaringer
(state, action, reward, next_state)i en hukommelsesbuffer. - Udtag tilfældige grupper af erfaringer for at træne Q-netværket.
from collections import deque
# Initialize replay memory
memory = deque(maxlen=2000)
# Add experience to memory
memory.append((state, action, reward, next_state, done))Træning af Q-netværket
Vi træner Q-netværket ved hjælp af erfaringerne fra hukommelsesbufferen:
import numpy as np
# Sample a batch of experiences
batch_size = 32
batch = random.sample(memory, batch_size)
# Train the Q-Network
for state, action, reward, next_state, done in batch:
target = reward
if not done:
target += gamma * np.max(q_network.predict(next_state[np.newaxis, ...]))
q_values = q_network.predict(state[np.newaxis, ...])
q_values[0][action] = target
q_network.fit(state[np.newaxis, ...], q_values, epochs=1, verbose=0)Målnetværk
For at stabilisere træningen bruger DQN et målnetværk:
- Vedligehold et separat netværk til beregning af mål-Q-værdier.
- Kopiér med jævne mellemrum vægte fra Q-netværket til målnetværket.
Fordele ved deep Q-learning
Deep Q-learning har flere fordele:
- Håndterer tilstandsrum med mange dimensioner, f.eks. billeder.
- Generaliserer på tværs af tilstande ved hjælp af neurale netværk.
- Kan løse komplekse opgaver som Atari-spil og robotstyring.
Opsummering og næste trin
I denne lektion:
- Undersøgte du det grundlæggende i deep Q-learning.
- Byggede du et Q-netværk til at tilnærme Q-værdier.
- Gennemgik du genafspilning af erfaringer og målnetværk til stabil træning.
Derefter undersøger vi OpenAI Gym og anvender reinforcement learning i simulerede miljøer.

Lær Python med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 76
- Lektioner
- 320
Ofte stillede spørgsmål
Er lektionen “Deep Q-learning” gratis?
Ja — hele teksten til “Deep Q-learning” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af Python Academy-kurset, skal du opgradere til CoddyKit PRO. Python Academy-kurset indeholder 5 lektioner i alt.
Hvad lærer jeg i “Deep Q-learning”?
Brug af neurale netværk til reinforcement learning Du øver dig i Python Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på Python Academy?
Der kræves ingen tidligere erfaring. Python Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 4 af 5.
Hvor lang tid tager lektionen “Deep Q-learning”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne Python Academy-lektion?
Ja. Alle Python Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- Grundlæggende koncepter i reinforcement learning
- Q-tabel-konceptet
- Implementering af Q-tabel i Python
- Deep Q-learning
- Udforskning af OpenAI Gym