Python Academy · Lektion

Implementering af Q-tabel i Python

Et enkelt eksempel på Q-learning

Lektion 3 af 510 trin

Implementering af Q-tabel i Python er en gratis Python Academy-lektion på CoddyKit. Dette er lektion 3 af 5. Du kan læse hele lektionen gratis nedenfor — og derefter øve dig praktisk i browseren med en indbygget kodeeditor og en AI-vejleder, der er tilgængelig døgnet rundt. Den er en del af læringsforløbet i Python Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Python Academy-kurset indeholder 5 lektioner i alt.

Implementering af Q-learning i Python

I denne lektion implementerer du en simpel Q-learning-algoritme i Python. Agenten lærer at navigere i en gitterverden for at maksimere sine belønninger.

Implementering af Q-tabel i Python — illustration 1

Definition af miljøet

Vi definerer en simpel gitterverden på 4×4, hvor agenten starter i øverste venstre hjørne og skal nå det nederste højre hjørne for at modtage en belønning.

import numpy as np

# Define the environment
num_states = 16  # 4x4 grid
num_actions = 4  # Up, Down, Left, Right

# Define rewards (-1 for each step, +10 for the goal)
rewards = np.zeros(num_states)
rewards[-1] = 10

Initialisering af Q-tabellen

Q-tabellen initialiseres med nuller for alle tilstands-handlingspar.

# Initialize the Q-Table
q_table = np.zeros((num_states, num_actions))

print("Initial Q-Table:")
print(q_table)

Implementering af Q-learning-algoritmen

Vi bruger følgende parametre:

  • α (Læringsrate): Bestemmer, hvor meget ny information overskriver gammel information.
  • γ (Diskonteringsfaktor): Vægter fremtidige belønninger i forhold til øjeblikkelige belønninger.
  • ε (Udforskningsrate): Afvejer udforskning og udnyttelse.
# Parameters
alpha = 0.1  # Learning rate
gamma = 0.9  # Discount factor
epsilon = 0.1  # Exploration rate

# Q-Learning loop
num_episodes = 1000
for episode in range(num_episodes):
    state = 0  # Start at the first state
    done = False
    while not done:
        # Exploration or exploitation
        if np.random.rand() < epsilon:
            action = np.random.randint(num_actions)  # Explore
        else:
            action = np.argmax(q_table[state])  # Exploit

        # Transition to the next state
        next_state = (state + action) % num_states  # Simplified transition logic
        reward = rewards[next_state]

        # Update Q-value
        q_table[state, action] = q_table[state, action] + alpha * (
            reward + gamma * np.max(q_table[next_state]) - q_table[state, action]
        )

        # Move to the next state
        state = next_state
        done = state == num_states - 1

Evaluering af den indlærte politik

Efter træningen evaluerer vi politikken ved at følge de optimale handlinger, der er gemt i Q-tabellen:

# Evaluate the policy
state = 0
optimal_path = [state]
while state != num_states - 1:
    action = np.argmax(q_table[state])
    state = (state + action) % num_states  # Simplified transition logic
    optimal_path.append(state)

print("Optimal Path:", optimal_path)

Visualisering af Q-tabellen

Vi kan visualisere Q-tabellen for at forstå de indlærte værdier for hvert tilstands-handlingspar:

import matplotlib.pyplot as plt
import seaborn as sns

# Visualize Q-Table
plt.figure(figsize=(10, 8))
sns.heatmap(q_table, annot=True, fmt=".2f", cmap="coolwarm")
plt.title("Q-Table Heatmap")
plt.xlabel("Actions")
plt.ylabel("States")
plt.show()

Fordele ved Q-learning

Q-learning har flere fordele:

  • Enkel og let at implementere.
  • Kan håndtere stokastiske miljøer.
  • Konvergerer til den optimale politik med tilstrækkelig udforskning.

Begrænsninger ved Q-learning

Q-learning har nogle begrænsninger:

  • Skalerer ikke godt til miljøer med store tilstands-handlingsrum.
  • Læringen kan være langsom i komplekse miljøer.
  • Kræver en veldefineret repræsentation af tilstande og handlinger.

Opsummering og næste trin

I denne lektion:

  • Implementerede du en simpel Q-learning-algoritme i Python.
  • Trænede du en agent til at navigere i en gitterverden ved hjælp af en Q-tabel.
  • Evaluerede du den indlærte politik og visualiserede Q-tabellen.

Derefter undersøger vi deep Q-learning, som bruger neurale netværk til at håndtere miljøer med store tilstands-handlingsrum.

Implementering af Q-tabel i Python — illustration 10
Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
76
Lektioner
320

Ofte stillede spørgsmål

Er lektionen “Implementering af Q-tabel i Python” gratis?

Ja — hele teksten til “Implementering af Q-tabel i Python” kan læses gratis her på nettet. Hvis du vil øve dig interaktivt med en indbygget kodeeditor og en AI-vejleder døgnet rundt og få adgang til resten af Python Academy-kurset, skal du opgradere til CoddyKit PRO. Python Academy-kurset indeholder 5 lektioner i alt.

Hvad lærer jeg i “Implementering af Q-tabel i Python”?

Et enkelt eksempel på Q-learning Du øver dig i Python Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Python Academy?

Der kræves ingen tidligere erfaring. Python Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 3 af 5.

Hvor lang tid tager lektionen “Implementering af Q-tabel i Python”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Python Academy-lektion?

Ja. Alle Python Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Grundlæggende koncepter i reinforcement learning
  2. Q-tabel-konceptet
  3. Implementering af Q-tabel i Python
  4. Deep Q-learning
  5. Udforskning af OpenAI Gym
← Tilbage til Python Academy