Lær AI med Python · leksjon

Q-Table-konseptet

Forsterkende læring basert på tabeller

Leksjon 2 av 510 trinn

Q-Table-konseptet er en gratis leksjon i Lær AI med Python på CoddyKit. Dette er leksjon 2 av 5. Du kan lese valgfritt 3 leksjoner fra denne læringsstien gratis i sin helhet – deretter låser CoddyKit PRO opp alle leksjoner, samt praktisk øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i Lær AI med Python, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i Lær AI med Python inneholder totalt 5 leksjoner.

Hva er en Q-tabell?

Q-tabell-konseptet

Q-tabellen er et sentralt konsept innen forsterkende læring. Den er en oppslagstabell der hver oppføring representerer den forventede belønningen for å utføre en bestemt handling i en gitt tilstand.

Målet er å lære Q-verdiene, som veileder agenten til å utføre de beste handlingene for å oppnå maksimale belønninger.

Q-Table-konseptet — illustrasjon 1

Strukturen til en Q-tabell

Q-tabellen er strukturert slik:

  • Rader: Representerer miljøets tilstander.
  • Kolonner: Representerer handlingene som er tilgjengelige for agenten.
  • Verdier: Representerer Q-verdien for tilstands-handlingspar.

Agenten oppdaterer disse verdiene under læringen.

Formel for oppdatering av Q-verdi

Q-verdier oppdateres ved hjelp av Bellman-ligningen:

Q(s, a) = Q(s, a) + α [r + γ max(Q(s', a')) - Q(s, a)]

Der:

  • s: Gjeldende tilstand
  • a: Gjeldende handling
  • r: Belønning for handlingen
  • s': Neste tilstand
  • α: Læringsrate
  • γ: Diskonteringsfaktor

Eksempel på en enkel Q-tabell

Se på en Q-tabell for en rutenettverden:

Tilstander: Rutenettposisjoner (for eksempel A1, B1)

Handlinger: Flytt opp, ned, til venstre eller til høyre

Til å begynne med er alle Q-verdiene satt til null:

Tilstand Opp Ned Venstre Høyre
A1 0 0 0 0
B1 0 0 0 0

Initialisering av en Q-tabell i Python

Vi kan representere en Q-tabell ved hjelp av en NumPy-matrise eller en ordbok:

import numpy as np

# Example: Q-Table for 5 states and 4 actions
num_states = 5
num_actions = 4
q_table = np.zeros((num_states, num_actions))

print("Initial Q-Table:")
print(q_table)

Utforskning i Q-Learning

Agenten bruker en ε-greedy-policy for å balansere utforskning og utnyttelse:

  • Med sannsynlighet ε velges en tilfeldig handling (utforskning).
  • Med sannsynlighet 1-ε velges handlingen med den høyeste Q-verdien (utnyttelse).

Fordeler med Q-tabeller

Q-tabeller er enkle og effektive for små miljøer. Fordelene omfatter:

  • Enkel implementering og feilsøking.
  • Tydelig tolkning av forholdet mellom tilstand og handling.
  • Lav beregningskostnad for små tilstands- og handlingsrom.

Begrensninger ved Q-tabeller

Q-tabeller har enkelte begrensninger:

  • Kan ikke skaleres til miljøer med store tilstands- og handlingsrom.
  • Krever betydelig minne for problemer med mange dimensjoner.
  • Mangler evnen til å generalisere på tvers av lignende tilstander.

Oppsummering og neste steg

I denne leksjonen har vi:

  • Lært om Q-tabell-konseptet og strukturen til en Q-tabell.
  • Utforsket hvordan Q-verdier oppdateres ved hjelp av Bellman-ligningen.
  • Diskutert fordelene og begrensningene ved Q-tabeller.

Deretter implementerer vi en enkel Q-Learning-algoritme i Python for å se Q-tabeller i praksis.

Q-Table-konseptet — illustrasjon 10
Gratis å komme i gang

Lær deg Python med en AI-veileder – gratis

Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.

Kurs
53
Leksjoner
225

Ofte stilte spørsmål

Er leksjonen «Q-Table-konseptet» gratis?

Ja – du kan lese valgfritt 3 av leksjonene i læringsstien Lær AI med Python, inkludert «Q-Table-konseptet», gratis i sin helhet her på nettet. Deretter låser CoddyKit PRO opp alle leksjoner, samt interaktiv øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Kurset i Lær AI med Python inneholder totalt 5 leksjoner.

Hva lærer jeg i «Q-Table-konseptet»?

Forsterkende læring basert på tabeller Du øver på Lær AI med Python med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.

Trenger jeg erfaring for å begynne med Lær AI med Python?

Ingen tidligere erfaring er nødvendig. Lær AI med Python på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 2 av 5.

Hvor lang tid tar leksjonen «Q-Table-konseptet»?

De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.

Kan jeg skrive og kjøre kode i denne Lær AI med Python-leksjonen?

Ja. Alle Lær AI med Python-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.

Alle leksjonene i dette kurset

  1. Grunnleggende konsepter innen forsterkende læring
  2. Q-Table-konseptet
  3. Implementering av Q-tabell i Python
  4. Dyp Q-læring
  5. Utforsk OpenAI Gym
← Tilbake til Lær AI med Python