0Pricing
Learn AI with Python · Leçon

Concept de table Q

Apprentissage par renforcement fondé sur une table

Concept de table Q est une leçon Learn AI with Python gratuite sur CoddyKit. Ceci est la leçon 2 sur 5. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Learn AI with Python, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Learn AI with Python comprend 5 leçons au total.

Qu’est-ce qu’une table Q ?

Concept de la table Q

La table Q est un concept central de l’apprentissage par renforcement. Il s’agit d’une table de consultation dont chaque entrée représente la récompense attendue pour l’exécution d’une action donnée dans un état donné.

L’objectif est d’apprendre les valeurs Q, qui guident l’agent afin qu’il effectue les meilleures actions pour obtenir des récompenses maximales.

Concept de table Q — illustration 1

Structure d’une table Q

Structure d’une table Q

La table Q est structurée comme suit :

  • Lignes : représentent les états de l’environnement.
  • Colonnes : représentent les actions disponibles pour l’agent.
  • Valeurs : représentent la valeur Q des couples état-action.

L’agent met à jour ces valeurs au cours de l’apprentissage.

Formule de mise à jour de la valeur Q

Formule de mise à jour de la valeur Q

Les valeurs Q sont mises à jour à l’aide de l’équation de Bellman :

Q(s, a) = Q(s, a) + α [r + γ max(Q(s', a')) - Q(s, a)]

Où :

  • s : état actuel
  • a : action actuelle
  • r : récompense associée à l’action
  • s' : état suivant
  • α : taux d’apprentissage
  • γ : facteur d’actualisation

Exemple de table Q simple

Exemple de table Q simple

Considérons une table Q pour un monde en grille :

États : positions de la grille (par exemple, A1, B1)

Actions : se déplacer vers le haut, le bas, la gauche ou la droite

Initialement, toutes les valeurs Q sont définies sur zéro :

État Haut Bas Gauche Droite
A1 0 0 0 0
B1 0 0 0 0

Initialisation d’une table Q en Python

Initialisation d’une table Q en Python

Nous pouvons représenter une table Q à l’aide d’un tableau NumPy ou d’un dictionnaire :

import numpy as np

# Example: Q-Table for 5 states and 4 actions
num_states = 5
num_actions = 4
q_table = np.zeros((num_states, num_actions))

print("Initial Q-Table:")
print(q_table)

Exploration dans l’apprentissage Q

Exploration dans l’apprentissage Q

L’agent utilise une politique ε-gloutonne pour équilibrer l’exploration et l’exploitation :

  • avec une probabilité ε, l’agent choisit une action aléatoire (exploration) ;
  • avec une probabilité 1-ε, l’agent choisit l’action dont la valeur Q est la plus élevée (exploitation).

Avantages des tables Q

Avantages des tables Q

Les tables Q sont simples et efficaces pour les petits environnements. Elles présentent notamment les avantages suivants :

  • mise en œuvre et débogage faciles ;
  • interprétation claire des relations entre les états et les actions ;
  • faible coût de calcul pour les espaces état-action de petite taille.

Limites des tables Q

Limites des tables Q

Les tables Q présentent certaines limites :

  • elles ne passent pas à l’échelle pour les environnements comportant de grands espaces état-action ;
  • elles nécessitent une quantité importante de mémoire pour les problèmes de grande dimension ;
  • elles ne peuvent pas généraliser les connaissances à des états similaires.

Résumé et prochaines étapes

Résumé et prochaines étapes

Dans cette leçon, nous avons :

  • étudié le concept de la table Q et sa structure ;
  • exploré la mise à jour des valeurs Q à l’aide de l’équation de Bellman ;
  • examiné les avantages et les limites des tables Q.

Ensuite, nous mettrons en œuvre un algorithme simple d’apprentissage Q en Python afin d’observer les tables Q en action.

Concept de table Q — illustration 10

Questions Fréquemment Posées

La leçon « Concept de table Q » est-elle gratuite ?

Oui — le texte complet de « Concept de table Q » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Learn AI with Python, passe à CoddyKit PRO. Le cours Learn AI with Python comprend 5 leçons au total.

Qu'est-ce que j'apprendrai dans « Concept de table Q » ?

Apprentissage par renforcement fondé sur une table Tu pratiques Learn AI with Python avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer Learn AI with Python ?

Aucune expérience préalable n'est requise. Learn AI with Python sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 5.

Combien de temps prend la leçon « Concept de table Q » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon Learn AI with Python ?

Oui. Chaque leçon Learn AI with Python inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Notions fondamentales de l'apprentissage par renforcement
  2. Concept de table Q
  3. Implémentation d'une table Q en Python
  4. Apprentissage Q profond
  5. Découverte d'OpenAI Gym
← Retour à Learn AI with Python