0Pricing
AI Agents · Leçon

Modèles du monde et anticipation

Prévoyez le résultat d’une action avant de l’exécuter ; choisissez l’action dont l’issue prévue est la meilleure.

Modèles du monde et anticipation est une leçon AI Agents gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Agents, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Agents comprend 4 leçons au total.

Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.

Prédire avant d’agir

Les meilleurs agents ne se contentent pas d’essayer des choses : ils prédisent d’abord les résultats, choisissent la meilleure option, puis agissent. C’est la même idée que rechercher N coups à l’avance aux échecs.

Qu’est-ce qu’un modèle du monde ?

Un modèle du monde prédit l’état suivant : étant donné l’état current S et l’action A, quel est l’état suivant S' ?

Pour un agent fondé sur un LLM, le LLM lui-même peut servir de modèle du monde :

prediction_prompt = '''
Current state: {state}
Proposed action: {action}
What is the most likely outcome? Return JSON: {new_state, success_probability}.
'''

Pourquoi l’anticipation est utile

Certaines actions sont irréversibles (envoyer un courriel, supprimer des données). Prédire d’abord peut éviter des erreurs coûteuses.

D’autres actions ont des résultats incertains. La prédiction force l’agent à réfléchir aux conséquences.

Simple 1-Step Lookahead

candidates = [a1, a2, a3]
predictions = [predict(state, a) for a in candidates]
best = max(zip(predictions, candidates), key=lambda p: p[0].success_probability)[1]
act(best)

Anticipation sur plusieurs étapes (recherche arborescente)

Développez plusieurs étapes à l’avance. Pour chaque possibilité, prédisez les résultats, puis prédisez les résultats de ces résultats :

def search(state, depth=2):
    if depth == 0:
        return value(state)
    actions = candidate_actions(state)
    best_score = -math.inf
    for a in actions:
        next_state = predict(state, a)
        score = search(next_state, depth - 1)
        best_score = max(best_score, score)
    return best_score

Arbre des pensées

Yao et al. 2023 — étend le raisonnement en chaîne (CoT) sous forme d’arbre. L’agent génère plusieurs « chemins de réflexion », évalue chacun d’eux et développe le plus prometteur :

import random

def continue_thought(question):
    return question + ' -> idea' + str(random.randint(1, 100))

def score(t):
    return len(t)

def expand_top_k(thoughts, scores, k):
    ranked = sorted(zip(thoughts, scores), key=lambda x: -x[1])
    return [t for t, s in ranked[:k]]

def ToT(question):
    thoughts = [continue_thought(question) for _ in range(5)]
    for depth in range(2):
        scores = [score(t) for t in thoughts]
        thoughts = expand_top_k(thoughts, scores, k=3)
    return thoughts

result = ToT('How to reduce agent latency?')
print('Top thoughts:', result)

Recherche arborescente de Monte-Carlo (MCTS)

Pour les arbres de recherche très vastes : échantillonnez des chemins, utilisez score pour évaluer les résultats et propagez les scores vers le haut afin d’éclairer les sélections futures. Cette méthode est très utilisée dans les IA qui jouent à des jeux et commence à apparaître dans la recherche sur les agents.

Coût de l’anticipation

Chaque action prédite est un appel de LLM. Une anticipation avec une profondeur de 2 et un facteur de branchement de 3 nécessite 9 appels simplement pour décider de l’action ONE. Utilisez l’anticipation uniquement pour les décisions à forts enjeux.

Élagage heuristique

Ignorez les prédictions pour les actions manifestement mauvaises. Filtrez d’abord les actions candidates avec un classificateur peu coûteux ou une règle.

Étalonner les prédictions

Les prédictions des LLM sont imparfaites. Étalonnez-les en comparant occasionnellement les résultats prédits aux résultats réels :

for trace in recent_traces:
    predicted = trace.predicted_outcome
    actual = trace.actual_outcome
    log.info('prediction-accuracy', match=(predicted == actual))

Quand utiliser NOT l’anticipation

  • Actions peu coûteuses et réversibles : essayez-les simplement
  • Parcours où la latence est critique
  • Tâches dont les résultats sont évidents

Quand utiliser TO l’anticipation

  • Actions irréversibles (financières, de communication)
  • Plans en plusieurs étapes où les erreurs se cumulent
  • Domaines à forts enjeux (médical, juridique)
  • Tâches adversariales (jeux, débats)

Anticipation interne de type o1

Les modèles de raisonnement o1 / o3 d’OpenAI effectuent automatiquement une anticipation interne pendant la phase de « réflexion ». Ils explorent de nombreuses continuations avant de s’engager. Vous n’avez pas besoin de l’implémenter à l’extérieur.

Compromis de l’anticipation

Quel est le principal coût de l’anticipation sur plusieurs étapes ?

Récapitulatif

Prédisez avant d’agir. L’anticipation à une étape est peu coûteuse et utile ; la recherche arborescente est coûteuse, mais puissante. Les modèles de raisonnement (o1, o3) automatisent cette approche. Utilisez-la avec modération.

Questions Fréquemment Posées

La leçon « Modèles du monde et anticipation » est-elle gratuite ?

Oui — le texte complet de « Modèles du monde et anticipation » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Agents, passe à CoddyKit PRO. Le cours AI Agents comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Modèles du monde et anticipation » ?

Prévoyez le résultat d’une action avant de l’exécuter ; choisissez l’action dont l’issue prévue est la meilleure. Tu pratiques AI Agents avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Agents ?

Aucune expérience préalable n'est requise. AI Agents sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.

Combien de temps prend la leçon « Modèles du monde et anticipation » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Agents ?

Oui. Chaque leçon AI Agents inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Décomposition hiérarchique des tâches
  2. Piles d’objectifs et retour en arrière
  3. Modèles du monde et anticipation
  4. Boucles de réflexion et d’autocritique
← Retour à AI Agents