Modelli del mondo e lookahead
Preveda il risultato di un’azione prima di eseguirla e scelga l’azione con l’esito previsto migliore
Modelli del mondo e lookahead è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 3 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.
Parti di questa lezione non sono ancora state tradotte e vengono mostrate in inglese.
Prevedere prima di agire
I migliori agenti non si limitano a provare: prevedono prima i risultati, scelgono l'opzione migliore e poi agiscono. È la stessa idea di prevedere N mosse in avanti negli scacchi.
Che cos'è un modello del mondo?
Un modello del mondo prevede: dato lo stato attuale S e l'azione A, quale sarà lo stato successivo S'?
Per un agente basato su un LLM, l'LLM stesso può fungere da modello del mondo:
prediction_prompt = '''
Current state: {state}
Proposed action: {action}
What is the most likely outcome? Return JSON: {new_state, success_probability}.
'''Perché guardare in avanti è utile
Alcune azioni sono irreversibili (inviare un'e-mail, eliminare dati). Prevedere prima può evitare errori costosi.
Altre azioni hanno risultati incerti. Prevedere costringe l'agente a riflettere sulle conseguenze.
Simple 1-Step Lookahead
candidates = [a1, a2, a3]
predictions = [predict(state, a) for a in candidates]
best = max(zip(predictions, candidates), key=lambda p: p[0].success_probability)[1]
act(best)Lookahead multi-passaggio (ricerca ad albero)
Espanda la ricerca su più passaggi. Per ogni candidato, preveda i risultati e poi preveda i risultati di quei risultati:
def search(state, depth=2):
if depth == 0:
return value(state)
actions = candidate_actions(state)
best_score = -math.inf
for a in actions:
next_state = predict(state, a)
score = search(next_state, depth - 1)
best_score = max(best_score, score)
return best_scoreAlbero dei pensieri
Yao et al. 2023 — estende il CoT in un albero. L'agente genera diversi "percorsi di pensiero", valuta ciascuno e amplia quello più promettente:
import random
def continue_thought(question):
return question + ' -> idea' + str(random.randint(1, 100))
def score(t):
return len(t)
def expand_top_k(thoughts, scores, k):
ranked = sorted(zip(thoughts, scores), key=lambda x: -x[1])
return [t for t, s in ranked[:k]]
def ToT(question):
thoughts = [continue_thought(question) for _ in range(5)]
for depth in range(2):
scores = [score(t) for t in thoughts]
thoughts = expand_top_k(thoughts, scores, k=3)
return thoughts
result = ToT('How to reduce agent latency?')
print('Top thoughts:', result)
Ricerca ad albero Monte Carlo (MCTS)
Per alberi di ricerca molto grandi: campioni i percorsi, assegni un punteggio ai risultati e propaghi i punteggi verso l'alto per guidare le selezioni successive. È ampiamente utilizzata nell'IA per i giochi e sta emergendo nella ricerca sugli agenti.
Costo del lookahead
Ogni azione prevista richiede una chiamata all'LLM. Un lookahead con profondità=2 e ramificazione=3 richiede 9 chiamate solo per decidere UNA azione. Utilizzi il lookahead solo per decisioni ad alto impatto.
Potatura euristica
Salti le previsioni per le azioni chiaramente sbagliate. Pre-filtri le azioni candidate con un classificatore economico o una regola.
Calibrare le previsioni
Le previsioni degli LLM non sono perfette. Le calibri confrontando occasionalmente i risultati previsti con quelli effettivi:
for trace in recent_traces:
predicted = trace.predicted_outcome
actual = trace.actual_outcome
log.info('prediction-accuracy', match=(predicted == actual))Quando NON usare il lookahead
- Azioni economiche e reversibili: è sufficiente eseguirle
- Percorsi in cui la latenza è critica
- Attività con risultati ovvi
Quando usare il lookahead
- Azioni irreversibili (finanziarie, comunicative)
- Piani composti da più passaggi, in cui gli errori si accumulano
- Ambiti ad alto impatto (medico, legale)
- Attività avversariali (giochi, dibattiti)
Lookahead interno in stile o1
I modelli di ragionamento OpenAI o1 / o3 eseguono automaticamente il lookahead interno durante la fase di "pensiero". Esplorano molte continuazioni prima di impegnarsi su una. Non è necessario implementarlo esternamente.
Compromesso del lookahead
Qual è il costo principale del lookahead multi-passaggio?
Riepilogo
Preveda prima di agire. Il lookahead di un passaggio è economico e utile; la ricerca ad albero è costosa ma potente. I modelli di ragionamento (o1, o3) automatizzano questo processo. Lo utilizzi con parsimonia.
Domande Frequenti
La lezione «Modelli del mondo e lookahead» è gratuita?
Sì — il testo completo di «Modelli del mondo e lookahead» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.
Cosa imparerò in «Modelli del mondo e lookahead»?
Preveda il risultato di un’azione prima di eseguirla e scelga l’azione con l’esito previsto migliore Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare AI Agents?
Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 3 di 4.
Quanto tempo richiede la lezione «Modelli del mondo e lookahead»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione AI Agents?
Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Decomposizione gerarchica delle attività
- Stack degli obiettivi e backtracking
- Modelli del mondo e lookahead
- Cicli di riflessione e autocritica