Modelos del mundo y anticipación
Prediga el resultado de una acción antes de realizarla; elija la acción con el mejor resultado previsto.
Modelos del mundo y anticipación es una lección gratuita de AI Agents en CoddyKit. Esta es la lección 3 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Agents, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Agents incluye 4 lecciones en total.
Partes de esta lección aún no han sido traducidas y se muestran en inglés.
Prediga antes de actuar
Los mejores agentes no se limitan a probar cosas: primero predicen los resultados, eligen la mejor opción y después actúan. Es la misma idea que buscar N movimientos por adelantado en ajedrez.
¿Qué es un modelo del mundo?
Un modelo del mundo predice lo siguiente: dado el estado actual S y la acción A, ¿cuál es el estado siguiente S'?
En un agente basado en un LLM, el propio LLM puede ser el modelo del mundo:
prediction_prompt = '''
Current state: {state}
Proposed action: {action}
What is the most likely outcome? Return JSON: {new_state, success_probability}.
'''Por qué ayuda anticiparse
Algunas acciones son irreversibles (enviar un correo electrónico, eliminar datos). Predecir primero puede evitar errores costosos.
Otras acciones tienen resultados inciertos. Predecir obliga al agente a pensar en las consecuencias.
Simple 1-Step Lookahead
candidates = [a1, a2, a3]
predictions = [predict(state, a) for a in candidates]
best = max(zip(predictions, candidates), key=lambda p: p[0].success_probability)[1]
act(best)Anticipación de varios pasos (búsqueda en árbol)
Amplíe la búsqueda varios pasos por adelantado. Para cada candidata, prediga los resultados y después prediga los resultados de esos resultados:
def search(state, depth=2):
if depth == 0:
return value(state)
actions = candidate_actions(state)
best_score = -math.inf
for a in actions:
next_state = predict(state, a)
score = search(next_state, depth - 1)
best_score = max(best_score, score)
return best_scoreÁrbol de pensamientos
Yao et al. 2023: amplía CoT a un árbol. El agente genera varias "rutas de pensamiento", evalúa cada una y amplía la más prometedora:
import random
def continue_thought(question):
return question + ' -> idea' + str(random.randint(1, 100))
def score(t):
return len(t)
def expand_top_k(thoughts, scores, k):
ranked = sorted(zip(thoughts, scores), key=lambda x: -x[1])
return [t for t, s in ranked[:k]]
def ToT(question):
thoughts = [continue_thought(question) for _ in range(5)]
for depth in range(2):
scores = [score(t) for t in thoughts]
thoughts = expand_top_k(thoughts, scores, k=3)
return thoughts
result = ToT('How to reduce agent latency?')
print('Top thoughts:', result)
Búsqueda de árbol de Monte Carlo (MCTS)
Para árboles de búsqueda muy grandes: muestree rutas, puntúe los resultados y propague las puntuaciones hacia arriba para orientar selecciones futuras. Se utiliza mucho en la IA para juegos y está empezando a usarse en la investigación sobre agentes.
Coste de anticiparse
Cada acción predicha es una llamada al LLM. Una anticipación con depth=2 y branch=3 requiere 9 llamadas solo para decidir UNA acción. Utilice la anticipación únicamente para decisiones de alto riesgo.
Poda heurística
Omita las predicciones de acciones claramente malas. Filtre previamente las acciones candidatas con un clasificador económico o una regla.
Calibración de predicciones
Las predicciones de los LLM son imperfectas. Calíbrelas comparando ocasionalmente los resultados predichos con los reales:
for trace in recent_traces:
predicted = trace.predicted_outcome
actual = trace.actual_outcome
log.info('prediction-accuracy', match=(predicted == actual))Cuándo NO utilizar la anticipación
- Acciones económicas y reversibles: simplemente pruébelas
- Rutas críticas para la latencia
- Tareas cuyos resultados son evidentes
Cuándo SÍ utilizar la anticipación
- Acciones irreversibles (financieras, de comunicación)
- Planes de varios pasos en los que los errores se acumulan
- Ámbitos de alto riesgo (médico, jurídico)
- Tareas adversariales (juegos, debates)
Anticipación interna al estilo de o1
Los modelos de razonamiento OpenAI o1 / o3 realizan automáticamente una anticipación interna durante la fase de "pensamiento". Exploran muchas continuaciones antes de decidirse. No necesita implementarla externamente.
Compromiso de la anticipación
¿Cuál es el principal coste de anticiparse varios pasos?
Repaso
Prediga antes de actuar. La anticipación de un paso es económica y útil; la búsqueda en árbol es costosa, pero potente. Los modelos de razonamiento (o1, o3) automatizan este proceso. Utilícela con moderación.
Preguntas frecuentes
¿La lección «Modelos del mundo y anticipación» es gratis?
Sí — el texto completo de «Modelos del mundo y anticipación» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Agents, actualiza a CoddyKit PRO. El curso de AI Agents incluye 4 lecciones en total.
¿Qué aprenderé en «Modelos del mundo y anticipación»?
Prediga el resultado de una acción antes de realizarla; elija la acción con el mejor resultado previsto. Practicas AI Agents con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar AI Agents?
No se requiere experiencia previa. AI Agents en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 3 de 4.
¿Cuánto tiempo toma la lección «Modelos del mundo y anticipación»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de AI Agents?
Sí. Cada lección de AI Agents incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Descomposición jerárquica de tareas
- Pilas de objetivos y retroceso
- Modelos del mundo y anticipación
- Bucles de reflexión y autocrítica