Razonamiento agéntico (o1, o3, modelos de razonamiento)
Modelos que «piensan» antes de responder: cadenas de pensamiento internas, cómputo en tiempo de prueba y autocorrección.
Razonamiento agéntico (o1, o3, modelos de razonamiento) es una lección gratuita de AI Agents en CoddyKit. Esta es la lección 1 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Agents, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Agents incluye 4 lecciones en total.
Partes de esta lección aún no han sido traducidas y se muestran en inglés.
Una nueva clase de modelos
OpenAI o1 (septiembre de 2024) introdujo los «modelos de razonamiento»: LLM que razonan explícitamente paso a paso antes de producir la respuesta visible. Entre sus sucesores se incluyen o3, DeepSeek R1, Claude con extended thinking, Gemini 2.5 thinking y muchos otros.
Cómo funcionan
En lugar de generar la respuesta de inmediato, el modelo:
- Produce una larga secuencia interna de «pensamiento» (estilo CoT)
- Explora varios enfoques
- Se autocorrige
- Después emite la respuesta final visible
Cómputo en tiempo de prueba
Puede elegir cuánto «piensa» el modelo. Cuantos más tokens se dediquen al razonamiento, mejores serán las respuestas en problemas difíciles. La desventaja es la latencia y el costo.
OpenAI o-Series API
response = client.chat.completions.create(
model='o3-mini',
messages=[{'role': 'user', 'content': 'Solve this puzzle...'}],
reasoning_effort='high' # low / medium / high
)
print(response.choices[0].message.content)
print(response.usage.reasoning_tokens) # how many 'thinking' tokens were usedAnthropic Extended Thinking
response = client.messages.create(
model='claude-sonnet-4-5',
max_tokens=8192,
thinking={'type': 'enabled', 'budget_tokens': 4096},
messages=[{'role': 'user', 'content': 'Hard reasoning problem'}]
)
# response.content includes 'thinking' blocks + 'text' final answerCuándo destacan los modelos de razonamiento
- Matemáticas de varios pasos
- Generación de código con lógica compleja
- Razonamiento jurídico o científico
- Planificación que requiere anticipación
Pruebas: o3 obtiene >90% en AIME y una puntuación alta en GPQA; está muy por encima de los modelos sin razonamiento.
Cuándo son mejores los modelos estándar
- Chat o preguntas y respuestas sencillas — el razonamiento es innecesario
- Rutas críticas para la latencia — el razonamiento añade segundos
- Procesamiento masivo sensible al costo — el razonamiento multiplica el costo
- Tareas de estilo o formato — no aporta beneficios
Perfil de costos
Los tokens de razonamiento cuentan para el precio. o3-mini con un nivel de esfuerzo alto puede usar entre 10k y 100k tokens de razonamiento por pregunta. Eso puede suponer $0.10 - $1 por pregunta en los modelos de razonamiento más grandes.
Dentro de los bucles del agente
Uso de un modelo de razonamiento como planificador dentro de un agente más grande:
- Modelo de razonamiento: planificar / decidir / evaluar
- Modelo estándar: ejecutar los pasos
- Llamadas a herramientas: ejecutarlas normalmente
Lo mejor de ambos mundos: razonamiento profundo donde importa y ejecución económica en el resto.
No añada CoT a la fuerza
Ya no necesita indicaciones como «pensemos paso a paso» con los modelos de razonamiento: ya realizan CoT internamente. Añadirlo incluso puede perjudicar.
Razonamiento de código abierto
DeepSeek R1, R1-Distill y otros modelos incorporan el razonamiento a los pesos abiertos. Están disponibles en HuggingFace, Together AI, etc.
Frontera de la investigación
- Reflection-tuning — entrenar modelos para que se critiquen a sí mismos
- Inferencia basada en búsqueda — Tree-of-Thoughts, MCTS durante la inferencia
- Entrenamiento en tiempo de prueba — adaptar los pesos para cada consulta
Precaución: razonamiento de caja negra
Los «pensamientos» de los modelos de razonamiento suelen estar ocultos para usted (OpenAI) o resumidos (Anthropic). La transparencia limitada dificulta la depuración; en su lugar, confíe en evaluaciones de entrada y salida.
Cuándo usar modelos de razonamiento
¿Para qué tarea merece más la pena asumir el costo adicional de un modelo de razonamiento?
Resumen
Los modelos de razonamiento (o1, o3, R1, Claude extended thinking) intercambian tiempo y costo por calidad en tareas difíciles. Úselos como planificadores o jueces dentro de los agentes. Evítelos para el chat sencillo.
Preguntas frecuentes
¿La lección «Razonamiento agéntico (o1, o3, modelos de razonamiento)» es gratis?
Sí — el texto completo de «Razonamiento agéntico (o1, o3, modelos de razonamiento)» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Agents, actualiza a CoddyKit PRO. El curso de AI Agents incluye 4 lecciones en total.
¿Qué aprenderé en «Razonamiento agéntico (o1, o3, modelos de razonamiento)»?
Modelos que «piensan» antes de responder: cadenas de pensamiento internas, cómputo en tiempo de prueba y autocorrección. Practicas AI Agents con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar AI Agents?
No se requiere experiencia previa. AI Agents en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 1 de 4.
¿Cuánto tiempo toma la lección «Razonamiento agéntico (o1, o3, modelos de razonamiento)»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de AI Agents?
Sí. Cada lección de AI Agents incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Razonamiento agéntico (o1, o3, modelos de razonamiento)
- Agentes híbridos simbólicos y neuronales
- Agentes multimodales (visión + voz + acción)
- Problemas abiertos: robustez, alineación y memoria a largo plazo