0Pricing
AI Prompt Engineering · Lección

En qué se diferencian los modelos de razonamiento

Cadena de pensamiento interna frente a modelos estándar: qué cambia para quien redacta el prompt.

En qué se diferencian los modelos de razonamiento es una lección gratuita de AI Prompt Engineering en CoddyKit. Esta es la lección 1 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Prompt Engineering, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Prompt Engineering incluye 4 lecciones en total.

¿Qué son los modelos de razonamiento?

Los modelos de razonamiento son LLM entrenados y configurados específicamente para llevar a cabo una deliberación interna prolongada antes de producir una respuesta. Algunos ejemplos son las series o1/o3/o4 de OpenAI y Claude de Anthropic con el pensamiento extendido activado.

A diferencia de los modelos estándar, que generan texto directamente token a token a partir de su prompt, los modelos de razonamiento primero producen una cadena de pensamiento interna extensa y después la resumen en una respuesta final.

Estándar frente a razonamiento: lo que usted ve

Desde la perspectiva del usuario de la API, la diferencia es la siguiente:

  • Modelo estándar: entrada → salida (rápido y directo)
  • Modelo de razonamiento: entrada → [pensamiento interno, oculto o transmitido] → salida (más lento, pero más preciso en problemas difíciles)

El proceso de pensamiento es el bloc de notas privado del modelo. Puede contener desvíos, autocorrecciones y cálculos intermedios que nunca aparecen en la respuesta final.

Series o de OpenAI: comportamiento de la API

Los modelos o1/o3/o4 de OpenAI gestionan el pensamiento internamente: los tokens de razonamiento no se muestran de forma predeterminada. Puede consultar el recuento de tokens de pensamiento en los metadatos de uso, pero no su contenido.

import openai

client = openai.OpenAI(api_key='sk-...')

# o3 — reasoning happens internally
response = client.chat.completions.create(
    model='o3',
    messages=[
        {'role': 'user', 'content': 'Solve: A train leaves Chicago at 9am going 60mph. Another leaves NYC at 10am going 80mph. If the distance is 790 miles, when do they meet?'}
    ],
    # reasoning_effort='high'  # Optional: 'low', 'medium', 'high'
)

print(response.choices[0].message.content)
# Check how many tokens were used for thinking:
print('Input tokens:', response.usage.prompt_tokens)
print('Output tokens:', response.usage.completion_tokens)

Pensamiento extendido de Claude: comportamiento de la API

Claude de Anthropic expone los tokens de pensamiento extendido mediante la API. Puede transmitirlos y observar el proceso de razonamiento del modelo en tiempo real. El contenido del pensamiento aparece antes de la respuesta final.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# Enable extended thinking
response = client.messages.create(
    model='claude-opus-4-5',
    max_tokens=16000,
    thinking={
        'type': 'enabled',
        'budget_tokens': 10000  # Max tokens for thinking
    },
    messages=[{
        'role': 'user',
        'content': 'What is the 100th prime number?'
    }]
)

# Response contains both thinking blocks and text blocks
for block in response.content:
    if block.type == 'thinking':
        print('THINKING:', block.thinking[:200], '...')
    elif block.type == 'text':
        print('ANSWER:', block.text)

Transmitir tokens de pensamiento

Puede transmitir el pensamiento extendido en tiempo real y observar el razonamiento del modelo mientras se desarrolla. Esto resulta útil para la experiencia de usuario: puede mostrar una animación de «pensando» o permitir que los usuarios avanzados observen el proceso de razonamiento.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

def stream_with_thinking(question):
    with client.messages.stream(
        model='claude-opus-4-5',
        max_tokens=16000,
        thinking={'type': 'enabled', 'budget_tokens': 8000},
        messages=[{'role': 'user', 'content': question}]
    ) as stream:
        current_block_type = None
        for event in stream:
            # Track which block type we're in
            if hasattr(event, 'type'):
                if 'thinking' in str(event.type):
                    current_block_type = 'thinking'
                elif 'text' in str(event.type):
                    current_block_type = 'text'
            # Print text delta
            if hasattr(event, 'delta') and hasattr(event.delta, 'text'):
                prefix = '[THINK] ' if current_block_type == 'thinking' else '[ANS] '
                print(prefix + event.delta.text, end='', flush=True)

stream_with_thinking('Explain why P != NP is unproven.')

Qué ocurre internamente: el bloc de notas

El pensamiento interno del modelo funciona como un bloc de notas en el que puede:

  • Explorar varios enfoques antes de decidirse por uno
  • Hacer cálculos y verificarlos
  • Identificar sus propios errores y volver atrás
  • Considerar casos límite
  • Planificar soluciones de varios pasos

Esta deliberación interna explica por qué los modelos de razonamiento superan ampliamente a los modelos estándar en matemáticas complejas, programación y planificación estratégica: en esencia, hacen una revisión bibliográfica antes de escribir.

budget_tokens: Control de la profundidad del razonamiento

budget_tokens (Claude) o reasoning_effort (OpenAI) controla cuánto razona el modelo. Más razonamiento implica mayor precisión en problemas difíciles, pero también más coste y latencia.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

def ask_with_budget(question, budget):
    r = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=budget + 2048,  # must exceed budget_tokens
        thinking={'type': 'enabled', 'budget_tokens': budget},
        messages=[{'role': 'user', 'content': question}]
    )
    thinking_tokens = sum(
        len(b.thinking.split()) * 1.3  # rough estimate
        for b in r.content if b.type == 'thinking'
    )
    answer = next(b.text for b in r.content if b.type == 'text')
    return answer, int(thinking_tokens)

# Same hard question with different budgets
q = 'Prove that the square root of 2 is irrational.'
ans_small, tok_small = ask_with_budget(q, 1024)
ans_large, tok_large = ask_with_budget(q, 8000)
print(f'Small budget ({tok_small} thinking tokens): {ans_small[:100]}')
print(f'Large budget ({tok_large} thinking tokens): {ans_large[:100]}')

Temperatura y modelos de razonamiento

Los modelos de razonamiento se comportan de forma diferente con la configuración de temperatura:

  • Para los modelos o-series de OpenAI: la temperatura es 1 de forma predeterminada y no siempre se puede cambiar
  • Para el extended thinking de Claude: normalmente se establece en 1 durante el razonamiento

No intente utilizar la temperatura para controlar el comportamiento de los modelos de razonamiento; utilice budget_tokens o reasoning_effort en su lugar.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# For Claude with extended thinking, temperature=1 is the default
# and best practice
response = client.messages.create(
    model='claude-opus-4-5',
    max_tokens=10000,
    temperature=1,  # Required to be 1 when extended thinking is enabled
    thinking={
        'type': 'enabled',
        'budget_tokens': 5000
    },
    messages=[{
        'role': 'user',
        'content': 'Write a Python function to find all prime numbers up to N.'
    }]
)
print(response.content[-1].text[:300])

Pruebas de rendimiento: dónde destacan los modelos de razonamiento

Los modelos de razonamiento superan a los modelos estándar especialmente en:

  • Matemáticas de competición: AIME, AMC (o3 se aproxima al nivel de un experto humano)
  • Programación compleja: programación competitiva (Codeforces)
  • Razonamiento científico: GPQA (ciencia de nivel de posgrado)
  • Lógica en varios pasos: problemas que requieren deducciones secuenciales

En tareas sencillas (gramática, resúmenes, preguntas y respuestas objetivas), los modelos estándar ofrecen un rendimiento igual de bueno con un coste entre 10 y 100 veces menor.

La realidad de la latencia

Los modelos de razonamiento son lentos. Un problema difícil con un alto nivel de razonamiento puede tardar entre 30 y 60 segundos. Planifique su UX en consecuencia:

  • Muestre indicadores de progreso como «pensando...»
  • Utilice streaming para mostrar resultados parciales cuando estén disponibles
  • No utilice modelos de razonamiento para chats en tiempo real en los que la latencia sea importante
  • Calcule previamente las respuestas de los modelos de razonamiento para preguntas difíciles conocidas
import time
import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

def timed_reasoning_call(question, budget):
    start = time.time()
    response = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=budget + 2000,
        thinking={'type': 'enabled', 'budget_tokens': budget},
        messages=[{'role': 'user', 'content': question}]
    )
    elapsed = time.time() - start
    answer = next(b.text for b in response.content if b.type == 'text')
    print(f'Latency: {elapsed:.1f}s | Answer: {answer[:100]}')
    return answer

# Hard problem — expect 20-45 seconds
timed_reasoning_call(
    'Design a database schema for a multi-tenant SaaS billing system.',
    budget=8000
)

Modelos de razonamiento y prompts del sistema

Los modelos de razonamiento responden a los prompts del sistema de forma diferente a los modelos estándar. Como deliberan internamente antes de responder, pueden seguir instrucciones complejas de varios pasos en los prompts del sistema de forma más fiable.

Sin embargo, los prompts del sistema muy largos y restrictivos pueden entrar en conflicto con el razonamiento interno. Práctica recomendada: mantenga concisos los prompts del sistema para los modelos de razonamiento; defina el rol y el formato de salida, y deje que el razonamiento interno del modelo se encargue de la estrategia.

Comprobación de conocimientos: el razonamiento de los modelos

¿Cuál es la diferencia clave entre lo que proporciona el autor del prompt y lo que sucede internamente en un modelo de razonamiento?

Resumen: en qué se diferencian los modelos de razonamiento

Los modelos de razonamiento, como o1/o3 y Claude con extended thinking, ejecutan una cadena de pensamiento interna antes de responder. El autor del prompt proporciona un problema; el modelo delibera internamente, explora distintos enfoques y se autocorrige, y después genera una respuesta final. Puede controlar la profundidad del razonamiento con budget_tokens (Claude) o reasoning_effort (OpenAI). Los modelos de razonamiento destacan en matemáticas complejas, programación y lógica en varios pasos, pero son entre 10 y 100 veces más caros y entre 10 y 100 veces más lentos que los modelos estándar. Utilice streaming e indicadores de progreso para gestionar la latencia en su UX.

Preguntas frecuentes

¿La lección «En qué se diferencian los modelos de razonamiento» es gratis?

Sí — el texto completo de «En qué se diferencian los modelos de razonamiento» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Prompt Engineering, actualiza a CoddyKit PRO. El curso de AI Prompt Engineering incluye 4 lecciones en total.

¿Qué aprenderé en «En qué se diferencian los modelos de razonamiento»?

Cadena de pensamiento interna frente a modelos estándar: qué cambia para quien redacta el prompt. Practicas AI Prompt Engineering con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Prompt Engineering?

No se requiere experiencia previa. AI Prompt Engineering en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 1 de 4.

¿Cuánto tiempo toma la lección «En qué se diferencian los modelos de razonamiento»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Prompt Engineering?

Sí. Cada lección de AI Prompt Engineering incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. En qué se diferencian los modelos de razonamiento
  2. Prompts eficaces para el razonamiento prolongado
  3. Cuándo usar modelos de razonamiento frente a modelos estándar
  4. Compromisos entre coste y latencia
← Volver a AI Prompt Engineering