AI Prompt Engineering · Lección

Cuándo usar modelos de razonamiento frente a modelos estándar

Tipos de problemas en los que el razonamiento prolongado resulta útil: matemáticas, código y lógica de varios pasos.

Lección 3 de 413 pasos

Cuándo usar modelos de razonamiento frente a modelos estándar es una lección gratuita de AI Prompt Engineering en CoddyKit. Esta es la lección 3 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Prompt Engineering, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Prompt Engineering incluye 4 lecciones en total.

No todas las tareas necesitan modelos de razonamiento

Los modelos de razonamiento son potentes, pero caros y lentos. Elegir el tipo de modelo adecuado para cada tarea es una de las decisiones más importantes en el diseño de sistemas LLM.

La pregunta fundamental es: ¿esta tarea se beneficia realmente de una deliberación prolongada? Muchas tareas no lo hacen, y utilizar un modelo de razonamiento en ellas desperdicia dinero sin mejorar la calidad.

Dónde destacan los modelos de razonamiento: matemáticas en varios pasos

Los modelos de razonamiento superan ampliamente a los modelos estándar en problemas matemáticos que requieren varios pasos, especialmente cuando los errores se acumulan entre ellos.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# Multi-step math: use reasoning model
hard_math_prompt = (
    'A company has 3 factories. Factory A produces 240 units/day, '
    'Factory B produces 180 units/day, and Factory C produces 300 units/day. '
    'They operate 5 days/week. A unit sells for $47.50. Operating costs are '
    '$18,000/week for A, $14,500/week for B, and $22,000/week for C. '
    'What is the total weekly profit across all factories?'
)

response = client.messages.create(
    model='claude-opus-4-5',
    max_tokens=8000,
    thinking={'type': 'enabled', 'budget_tokens': 5000},
    messages=[{'role': 'user', 'content': hard_math_prompt}]
)
print(next(b.text for b in response.content if b.type == 'text'))

Dónde destacan los modelos de razonamiento: código complejo

En problemas algorítmicos —implementar estructuras de datos, depurar errores lógicos sutiles o diseñar soluciones eficientes—, los modelos de razonamiento superan a los modelos estándar porque pueden explorar internamente varios enfoques antes de decidirse por uno.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# Complex coding: use reasoning model
code_prompt = (
    'Implement a thread-safe LRU cache in Python with these requirements:\n'
    '- O(1) get and put operations\n'
    '- Thread-safe using minimal locking\n'
    '- Support a max_size parameter\n'
    '- Include full docstrings and type hints\n'
    '- Handle edge cases: empty cache, size=1, duplicate keys'
)

response = client.messages.create(
    model='claude-opus-4-5',
    max_tokens=10000,
    thinking={'type': 'enabled', 'budget_tokens': 8000},
    messages=[{'role': 'user', 'content': code_prompt}]
)
code = next(b.text for b in response.content if b.type == 'text')
print(code[:400])

Dónde destacan los modelos de razonamiento: planificación estratégica

Las tareas que requieren evaluar varias opciones contrapuestas, sopesar compromisos en muchas dimensiones y considerar consecuencias a largo plazo se benefician de un razonamiento prolongado. Algunos ejemplos son las decisiones de diseño de arquitectura, la evaluación de hojas de ruta de productos y el análisis de inversiones.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# Strategic decision: reasoning model adds real value
strategy_prompt = (
    'We are a B2B SaaS startup with $2M ARR, 15% monthly churn, '
    '3 engineers, and $800K runway. We have two options:\n'
    'A) Raise a Series A now at a $10M valuation\n'
    'B) Cut costs, extend runway 18 months, raise at higher valuation\n\n'
    'Analyze the trade-offs and recommend a course of action with reasoning.'
)

response = client.messages.create(
    model='claude-opus-4-5',
    max_tokens=10000,
    thinking={'type': 'enabled', 'budget_tokens': 8000},
    messages=[{'role': 'user', 'content': strategy_prompt}]
)
print(next(b.text for b in response.content if b.type == 'text')[:400])

Dónde destacan los modelos estándar: preguntas y respuestas sencillas

Las preguntas objetivas con respuestas directas no se benefician de un razonamiento prolongado. Utilizar o3 o Claude extended thinking para «¿Cuál es la capital de Francia?» supone gastar entre 20 y 50 veces más dinero con resultados idénticos.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# Simple Q&A: standard model is just as good, much cheaper
simple_questions = [
    'What is the capital of France?',
    'Who wrote Hamlet?',
    'What year did the Berlin Wall fall?',
]

for q in simple_questions:
    # Use claude-haiku-4-5 — fast, cheap, equally accurate for factual recall
    r = client.messages.create(
        model='claude-haiku-4-5',
        max_tokens=50,
        messages=[{'role': 'user', 'content': q}]
    )
    print(f'Q: {q}\nA: {r.content[0].text}\n')

# Reasoning model would give the same answers at 50-100x the cost

Dónde destacan los modelos estándar: formato del texto

Reformatear, resumir, traducir y transformar texto no requiere un razonamiento profundo, sino fluidez lingüística. Los modelos estándar destacan en estas tareas con un coste y una latencia mucho menores.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# Text formatting tasks: standard model wins
formatting_tasks = [
    ('Summarize in 2 sentences: The Eiffel Tower was built in 1889...', 100),
    ('Translate to Spanish: Good morning, how are you?', 50),
    ('Convert to bullet points: We need to buy milk, eggs, and bread.', 50),
]

for prompt, max_tok in formatting_tasks:
    r = client.messages.create(
        model='claude-haiku-4-5',  # Fastest, cheapest
        max_tokens=max_tok,
        messages=[{'role': 'user', 'content': prompt}]
    )
    print(r.content[0].text, '\n')

# Reasoning model: same quality, 50-100x more expensive, 10-30x slower

Dónde destacan los modelos estándar: aplicaciones de baja latencia

Las aplicaciones en tiempo real —chatbots, autocompletado y asistencia en directo— no pueden tolerar tiempos de respuesta de 30-60 segundos. Los modelos estándar responden en 1-5 segundos. Utilícelos para las interacciones en tiempo real orientadas al usuario.

import anthropic
import time

client = anthropic.Anthropic(api_key='sk-ant-...')

def latency_comparison(question):
    # Standard model: fast for real-time use
    start = time.time()
    r1 = client.messages.create(
        model='claude-haiku-4-5',
        max_tokens=200,
        messages=[{'role': 'user', 'content': question}]
    )
    t_standard = time.time() - start

    # Reasoning model: accurate but slow
    start = time.time()
    r2 = client.messages.create(
        model='claude-opus-4-5',
        max_tokens=5000,
        thinking={'type': 'enabled', 'budget_tokens': 3000},
        messages=[{'role': 'user', 'content': question}]
    )
    t_reasoning = time.time() - start

    print(f'Standard: {t_standard:.1f}s | Reasoning: {t_reasoning:.1f}s')

latency_comparison('What does API stand for?')

Problemas de razonamiento ambiguos

Algunos problemas son ambiguos: la respuesta correcta depende de supuestos que no se han especificado. Los modelos de razonamiento los gestionan mejor que los modelos estándar porque exploran internamente varias interpretaciones y eligen la más defendible.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

# Ambiguous reasoning: reasoning model handles this much better
ambiguous_prompt = (
    'Alice, Bob, and Carol are in a room. Alice says Bob is lying. '
    'Bob says Carol is lying. Carol says both Alice and Bob are lying. '
    'Who, if anyone, is telling the truth? '
    'Explain all possible consistent interpretations.'
)

# Reasoning model explores the logical space
response = client.messages.create(
    model='claude-opus-4-5',
    max_tokens=8000,
    thinking={'type': 'enabled', 'budget_tokens': 6000},
    messages=[{'role': 'user', 'content': ambiguous_prompt}]
)
print(next(b.text for b in response.content if b.type == 'text')[:400])

Marco de decisión: qué modelo utilizar

Un árbol de decisión práctico para elegir entre modelos estándar y de razonamiento:

  • ¿El problema tiene complejidad matemática o requiere lógica en varios pasos? → Razonamiento
  • ¿Requiere evaluar compromisos con muchas variables? → Razonamiento
  • ¿Es una recuperación de datos objetivos, un resumen o una traducción? → Estándar
  • ¿Necesita un tiempo de respuesta inferior a 2 segundos? → Estándar
  • ¿Es crítico el coste por consulta a gran escala? → Estándar (salvo que la diferencia de calidad sea grande)
  • ¿Es fundamental acertar en casos extremos difíciles (médicos, legales o financieros)? → Razonamiento

Enrutamiento híbrido: lo mejor de ambos mundos

En producción, utilice una capa de enrutamiento que clasifique las consultas y las dirija al nivel de modelo adecuado. Las consultas sencillas se envían a modelos rápidos y económicos; las consultas complejas se derivan a modelos de razonamiento.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

def classify_complexity(query):
    prompt = (
        f'Classify this query as SIMPLE or COMPLEX:\n'
        f'SIMPLE: factual, formatting, translation, short Q&A\n'
        f'COMPLEX: multi-step reasoning, analysis, code design, math\n\n'
        f'Query: {query}\n\n'
        f'Reply with only SIMPLE or COMPLEX.'
    )
    r = client.messages.create(
        model='claude-haiku-4-5',
        max_tokens=10,
        messages=[{'role': 'user', 'content': prompt}]
    )
    return r.content[0].text.strip()

def smart_query(query):
    complexity = classify_complexity(query)
    if complexity == 'SIMPLE':
        model, thinking = 'claude-haiku-4-5', None
    else:
        model = 'claude-opus-4-5'
        thinking = {'type': 'enabled', 'budget_tokens': 8000}

    kwargs = {'model': model, 'max_tokens': 2048, 'messages': [{'role': 'user', 'content': query}]}
    if thinking:
        kwargs['thinking'] = thinking
        kwargs['max_tokens'] = 10000

    r = client.messages.create(**kwargs)
    print(f'Used: {model} ({complexity})')
    return r.content[-1].text

Evaluar cuándo ayuda el razonamiento

No dé por hecho que el razonamiento siempre ayuda. Mídalo. Compare la precisión de los modelos estándar y de razonamiento en su tipo de tarea específico utilizando un conjunto de evaluación etiquetado.

import anthropic

client = anthropic.Anthropic(api_key='sk-ant-...')

def compare_models_on_task(task_examples, metric_fn):
    results = {'standard': [], 'reasoning': []}

    for ex in task_examples:
        # Standard model
        r_std = client.messages.create(
            model='claude-haiku-4-5',
            max_tokens=200,
            messages=[{'role': 'user', 'content': ex.question}]
        )
        results['standard'].append(
            metric_fn(ex.answer, r_std.content[0].text)
        )

        # Reasoning model
        r_rsn = client.messages.create(
            model='claude-opus-4-5',
            max_tokens=8000,
            thinking={'type': 'enabled', 'budget_tokens': 5000},
            messages=[{'role': 'user', 'content': ex.question}]
        )
        ans = next(b.text for b in r_rsn.content if b.type == 'text')
        results['reasoning'].append(metric_fn(ex.answer, ans))

    for model, scores in results.items():
        avg = sum(scores) / len(scores)
        print(f'{model}: {avg:.1%}')
    return results

Comprobación de conocimientos: enrutamiento de tareas

¿Qué tipo de tarea tiene MENOS probabilidades de beneficiarse de un modelo de razonamiento frente a un modelo estándar?

Resumen: cuándo utilizar modelos de razonamiento frente a modelos estándar

Utilice modelos de razonamiento para: matemáticas en varios pasos, programación algorítmica compleja, planificación estratégica, problemas de lógica ambiguos y decisiones críticas en las que la precisión sea más importante que el coste. Utilice modelos estándar para: preguntas y respuestas sencillas, formato del texto, traducción, resúmenes y todas las aplicaciones en tiempo real sensibles a la latencia. En producción, cree una capa de enrutamiento que clasifique la complejidad de las consultas y dirija cada solicitud al nivel de modelo adecuado. Mida siempre si el razonamiento mejora realmente la precisión en su tarea específica antes de asumir un coste entre 20 y 100 veces mayor.

Gratis para empezar

Aprende AI Prompt Engineering con un tutor de IA — gratis

Escribe y ejecuta código real en tu navegador, obtén ayuda instantánea de un tutor de IA disponible 24/7 y continúa donde lo dejaste en la web o en la aplicación.

Cursos
53
Lecciones
199

Preguntas frecuentes

¿La lección «Cuándo usar modelos de razonamiento frente a modelos estándar» es gratis?

Sí — el texto completo de «Cuándo usar modelos de razonamiento frente a modelos estándar» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Prompt Engineering, actualiza a CoddyKit PRO. El curso de AI Prompt Engineering incluye 4 lecciones en total.

¿Qué aprenderé en «Cuándo usar modelos de razonamiento frente a modelos estándar»?

Tipos de problemas en los que el razonamiento prolongado resulta útil: matemáticas, código y lógica de varios pasos. Practicas AI Prompt Engineering con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Prompt Engineering?

No se requiere experiencia previa. AI Prompt Engineering en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 3 de 4.

¿Cuánto tiempo toma la lección «Cuándo usar modelos de razonamiento frente a modelos estándar»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Prompt Engineering?

Sí. Cada lección de AI Prompt Engineering incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. En qué se diferencian los modelos de razonamiento
  2. Prompts eficaces para el razonamiento prolongado
  3. Cuándo usar modelos de razonamiento frente a modelos estándar
  4. Compromisos entre coste y latencia
← Volver a AI Prompt Engineering