0Pricing
AI Agents · Lección

Presupuestos de tokens por paso

Limite los tokens de entrada y salida de cada nodo para que un bucle descontrolado no le arruine económicamente.

Presupuestos de tokens por paso es una lección gratuita de AI Agents en CoddyKit. Esta es la lección 1 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de AI Agents, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de AI Agents incluye 4 lecciones en total.

Los tokens cuestan dinero

Cada token que envía o recibe cuesta dinero y tiempo. Los agentes de producción registran el uso de tokens en cada paso y aplican límites.

Limite max_tokens en todas partes

Establezca siempre max_tokens en cada llamada. Sin este límite, un prompt defectuoso puede generar respuestas de 10 000 tokens:

response = client.chat.completions.create(
    model='gpt-4o-mini',
    messages=messages,
    max_tokens=1024,   # cap per response
)

Límites por paso en un bucle de agente

Los distintos pasos necesitan presupuestos diferentes:

STEP_BUDGETS = {
    'planner': 512,
    'classifier': 64,
    'final_synthesis': 2048,
    'tool_call': 256
}

response = client.chat.completions.create(
    model=model,
    messages=messages,
    max_tokens=STEP_BUDGETS[step_name]
)

Recorte los tokens de entrada

Los tokens de entrada también tienen un coste. Recórtelos de forma agresiva:

import tiktoken
enc = tiktoken.encoding_for_model('gpt-4o-mini')

def trim_to_budget(text, max_tokens=4000):
    toks = enc.encode(text)
    if len(toks) > max_tokens:
        return enc.decode(toks[:max_tokens])
    return text

Presupuesto total por ejecución

Sume la entrada y la salida de todos los pasos y cancele la ejecución si se supera el límite:

MAX_TOKENS_PER_RUN = 50_000
total = 0
for step in agent_steps:
    r = call_step(step)
    total += r.usage.total_tokens
    if total > MAX_TOKENS_PER_RUN:
        return 'Budget exhausted; partial result'

Límites de coste en dólares

A veces resulta más útil presupuestar en dólares:

PRICES = {'gpt-4o-mini': {'in': 0.15e-6, 'out': 0.60e-6}}

for step in agent_steps:
    r = call_step(step)
    cost = r.usage.prompt_tokens * PRICES[model]['in'] + r.usage.completion_tokens * PRICES[model]['out']
    total_cost += cost
    if total_cost > MAX_COST_PER_RUN:
        break

Presupuestos adaptativos

Gaste más tokens en los pasos más difíciles:

if step_difficulty == 'easy':
    max_tokens = 256
elif step_difficulty == 'hard':
    max_tokens = 2048

Estimación de la longitud de salida

A veces puede preguntar al modelo cuánto debe durar la respuesta:

preview = llm.invoke(f'How many tokens (approx) does {question} need to answer?').content
budget = parse_int(preview, default=512)
final = llm.invoke(question, max_tokens=budget)

Trunque las salidas de las herramientas

Las salidas grandes de las herramientas (HTML, registros) aumentan demasiado el contexto. Trúnquelas antes de enviarlas al modelo:

tool_result = run_tool(...)
text = json.dumps(tool_result)
if len(text) > 4000:
    text = text[:4000] + '\n...[truncated]'

Comprima el historial

En conversaciones largas, resuma los turnos antiguos para ahorrar tokens:

if total_message_tokens(messages) > 8000:
    messages = compact(messages)

El formato de salida afecta a los tokens

JSON es verboso. Para respuestas estructuradas breves, considere:

  • Un único argumento de llamada a herramienta
  • Una lista separada por comas
  • Un formato personalizado compacto

Registre la distribución de tokens

Los histogramas por paso muestran qué pasos debe optimizar:

metrics.observe('step.planner.tokens', r.usage.total_tokens, tags={'agent': 'qa'})

¿Por qué max_tokens?

¿Por qué debe establecer max_tokens en cada llamada a un LLM?

Resumen

Limite max_tokens en cada llamada. Recorte las entradas. Establezca presupuestos por paso. Aplique límites totales por ejecución. Registre las distribuciones. Comprima el historial.

Preguntas frecuentes

¿La lección «Presupuestos de tokens por paso» es gratis?

Sí — el texto completo de «Presupuestos de tokens por paso» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de AI Agents, actualiza a CoddyKit PRO. El curso de AI Agents incluye 4 lecciones en total.

¿Qué aprenderé en «Presupuestos de tokens por paso»?

Limite los tokens de entrada y salida de cada nodo para que un bucle descontrolado no le arruine económicamente. Practicas AI Agents con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar AI Agents?

No se requiere experiencia previa. AI Agents en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 1 de 4.

¿Cuánto tiempo toma la lección «Presupuestos de tokens por paso»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de AI Agents?

Sí. Cada lección de AI Agents incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Presupuestos de tokens por paso
  2. Enrutamiento de modelos (barato -> caro)
  3. Almacenamiento en caché de prompts y resultados (Anthropic, Vertex)
  4. Cuantización y decodificación especulativa
← Volver a AI Agents