0Pricing
AI Agents · Aula

Orçamentos de tokens por etapa

Limite os tokens de entrada e saída por nó para que um ciclo descontrolado não leve você à falência.

Orçamentos de tokens por etapa é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.

Tokens custam dinheiro

Cada token enviado ou recebido custa dinheiro e tempo. Agentes de produção acompanham o uso de tokens em cada etapa e impõem limites.

Defina max_tokens em toda parte

Sempre defina max_tokens em cada chamada. Sem isso, uma instrução com erro pode produzir respostas com 10.000 tokens:

response = client.chat.completions.create(
    model='gpt-4o-mini',
    messages=messages,
    max_tokens=1024,   # cap per response
)

Limites por etapa em um ciclo de agente

Etapas diferentes precisam de orçamentos diferentes:

STEP_BUDGETS = {
    'planner': 512,
    'classifier': 64,
    'final_synthesis': 2048,
    'tool_call': 256
}

response = client.chat.completions.create(
    model=model,
    messages=messages,
    max_tokens=STEP_BUDGETS[step_name]
)

Reduza os tokens de entrada

Os tokens de entrada também têm custo. Reduza-os de forma agressiva:

import tiktoken
enc = tiktoken.encoding_for_model('gpt-4o-mini')

def trim_to_budget(text, max_tokens=4000):
    toks = enc.encode(text)
    if len(toks) > max_tokens:
        return enc.decode(toks[:max_tokens])
    return text

Orçamento total por execução

Some a entrada e a saída de todas as etapas; aborte se o limite for ultrapassado:

MAX_TOKENS_PER_RUN = 50_000
total = 0
for step in agent_steps:
    r = call_step(step)
    total += r.usage.total_tokens
    if total > MAX_TOKENS_PER_RUN:
        return 'Budget exhausted; partial result'

Limites de custo em dinheiro

Às vezes, definir o orçamento em dinheiro é mais significativo:

PRICES = {'gpt-4o-mini': {'in': 0.15e-6, 'out': 0.60e-6}}

for step in agent_steps:
    r = call_step(step)
    cost = r.usage.prompt_tokens * PRICES[model]['in'] + r.usage.completion_tokens * PRICES[model]['out']
    total_cost += cost
    if total_cost > MAX_COST_PER_RUN:
        break

Orçamentos adaptativos

Gaste mais tokens nas etapas mais difíceis:

if step_difficulty == 'easy':
    max_tokens = 256
elif step_difficulty == 'hard':
    max_tokens = 2048

Estimativa do tamanho da saída

Às vezes, pergunte ao modelo qual deve ser o tamanho da resposta:

preview = llm.invoke(f'How many tokens (approx) does {question} need to answer?').content
budget = parse_int(preview, default=512)
final = llm.invoke(question, max_tokens=budget)

Trunque as saídas das ferramentas

Saídas grandes de ferramentas (HTML, registros) aumentam o contexto. Faça o truncamento antes de enviá-las ao modelo:

tool_result = run_tool(...)
text = json.dumps(tool_result)
if len(text) > 4000:
    text = text[:4000] + '\n...[truncated]'

Comprima o histórico

Em conversas longas, resuma as interações mais antigas para economizar tokens:

if total_message_tokens(messages) > 8000:
    messages = compact(messages)

O formato da saída afeta os tokens

JSON é prolixo. Para respostas estruturadas curtas, considere:

  • Um único argumento de chamada de ferramenta
  • Uma lista separada por vírgulas
  • Um formato personalizado compacto

Acompanhe a distribuição dos tokens

Histogramas por etapa revelam quais etapas devem ser otimizadas:

metrics.observe('step.planner.tokens', r.usage.total_tokens, tags={'agent': 'qa'})

Por que usar max_tokens?

Por que definir max_tokens em cada chamada de LLM?

Recapitulação

Defina um limite de max_tokens em cada chamada. Reduza as entradas. Defina orçamentos por etapa. Estabeleça limites totais por execução. Acompanhe as distribuições. Comprima o histórico.

Perguntas Frequentes

A aula “Orçamentos de tokens por etapa” é grátis?

Sim — o texto completo de “Orçamentos de tokens por etapa” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.

O que vou aprender em “Orçamentos de tokens por etapa”?

Limite os tokens de entrada e saída por nó para que um ciclo descontrolado não leve você à falência. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Agents?

Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.

Quanto tempo leva a aula “Orçamentos de tokens por etapa”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Agents?

Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Orçamentos de tokens por etapa
  2. Roteamento de modelos (barato -> caro)
  3. Armazenamento em cache de instruções e resultados (Anthropic, Vertex)
  4. Quantização e decodificação especulativa
← Voltar para AI Agents