Orçamentos de tokens por etapa
Limite os tokens de entrada e saída por nó para que um ciclo descontrolado não leve você à falência.
Orçamentos de tokens por etapa é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 1 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.
Tokens custam dinheiro
Cada token enviado ou recebido custa dinheiro e tempo. Agentes de produção acompanham o uso de tokens em cada etapa e impõem limites.
Defina max_tokens em toda parte
Sempre defina max_tokens em cada chamada. Sem isso, uma instrução com erro pode produzir respostas com 10.000 tokens:
response = client.chat.completions.create(
model='gpt-4o-mini',
messages=messages,
max_tokens=1024, # cap per response
)Limites por etapa em um ciclo de agente
Etapas diferentes precisam de orçamentos diferentes:
STEP_BUDGETS = {
'planner': 512,
'classifier': 64,
'final_synthesis': 2048,
'tool_call': 256
}
response = client.chat.completions.create(
model=model,
messages=messages,
max_tokens=STEP_BUDGETS[step_name]
)Reduza os tokens de entrada
Os tokens de entrada também têm custo. Reduza-os de forma agressiva:
import tiktoken
enc = tiktoken.encoding_for_model('gpt-4o-mini')
def trim_to_budget(text, max_tokens=4000):
toks = enc.encode(text)
if len(toks) > max_tokens:
return enc.decode(toks[:max_tokens])
return textOrçamento total por execução
Some a entrada e a saída de todas as etapas; aborte se o limite for ultrapassado:
MAX_TOKENS_PER_RUN = 50_000
total = 0
for step in agent_steps:
r = call_step(step)
total += r.usage.total_tokens
if total > MAX_TOKENS_PER_RUN:
return 'Budget exhausted; partial result'Limites de custo em dinheiro
Às vezes, definir o orçamento em dinheiro é mais significativo:
PRICES = {'gpt-4o-mini': {'in': 0.15e-6, 'out': 0.60e-6}}
for step in agent_steps:
r = call_step(step)
cost = r.usage.prompt_tokens * PRICES[model]['in'] + r.usage.completion_tokens * PRICES[model]['out']
total_cost += cost
if total_cost > MAX_COST_PER_RUN:
breakOrçamentos adaptativos
Gaste mais tokens nas etapas mais difíceis:
if step_difficulty == 'easy':
max_tokens = 256
elif step_difficulty == 'hard':
max_tokens = 2048Estimativa do tamanho da saída
Às vezes, pergunte ao modelo qual deve ser o tamanho da resposta:
preview = llm.invoke(f'How many tokens (approx) does {question} need to answer?').content
budget = parse_int(preview, default=512)
final = llm.invoke(question, max_tokens=budget)Trunque as saídas das ferramentas
Saídas grandes de ferramentas (HTML, registros) aumentam o contexto. Faça o truncamento antes de enviá-las ao modelo:
tool_result = run_tool(...)
text = json.dumps(tool_result)
if len(text) > 4000:
text = text[:4000] + '\n...[truncated]'Comprima o histórico
Em conversas longas, resuma as interações mais antigas para economizar tokens:
if total_message_tokens(messages) > 8000:
messages = compact(messages)O formato da saída afeta os tokens
JSON é prolixo. Para respostas estruturadas curtas, considere:
- Um único argumento de chamada de ferramenta
- Uma lista separada por vírgulas
- Um formato personalizado compacto
Acompanhe a distribuição dos tokens
Histogramas por etapa revelam quais etapas devem ser otimizadas:
metrics.observe('step.planner.tokens', r.usage.total_tokens, tags={'agent': 'qa'})Por que usar max_tokens?
Por que definir max_tokens em cada chamada de LLM?
Recapitulação
Defina um limite de max_tokens em cada chamada. Reduza as entradas. Defina orçamentos por etapa. Estabeleça limites totais por execução. Acompanhe as distribuições. Comprima o histórico.
Perguntas Frequentes
A aula “Orçamentos de tokens por etapa” é grátis?
Sim — o texto completo de “Orçamentos de tokens por etapa” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.
O que vou aprender em “Orçamentos de tokens por etapa”?
Limite os tokens de entrada e saída por nó para que um ciclo descontrolado não leve você à falência. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Agents?
Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 1 de 4.
Quanto tempo leva a aula “Orçamentos de tokens por etapa”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Agents?
Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Orçamentos de tokens por etapa
- Roteamento de modelos (barato -> caro)
- Armazenamento em cache de instruções e resultados (Anthropic, Vertex)
- Quantização e decodificação especulativa