Controle de custos: contagem de tokens e orçamentos
Conte tokens com tiktoken, estime o custo antes do envio e aplique orçamentos por solicitação e por dia.
Controle de custos: contagem de tokens e orçamentos é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.
Por que a contagem de tokens é importante
Você paga por token. Um laço de agente sem controle e sem orçamento de tokens pode gastar centenas de dólares em poucos minutos.
A contagem de tokens é o hábito mais importante para controlar custos.
O que é um token?
Um token é um trecho de texto processado pelo modelo. Regras práticas aproximadas para o inglês:
- 1 token ~ 4 caracteres
- 1 token ~ 0,75 palavra
- 100 tokens ~ 75 palavras
Código, emojis e textos que não estão em inglês usam mais tokens por caractere.
Contagem de tokens com tiktoken (OpenAI)
A OpenAI disponibiliza um tokenizador exato:
# pip install tiktoken
import tiktoken
enc = tiktoken.encoding_for_model('gpt-4o-mini')
tokens = enc.encode('Hello, world!')
print(len(tokens)) # 4
print(tokens) # [9906, 11, 1917, 0]Contagem de tokens em mensagens
A contagem completa inclui a sobrecarga da estrutura das mensagens:
def count_message_tokens(messages, model='gpt-4o-mini'):
enc = tiktoken.encoding_for_model(model)
total = 0
for m in messages:
total += 4 # role + structural
total += len(enc.encode(m['content']))
return total + 2 # primingContagem de tokens com Anthropic
A Anthropic oferece um endpoint de contagem no servidor:
count = client.messages.count_tokens(
model='claude-sonnet-4-5',
system='You are helpful.',
messages=[{'role': 'user', 'content': 'Hello'}],
)
print(count.input_tokens)Estimativa do custo antes do envio
Multiplique a quantidade de tokens pelo preço por token, disponível na página de preços do provedor:
INPUT_PRICE = 0.150 / 1_000_000 # gpt-4o-mini: $0.15 / 1M input tokens
OUTPUT_PRICE = 0.600 / 1_000_000
input_tokens = count_message_tokens(messages)
est_input_cost = input_tokens * INPUT_PRICE
print(f'Estimated input cost: ${est_input_cost:.6f}')Acompanhamento do custo real
Depois de cada chamada, some o uso:
total_cost = 0
response = client.chat.completions.create(...)
cost = (
response.usage.prompt_tokens * INPUT_PRICE +
response.usage.completion_tokens * OUTPUT_PRICE
)
total_cost += costOrçamentos por execução
Defina um limite rígido para cada execução do agente:
MAX_COST_PER_RUN = 0.50 # USD
if total_cost > MAX_COST_PER_RUN:
raise BudgetExceeded(f'Cost {total_cost} exceeds limit')Orçamentos diários por usuário
Acompanhe o custo por usuário no Redis e faça a redefinição diariamente:
key = f'cost:{user_id}:{today_date}'
current = float(redis.get(key) or 0)
if current + cost > 5.0:
raise QuotaExceeded()
redis.incrbyfloat(key, cost)
redis.expireat(key, midnight_tomorrow_ts)Limite max_tokens por chamada
A maior fonte acidental de custos é gerar uma resposta de 50.000 tokens. Estabeleça um limite:
response = client.chat.completions.create(
model='gpt-4o-mini',
messages=messages,
max_tokens=2048, # never more than 2k output
)Limite de etapas para agentes
Combine limites de tokens com um limite de etapas, ou seja, o número máximo de iterações:
MAX_STEPS = 20
for step in range(MAX_STEPS):
response = run_step(...)
if response.is_final():
break
else:
raise StepLimitExceeded()Limite de tokens da saída
Por que definir max_tokens explicitamente?
Recapitulação
Contagem de tokens, max_tokens por chamada, orçamentos por execução, cotas por usuário e limites de etapas. Combine os cinco para obter segurança em produção.
Aprenda AI Agents com um tutor de IA — grátis
Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.
- Cursos
- 60
- Aulas
- 239
Perguntas Frequentes
A aula “Controle de custos: contagem de tokens e orçamentos” é grátis?
Sim — o texto completo de “Controle de custos: contagem de tokens e orçamentos” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.
O que vou aprender em “Controle de custos: contagem de tokens e orçamentos”?
Conte tokens com tiktoken, estime o custo antes do envio e aplique orçamentos por solicitação e por dia. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Agents?
Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.
Quanto tempo leva a aula “Controle de custos: contagem de tokens e orçamentos”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Agents?
Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Chamando a API da OpenAI: chat.completions
- Chamando a API da Anthropic: messages
- Transmissão de respostas (SSE)
- Controle de custos: contagem de tokens e orçamentos