AI Agents · Aula

Controle de custos: contagem de tokens e orçamentos

Conte tokens com tiktoken, estime o custo antes do envio e aplique orçamentos por solicitação e por dia.

Aula 4 de 413 etapas

Controle de custos: contagem de tokens e orçamentos é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.

Por que a contagem de tokens é importante

Você paga por token. Um laço de agente sem controle e sem orçamento de tokens pode gastar centenas de dólares em poucos minutos.

A contagem de tokens é o hábito mais importante para controlar custos.

O que é um token?

Um token é um trecho de texto processado pelo modelo. Regras práticas aproximadas para o inglês:

  • 1 token ~ 4 caracteres
  • 1 token ~ 0,75 palavra
  • 100 tokens ~ 75 palavras

Código, emojis e textos que não estão em inglês usam mais tokens por caractere.

Contagem de tokens com tiktoken (OpenAI)

A OpenAI disponibiliza um tokenizador exato:

# pip install tiktoken
import tiktoken

enc = tiktoken.encoding_for_model('gpt-4o-mini')
tokens = enc.encode('Hello, world!')
print(len(tokens))   # 4
print(tokens)        # [9906, 11, 1917, 0]

Contagem de tokens em mensagens

A contagem completa inclui a sobrecarga da estrutura das mensagens:

def count_message_tokens(messages, model='gpt-4o-mini'):
    enc = tiktoken.encoding_for_model(model)
    total = 0
    for m in messages:
        total += 4  # role + structural
        total += len(enc.encode(m['content']))
    return total + 2  # priming

Contagem de tokens com Anthropic

A Anthropic oferece um endpoint de contagem no servidor:

count = client.messages.count_tokens(
    model='claude-sonnet-4-5',
    system='You are helpful.',
    messages=[{'role': 'user', 'content': 'Hello'}],
)
print(count.input_tokens)

Estimativa do custo antes do envio

Multiplique a quantidade de tokens pelo preço por token, disponível na página de preços do provedor:

INPUT_PRICE = 0.150 / 1_000_000   # gpt-4o-mini: $0.15 / 1M input tokens
OUTPUT_PRICE = 0.600 / 1_000_000

input_tokens = count_message_tokens(messages)
est_input_cost = input_tokens * INPUT_PRICE
print(f'Estimated input cost: ${est_input_cost:.6f}')

Acompanhamento do custo real

Depois de cada chamada, some o uso:

total_cost = 0

response = client.chat.completions.create(...)
cost = (
    response.usage.prompt_tokens * INPUT_PRICE +
    response.usage.completion_tokens * OUTPUT_PRICE
)
total_cost += cost

Orçamentos por execução

Defina um limite rígido para cada execução do agente:

MAX_COST_PER_RUN = 0.50  # USD

if total_cost > MAX_COST_PER_RUN:
    raise BudgetExceeded(f'Cost {total_cost} exceeds limit')

Orçamentos diários por usuário

Acompanhe o custo por usuário no Redis e faça a redefinição diariamente:

key = f'cost:{user_id}:{today_date}'
current = float(redis.get(key) or 0)
if current + cost > 5.0:
    raise QuotaExceeded()
redis.incrbyfloat(key, cost)
redis.expireat(key, midnight_tomorrow_ts)

Limite max_tokens por chamada

A maior fonte acidental de custos é gerar uma resposta de 50.000 tokens. Estabeleça um limite:

response = client.chat.completions.create(
    model='gpt-4o-mini',
    messages=messages,
    max_tokens=2048,  # never more than 2k output
)

Limite de etapas para agentes

Combine limites de tokens com um limite de etapas, ou seja, o número máximo de iterações:

MAX_STEPS = 20
for step in range(MAX_STEPS):
    response = run_step(...)
    if response.is_final():
        break
else:
    raise StepLimitExceeded()

Limite de tokens da saída

Por que definir max_tokens explicitamente?

Recapitulação

Contagem de tokens, max_tokens por chamada, orçamentos por execução, cotas por usuário e limites de etapas. Combine os cinco para obter segurança em produção.

Grátis para começar

Aprenda AI Agents com um tutor de IA — grátis

Escreva e execute código real no seu navegador, obtenha ajuda instantânea de um tutor de IA 24/7 e continue de onde parou na web ou no app.

Cursos
60
Aulas
239

Perguntas Frequentes

A aula “Controle de custos: contagem de tokens e orçamentos” é grátis?

Sim — o texto completo de “Controle de custos: contagem de tokens e orçamentos” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.

O que vou aprender em “Controle de custos: contagem de tokens e orçamentos”?

Conte tokens com tiktoken, estime o custo antes do envio e aplique orçamentos por solicitação e por dia. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Agents?

Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.

Quanto tempo leva a aula “Controle de custos: contagem de tokens e orçamentos”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Agents?

Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Chamando a API da OpenAI: chat.completions
  2. Chamando a API da Anthropic: messages
  3. Transmissão de respostas (SSE)
  4. Controle de custos: contagem de tokens e orçamentos
← Voltar para AI Agents