0Pricing
AI Agents · Aula

Compromissos: latência, custo e capacidade

Pesos abertos economizam dinheiro, mas custam horas de engenharia; faça comparações antes de se comprometer.

Compromissos: latência, custo e capacidade é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.

Três Eixos, Escolha Dois

Toda escolha de modelo envolve compromissos entre:

  • Latência — tempo por resposta
  • Custo — por milhão de tokens
  • Capacidade — qualidade em tarefas difíceis

Nenhum modelo é o melhor nos três aspectos.

Panorama de Capacidades

Nível superiorNível intermediárioNível pequeno
FechadosGPT-4o, Claude Sonnet 4.5GPT-4o-mini, Haiku—
AbertosLlama 3.1 405BLlama 3.1 70B, Qwen 2.5 72BLlama 3.1 8B, Phi-3

Panorama de Latência

Latência p50 aproximada para um turno típico de agente:

  • Groq Llama 3.1 70B: ~200ms (extremamente rápido)
  • gpt-4o-mini: ~600ms
  • gpt-4o: ~1500ms
  • Llama 70B auto-hospedado em 1xH100: ~800ms
  • Llama 8B auto-hospedado em RTX 4090: ~200ms

Custo por milhão de tokens (aprox.)

Estimativa aproximada em meados de 2025, entrada/saída:

  • GPT-4o: $2.50 / $10
  • GPT-4o-mini: $0.15 / $0.60
  • Claude Sonnet 4.5: $3 / $15
  • Claude Haiku: $0.80 / $4
  • Together Llama 70B: $0.88 / $0.88
  • Groq Llama 70B: $0.59 / $0.79
  • Auto-hospedado (sua GPU): essencialmente gratuito por token

Calcule seu ponto de equilíbrio

A auto-hospedagem só economiza dinheiro acima de determinado volume. Estimativa aproximada:

GPU_COST_PER_HOUR = 1.5
GPU_TOKENS_PER_SECOND = 50
TOKENS_PER_HOUR = GPU_TOKENS_PER_SECOND * 3600
# 180,000 tokens/hour
print(f"Tokens per hour: {TOKENS_PER_HOUR:,}")
breakeven_tokens = GPU_COST_PER_HOUR / 0.6e-6
print(f"Breakeven vs $0.60/1M closed-model price: {breakeven_tokens:,.0f} tokens/hour")
print("Far above typical small-app traffic")

Roteamento de modelos

Use modelos baratos por padrão e recorra aos mais caros somente quando necessário:

def answer(query):
    cheap = call_model('gpt-4o-mini', query)
    if confidence(cheap) > 0.8:
        return cheap
    return call_model('gpt-4o', query)

Roteamento por etapa

Dentro de um agente, faça o roteamento por etapa:

  • Planeje com GPT-4o (raciocínio complexo)
  • Pesquise com Llama 8B (ciclos baratos)
  • Sintetize com Claude (qualidade de escrita)

Fluxos sensíveis à latência

Para voz / bate-papo em tempo real:

  • Use Groq, SambaNova ou Cerebras para obter menos de 200 ms
  • Transmita tokens sem hesitação
  • Evite agentes de várias etapas no caminho crítico

Fluxos sensíveis à qualidade

Para respostas finais e trabalhos de alto risco:

  • Use o melhor modelo que puder pagar
  • Adicione crítica entre modelos (GPT-4 escreve, Claude revisa)
  • Adicione verificação (execute o código, confira os fatos)

Custo total de propriedade

O custo da auto-hospedagem inclui:

  • Aluguel de GPU ou investimento de capital
  • Tempo de engenharia para gerenciar a infraestrutura
  • Monitoramento e plantão
  • Taxa de processamento menor que a dos serviços hospedados

Para a maioria das equipes, as APIs hospedadas têm um custo total de propriedade menor até volumes muito altos.

Quando pagar por modelos fechados grandes

  • Respostas finais voltadas aos usuários
  • Raciocínio de ponta
  • Multimodalidade
  • Contexto de 200 mil ou mais

Avalie com sua própria tarefa

As avaliações comparativas públicas contam apenas parte da história. Crie um conjunto de 50 perguntas com seus dados reais e meça cada modelo candidato com ele. Escolha o modelo mais barato que atenda ao nível de qualidade.

Estratégia de roteamento

Qual é a estratégia de roteamento de modelos mais barata que ainda atende ao nível de qualidade?

Recapitulação

Latência, custo, capacidade — escolha dois. Use modelos baratos por padrão e recorra a modelos mais caros quando necessário. APIs hospedadas de modelos abertos (Groq, Together) geralmente superam os dois extremos.

Perguntas Frequentes

A aula “Compromissos: latência, custo e capacidade” é grátis?

Sim — o texto completo de “Compromissos: latência, custo e capacidade” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.

O que vou aprender em “Compromissos: latência, custo e capacidade”?

Pesos abertos economizam dinheiro, mas custam horas de engenharia; faça comparações antes de se comprometer. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Agents?

Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.

Quanto tempo leva a aula “Compromissos: latência, custo e capacidade”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Agents?

Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Visão geral de Llama, Mistral e Qwen
  2. Executando modelos locais com Ollama e llama.cpp
  3. Modelos abertos com chamada de funções (Hermes, Functionary)
  4. Compromissos: latência, custo e capacidade
← Voltar para AI Agents