Compromissos: latência, custo e capacidade
Pesos abertos economizam dinheiro, mas custam horas de engenharia; faça comparações antes de se comprometer.
Compromissos: latência, custo e capacidade é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 4 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.
Três Eixos, Escolha Dois
Toda escolha de modelo envolve compromissos entre:
- Latência — tempo por resposta
- Custo — por milhão de tokens
- Capacidade — qualidade em tarefas difíceis
Nenhum modelo é o melhor nos três aspectos.
Panorama de Capacidades
| Nível superior | Nível intermediário | Nível pequeno | |
|---|---|---|---|
| Fechados | GPT-4o, Claude Sonnet 4.5 | GPT-4o-mini, Haiku | — |
| Abertos | Llama 3.1 405B | Llama 3.1 70B, Qwen 2.5 72B | Llama 3.1 8B, Phi-3 |
Panorama de Latência
Latência p50 aproximada para um turno típico de agente:
- Groq Llama 3.1 70B: ~200ms (extremamente rápido)
- gpt-4o-mini: ~600ms
- gpt-4o: ~1500ms
- Llama 70B auto-hospedado em 1xH100: ~800ms
- Llama 8B auto-hospedado em RTX 4090: ~200ms
Custo por milhão de tokens (aprox.)
Estimativa aproximada em meados de 2025, entrada/saída:
- GPT-4o: $2.50 / $10
- GPT-4o-mini: $0.15 / $0.60
- Claude Sonnet 4.5: $3 / $15
- Claude Haiku: $0.80 / $4
- Together Llama 70B: $0.88 / $0.88
- Groq Llama 70B: $0.59 / $0.79
- Auto-hospedado (sua GPU): essencialmente gratuito por token
Calcule seu ponto de equilíbrio
A auto-hospedagem só economiza dinheiro acima de determinado volume. Estimativa aproximada:
GPU_COST_PER_HOUR = 1.5
GPU_TOKENS_PER_SECOND = 50
TOKENS_PER_HOUR = GPU_TOKENS_PER_SECOND * 3600
# 180,000 tokens/hour
print(f"Tokens per hour: {TOKENS_PER_HOUR:,}")
breakeven_tokens = GPU_COST_PER_HOUR / 0.6e-6
print(f"Breakeven vs $0.60/1M closed-model price: {breakeven_tokens:,.0f} tokens/hour")
print("Far above typical small-app traffic")
Roteamento de modelos
Use modelos baratos por padrão e recorra aos mais caros somente quando necessário:
def answer(query):
cheap = call_model('gpt-4o-mini', query)
if confidence(cheap) > 0.8:
return cheap
return call_model('gpt-4o', query)Roteamento por etapa
Dentro de um agente, faça o roteamento por etapa:
- Planeje com GPT-4o (raciocínio complexo)
- Pesquise com Llama 8B (ciclos baratos)
- Sintetize com Claude (qualidade de escrita)
Fluxos sensíveis à latência
Para voz / bate-papo em tempo real:
- Use Groq, SambaNova ou Cerebras para obter menos de 200 ms
- Transmita tokens sem hesitação
- Evite agentes de várias etapas no caminho crítico
Fluxos sensíveis à qualidade
Para respostas finais e trabalhos de alto risco:
- Use o melhor modelo que puder pagar
- Adicione crítica entre modelos (GPT-4 escreve, Claude revisa)
- Adicione verificação (execute o código, confira os fatos)
Custo total de propriedade
O custo da auto-hospedagem inclui:
- Aluguel de GPU ou investimento de capital
- Tempo de engenharia para gerenciar a infraestrutura
- Monitoramento e plantão
- Taxa de processamento menor que a dos serviços hospedados
Para a maioria das equipes, as APIs hospedadas têm um custo total de propriedade menor até volumes muito altos.
Quando pagar por modelos fechados grandes
- Respostas finais voltadas aos usuários
- Raciocínio de ponta
- Multimodalidade
- Contexto de 200 mil ou mais
Avalie com sua própria tarefa
As avaliações comparativas públicas contam apenas parte da história. Crie um conjunto de 50 perguntas com seus dados reais e meça cada modelo candidato com ele. Escolha o modelo mais barato que atenda ao nível de qualidade.
Estratégia de roteamento
Qual é a estratégia de roteamento de modelos mais barata que ainda atende ao nível de qualidade?
Recapitulação
Latência, custo, capacidade — escolha dois. Use modelos baratos por padrão e recorra a modelos mais caros quando necessário. APIs hospedadas de modelos abertos (Groq, Together) geralmente superam os dois extremos.
Perguntas Frequentes
A aula “Compromissos: latência, custo e capacidade” é grátis?
Sim — o texto completo de “Compromissos: latência, custo e capacidade” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.
O que vou aprender em “Compromissos: latência, custo e capacidade”?
Pesos abertos economizam dinheiro, mas custam horas de engenharia; faça comparações antes de se comprometer. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Agents?
Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 4 de 4.
Quanto tempo leva a aula “Compromissos: latência, custo e capacidade”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Agents?
Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Visão geral de Llama, Mistral e Qwen
- Executando modelos locais com Ollama e llama.cpp
- Modelos abertos com chamada de funções (Hermes, Functionary)
- Compromissos: latência, custo e capacidade