Roteamento de modelos (barato -> caro)
Experimente primeiro um modelo pequeno e recorra a um modelo de ponta somente quando o pequeno falhar ou apresentar baixa confiança.
Roteamento de modelos (barato -> caro) é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.
Partes desta aula ainda não foram traduzidas e aparecem em inglês.
Não use modelos grandes para tarefas simples
Chamar o GPT-4o para responder "este e-mail é spam?" desperdiça dinheiro. Encaminhe tarefas simples para modelos baratos e tarefas difíceis para modelos caros.
O padrão de encaminhamento
- Primeiro, tente usar um modelo pequeno e barato
- Se a saída tiver baixa confiança ou falhar na validação, encaminhe a tarefa para um modelo grande
- Registre qual caminho foi seguido
Confidence-Based Routing
cheap_response = call('gpt-4o-mini', messages)
confidence = parse_confidence(cheap_response)
if confidence > 0.85:
return cheap_response
# Otherwise escalate
return call('gpt-4o', messages)Encaminhamento baseado em validação
Se a saída do modelo barato falhar na validação do esquema, encaminhe a tarefa para um modelo grande:
try:
result = Schema.model_validate_json(cheap_response.content)
return result
except ValidationError:
return Schema.model_validate_json(call('gpt-4o', messages).content)Escolha do modelo por etapa
Partes diferentes de um agente precisam de modelos diferentes:
MODEL_BY_STEP = {
'classify_intent': 'gpt-4o-mini', # easy
'plan': 'gpt-4o', # critical
'extract': 'gpt-4o-mini', # routine
'write_response': 'claude-sonnet-4-5' # quality matters
}
# --- demo ---
for step in ['classify_intent', 'plan', 'extract', 'write_response']:
print(f'{step:16s} -> {MODEL_BY_STEP[step]}')
Encaminhamento entre provedores
Use o Groq para obter baixa latência, o OpenAI para obter qualidade e o Anthropic para trabalhar com um contexto longo:
if need_low_latency:
return call_groq('llama-3.1-70b')
elif need_long_context:
return call_anthropic('claude-sonnet-4-5')
else:
return call_openai('gpt-4o-mini')LLM como encaminhador
Um modelo pequeno classifica a solicitação e escolhe o próximo modelo:
router = call('gpt-4o-mini', 'Classify this request as simple/complex/code. Return one word.')
if router == 'simple':
return call('gpt-4o-mini', user_msg)
else:
return call('gpt-4o', user_msg)Cadeia de alternativas
Se o modelo principal falhar (limite de requisições, erro), tente o secundário:
for model in ['gpt-4o', 'claude-sonnet-4-5', 'gpt-4o-mini']:
try:
return call(model, messages)
except RateLimitError:
continue
raise AllModelsFailed()Encaminhamento baseado em embeddings
Gere um embedding para a consulta; se ela for semelhante a um caso simples conhecido, use o modelo barato; caso contrário, use o modelo grande:
embedding = embed(query)
matches = vector_db.query(embedding, k=3, filter={'category': 'easy'})
if max(m.score for m in matches) > 0.9:
use_cheap_model()Exemplo de hierarquia de encaminhamento
| Nível | Custo | Uso |
|---|---|---|
| Nível 1 | $ — Llama 8B | Classificação, extração |
| Nível 2 | $$ — gpt-4o-mini | Etapas padrão do agente |
| Nível 3 | $$$ — gpt-4o / claude | Raciocínio difícil, síntese final |
Meça a economia líquida
Acompanhe:
- Porcentagem de solicitações atendidas por cada nível
- Qualidade (taxa de aprovação na avaliação) por nível
- Custo total por solicitação
Compare com a linha de base (sempre usar o modelo grande) para verificar se o encaminhamento ajuda.
Calibre a confiança
A confiança declarada pelo próprio modelo não é confiável. Faça a calibração usando um conjunto de avaliação; se o modelo disser 90%, mas estiver correto apenas 60% das vezes, ajuste seu limiar.
Encaminhadores de código aberto
RouteLLM (LMSYS) é uma estrutura OSS para encaminhadores de modelos treinados. Vale a pena explorá-la se o encaminhamento for essencial para sua estrutura de custos.
Estratégia de encaminhamento
Qual é a estratégia de encaminhamento mais simples e eficaz?
Recapitulação
Modelos organizados por níveis, começando pelo barato e escalando quando necessário, encaminhamento por etapa e cadeias de alternativas. Meça a combinação de níveis e a qualidade. O encaminhamento é a maior alavanca individual para reduzir custos em produção.
Perguntas Frequentes
A aula “Roteamento de modelos (barato -> caro)” é grátis?
Sim — o texto completo de “Roteamento de modelos (barato -> caro)” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.
O que vou aprender em “Roteamento de modelos (barato -> caro)”?
Experimente primeiro um modelo pequeno e recorra a um modelo de ponta somente quando o pequeno falhar ou apresentar baixa confiança. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar AI Agents?
Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.
Quanto tempo leva a aula “Roteamento de modelos (barato -> caro)”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de AI Agents?
Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Orçamentos de tokens por etapa
- Roteamento de modelos (barato -> caro)
- Armazenamento em cache de instruções e resultados (Anthropic, Vertex)
- Quantização e decodificação especulativa