0Pricing
AI Agents · Aula

Roteamento de modelos (barato -> caro)

Experimente primeiro um modelo pequeno e recorra a um modelo de ponta somente quando o pequeno falhar ou apresentar baixa confiança.

Roteamento de modelos (barato -> caro) é uma aula grátis de AI Agents no CoddyKit. Esta é a aula 2 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de AI Agents, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de AI Agents inclui 4 aulas no total.

Partes desta aula ainda não foram traduzidas e aparecem em inglês.

Não use modelos grandes para tarefas simples

Chamar o GPT-4o para responder "este e-mail é spam?" desperdiça dinheiro. Encaminhe tarefas simples para modelos baratos e tarefas difíceis para modelos caros.

O padrão de encaminhamento

  1. Primeiro, tente usar um modelo pequeno e barato
  2. Se a saída tiver baixa confiança ou falhar na validação, encaminhe a tarefa para um modelo grande
  3. Registre qual caminho foi seguido

Confidence-Based Routing

cheap_response = call('gpt-4o-mini', messages)
confidence = parse_confidence(cheap_response)
if confidence > 0.85:
    return cheap_response
# Otherwise escalate
return call('gpt-4o', messages)

Encaminhamento baseado em validação

Se a saída do modelo barato falhar na validação do esquema, encaminhe a tarefa para um modelo grande:

try:
    result = Schema.model_validate_json(cheap_response.content)
    return result
except ValidationError:
    return Schema.model_validate_json(call('gpt-4o', messages).content)

Escolha do modelo por etapa

Partes diferentes de um agente precisam de modelos diferentes:

MODEL_BY_STEP = {
    'classify_intent': 'gpt-4o-mini',     # easy
    'plan': 'gpt-4o',                     # critical
    'extract': 'gpt-4o-mini',             # routine
    'write_response': 'claude-sonnet-4-5' # quality matters
}

# --- demo ---
for step in ['classify_intent', 'plan', 'extract', 'write_response']:
    print(f'{step:16s} -> {MODEL_BY_STEP[step]}')

Encaminhamento entre provedores

Use o Groq para obter baixa latência, o OpenAI para obter qualidade e o Anthropic para trabalhar com um contexto longo:

if need_low_latency:
    return call_groq('llama-3.1-70b')
elif need_long_context:
    return call_anthropic('claude-sonnet-4-5')
else:
    return call_openai('gpt-4o-mini')

LLM como encaminhador

Um modelo pequeno classifica a solicitação e escolhe o próximo modelo:

router = call('gpt-4o-mini', 'Classify this request as simple/complex/code. Return one word.')
if router == 'simple':
    return call('gpt-4o-mini', user_msg)
else:
    return call('gpt-4o', user_msg)

Cadeia de alternativas

Se o modelo principal falhar (limite de requisições, erro), tente o secundário:

for model in ['gpt-4o', 'claude-sonnet-4-5', 'gpt-4o-mini']:
    try:
        return call(model, messages)
    except RateLimitError:
        continue
raise AllModelsFailed()

Encaminhamento baseado em embeddings

Gere um embedding para a consulta; se ela for semelhante a um caso simples conhecido, use o modelo barato; caso contrário, use o modelo grande:

embedding = embed(query)
matches = vector_db.query(embedding, k=3, filter={'category': 'easy'})
if max(m.score for m in matches) > 0.9:
    use_cheap_model()

Exemplo de hierarquia de encaminhamento

NívelCustoUso
Nível 1$ — Llama 8BClassificação, extração
Nível 2$$ — gpt-4o-miniEtapas padrão do agente
Nível 3$$$ — gpt-4o / claudeRaciocínio difícil, síntese final

Meça a economia líquida

Acompanhe:

  • Porcentagem de solicitações atendidas por cada nível
  • Qualidade (taxa de aprovação na avaliação) por nível
  • Custo total por solicitação

Compare com a linha de base (sempre usar o modelo grande) para verificar se o encaminhamento ajuda.

Calibre a confiança

A confiança declarada pelo próprio modelo não é confiável. Faça a calibração usando um conjunto de avaliação; se o modelo disser 90%, mas estiver correto apenas 60% das vezes, ajuste seu limiar.

Encaminhadores de código aberto

RouteLLM (LMSYS) é uma estrutura OSS para encaminhadores de modelos treinados. Vale a pena explorá-la se o encaminhamento for essencial para sua estrutura de custos.

Estratégia de encaminhamento

Qual é a estratégia de encaminhamento mais simples e eficaz?

Recapitulação

Modelos organizados por níveis, começando pelo barato e escalando quando necessário, encaminhamento por etapa e cadeias de alternativas. Meça a combinação de níveis e a qualidade. O encaminhamento é a maior alavanca individual para reduzir custos em produção.

Perguntas Frequentes

A aula “Roteamento de modelos (barato -> caro)” é grátis?

Sim — o texto completo de “Roteamento de modelos (barato -> caro)” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de AI Agents, atualize para CoddyKit PRO. O curso de AI Agents inclui 4 aulas no total.

O que vou aprender em “Roteamento de modelos (barato -> caro)”?

Experimente primeiro um modelo pequeno e recorra a um modelo de ponta somente quando o pequeno falhar ou apresentar baixa confiança. Você pratica AI Agents com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.

Preciso ter experiência prévia para começar AI Agents?

Nenhuma experiência prévia é necessária. AI Agents no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 2 de 4.

Quanto tempo leva a aula “Roteamento de modelos (barato -> caro)”?

A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.

Posso escrever e executar código nesta aula de AI Agents?

Sim. Cada aula de AI Agents inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.

Todas as aulas deste curso

  1. Orçamentos de tokens por etapa
  2. Roteamento de modelos (barato -> caro)
  3. Armazenamento em cache de instruções e resultados (Anthropic, Vertex)
  4. Quantização e decodificação especulativa
← Voltar para AI Agents