Instradamento dei modelli (da economico a costoso)
Provi prima un modello piccolo e passi a un modello frontier solo quando il primo fallisce o ha un livello di confidenza basso
Instradamento dei modelli (da economico a costoso) è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 2 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.
Parti di questa lezione non sono ancora state tradotte e vengono mostrate in inglese.
Non usate modelli grandi per attività semplici
Chiamare GPT-4o per «questa email è spam?» spreca denaro. Indirizzate le attività semplici verso modelli economici e quelle difficili verso modelli costosi.
Il modello di instradamento
- Provate prima un modello piccolo ed economico
- Se l'output ha una bassa confidenza o non supera la validazione, passate a un modello grande
- Registrate quale percorso è stato seguito
Confidence-Based Routing
cheap_response = call('gpt-4o-mini', messages)
confidence = parse_confidence(cheap_response)
if confidence > 0.85:
return cheap_response
# Otherwise escalate
return call('gpt-4o', messages)Instradamento basato sulla validazione
Se l'output del modello economico non supera la validazione dello schema, passate a un modello più grande:
try:
result = Schema.model_validate_json(cheap_response.content)
return result
except ValidationError:
return Schema.model_validate_json(call('gpt-4o', messages).content)Scelta del modello per passaggio
Parti diverse di un agente richiedono modelli diversi:
MODEL_BY_STEP = {
'classify_intent': 'gpt-4o-mini', # easy
'plan': 'gpt-4o', # critical
'extract': 'gpt-4o-mini', # routine
'write_response': 'claude-sonnet-4-5' # quality matters
}
# --- demo ---
for step in ['classify_intent', 'plan', 'extract', 'write_response']:
print(f'{step:16s} -> {MODEL_BY_STEP[step]}')
Instradamento tra provider
Usate Groq per la latenza, OpenAI per la qualità e Anthropic per i contesti lunghi:
if need_low_latency:
return call_groq('llama-3.1-70b')
elif need_long_context:
return call_anthropic('claude-sonnet-4-5')
else:
return call_openai('gpt-4o-mini')LLM come router
Un modello piccolo classifica la richiesta e sceglie il modello successivo:
router = call('gpt-4o-mini', 'Classify this request as simple/complex/code. Return one word.')
if router == 'simple':
return call('gpt-4o-mini', user_msg)
else:
return call('gpt-4o', user_msg)Catena di fallback
Se il modello principale fallisce (limite di frequenza, errore), provate quello secondario:
for model in ['gpt-4o', 'claude-sonnet-4-5', 'gpt-4o-mini']:
try:
return call(model, messages)
except RateLimitError:
continue
raise AllModelsFailed()Instradamento basato sugli embedding
Create l'embedding della query; se è simile a un caso semplice noto, usate il modello economico, altrimenti usate quello grande:
embedding = embed(query)
matches = vector_db.query(embedding, k=3, filter={'category': 'easy'})
if max(m.score for m in matches) > 0.9:
use_cheap_model()Esempio di gerarchia di instradamento
| Livello | Costo | Uso |
|---|---|---|
| Livello 1 | $ — Llama 8B | Classificazione, estrazione |
| Livello 2 | $$ — gpt-4o-mini | Passaggi standard dell'agente |
| Livello 3 | $$$ — gpt-4o / claude | Ragionamento difficile, sintesi finale |
Misurare il risparmio netto
Monitorate:
- La percentuale di richieste gestite da ogni livello
- La qualità (percentuale di superamento della valutazione) per ogni livello
- Il costo totale per richiesta
Confrontate i risultati con la baseline (modello sempre grande) per verificare che l'instradamento sia utile.
Calibrare la confidenza
La confidenza dichiarata dal modello non è affidabile. Calibratela su un set di valutazione; se il modello dichiara una confidenza del 90% ma è corretto solo il 60% delle volte, modificate la soglia.
Router open source
RouteLLM (LMSYS) è un framework OSS per router di modelli addestrati. Vale la pena esplorarlo se l'instradamento è fondamentale per la vostra struttura dei costi.
Strategia di instradamento
Qual è la strategia di instradamento più semplice ed efficace?
Riepilogo
Modelli organizzati per livelli, modello economico come prima scelta con escalation, instradamento per passaggio e catene di fallback. Misurate la distribuzione tra i livelli e la qualità. L'instradamento è la leva singola più importante per ridurre i costi in produzione.
Domande Frequenti
La lezione «Instradamento dei modelli (da economico a costoso)» è gratuita?
Sì — il testo completo di «Instradamento dei modelli (da economico a costoso)» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.
Cosa imparerò in «Instradamento dei modelli (da economico a costoso)»?
Provi prima un modello piccolo e passi a un modello frontier solo quando il primo fallisce o ha un livello di confidenza basso Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare AI Agents?
Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 2 di 4.
Quanto tempo richiede la lezione «Instradamento dei modelli (da economico a costoso)»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione AI Agents?
Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Budget di token per passaggio
- Instradamento dei modelli (da economico a costoso)
- Caching di prompt e risultati (Anthropic, Vertex)
- Quantizzazione e decodifica speculativa