Routage des modèles (économique → coûteux)
Essayez d’abord un petit modèle et passez à un modèle de pointe uniquement lorsque le premier échoue ou manque de confiance.
Routage des modèles (économique → coûteux) est une leçon AI Agents gratuite sur CoddyKit. Ceci est la leçon 2 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Agents, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Agents comprend 4 leçons au total.
Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.
N’utilisez pas de grands modèles pour les tâches faciles
Appeler GPT-4o pour déterminer si un courriel est indésirable fait gaspiller de l’argent. Acheminez les tâches faciles vers des modèles peu coûteux et les tâches difficiles vers des modèles coûteux.
Le schéma de routage
- Essayez d’abord un modèle petit et peu coûteux
- Si la sortie inspire peu confiance ou échoue à la validation, transférez la tâche à un grand modèle
- Consignez le chemin suivi
Confidence-Based Routing
cheap_response = call('gpt-4o-mini', messages)
confidence = parse_confidence(cheap_response)
if confidence > 0.85:
return cheap_response
# Otherwise escalate
return call('gpt-4o', messages)Routage fondé sur la validation
Si la sortie du modèle peu coûteux échoue à la validation du schéma, transférez la tâche :
try:
result = Schema.model_validate_json(cheap_response.content)
return result
except ValidationError:
return Schema.model_validate_json(call('gpt-4o', messages).content)Choix du modèle pour chaque étape
Les différentes parties d’un agent nécessitent des modèles différents :
MODEL_BY_STEP = {
'classify_intent': 'gpt-4o-mini', # easy
'plan': 'gpt-4o', # critical
'extract': 'gpt-4o-mini', # routine
'write_response': 'claude-sonnet-4-5' # quality matters
}
# --- demo ---
for step in ['classify_intent', 'plan', 'extract', 'write_response']:
print(f'{step:16s} -> {MODEL_BY_STEP[step]}')
Routage entre fournisseurs
Utilisez Groq pour la latence, OpenAI pour la qualité et Anthropic pour les contextes longs :
if need_low_latency:
return call_groq('llama-3.1-70b')
elif need_long_context:
return call_anthropic('claude-sonnet-4-5')
else:
return call_openai('gpt-4o-mini')LLM comme routeur
Un petit modèle classe la demande et choisit le modèle suivant :
router = call('gpt-4o-mini', 'Classify this request as simple/complex/code. Return one word.')
if router == 'simple':
return call('gpt-4o-mini', user_msg)
else:
return call('gpt-4o', user_msg)Chaîne de repli
Si le modèle principal échoue (limitation de débit, erreur), essayez le modèle secondaire :
for model in ['gpt-4o', 'claude-sonnet-4-5', 'gpt-4o-mini']:
try:
return call(model, messages)
except RateLimitError:
continue
raise AllModelsFailed()Routage fondé sur les plongements
Calculez le plongement de la requête ; si celle-ci ressemble à un cas facile connu, utilisez le modèle peu coûteux ; sinon, utilisez le grand modèle :
embedding = embed(query)
matches = vector_db.query(embedding, k=3, filter={'category': 'easy'})
if max(m.score for m in matches) > 0.9:
use_cheap_model()Exemple de hiérarchie de routage
| Niveau | Coût | Utilisation |
|---|---|---|
| Niveau 1 | $ — Llama 8B | Classification, extraction |
| Niveau 2 | $$ — gpt-4o-mini | Étapes standard d’un agent |
| Niveau 3 | $$$ — gpt-4o / claude | Raisonnement difficile, synthèse finale |
Mesurer les économies nettes
Suivez :
- Le pourcentage de demandes traitées par chaque niveau
- La qualité (taux de réussite de l’évaluation) pour chaque niveau
- Le coût total par demande
Comparez ces résultats à la référence (toujours utiliser le grand modèle) pour vérifier que le routage est utile.
Étalonner la confiance
La confiance déclarée par le modèle n’est pas fiable. Étalonnez-la sur un ensemble d’évaluation ; si le modèle annonce 90 % de confiance, mais n’est correct que 60 % du temps, ajustez votre seuil.
Routeurs open source
RouteLLM (LMSYS) est un cadre logiciel OSS de routeurs de modèles entraînés. Il mérite votre attention si le routage est essentiel à votre structure de coûts.
Stratégie de routage
Quelle est la stratégie de routage la plus simple et la plus efficace ?
Récapitulatif
Modèles à plusieurs niveaux, modèle peu coûteux utilisé en premier avec transfert vers un modèle supérieur, routage par étape et chaînes de repli. Mesurez la répartition entre les niveaux et la qualité. Le routage est le principal levier de réduction des coûts en production.
Questions Fréquemment Posées
La leçon « Routage des modèles (économique → coûteux) » est-elle gratuite ?
Oui — le texte complet de « Routage des modèles (économique → coûteux) » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Agents, passe à CoddyKit PRO. Le cours AI Agents comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Routage des modèles (économique → coûteux) » ?
Essayez d’abord un petit modèle et passez à un modèle de pointe uniquement lorsque le premier échoue ou manque de confiance. Tu pratiques AI Agents avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer AI Agents ?
Aucune expérience préalable n'est requise. AI Agents sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 4.
Combien de temps prend la leçon « Routage des modèles (économique → coûteux) » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon AI Agents ?
Oui. Chaque leçon AI Agents inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Budgets de jetons par étape
- Routage des modèles (économique → coûteux)
- Mise en cache des invites et des résultats (Anthropic, Vertex)
- Quantification et décodage spéculatif