AI Agents · Leçon

Compromis : latence, coût et capacités

Les poids ouverts réduisent les coûts, mais demandent des heures d’ingénierie ; comparez les performances avant de vous engager.

Leçon 4 sur 414 étapes

Compromis : latence, coût et capacités est une leçon AI Agents gratuite sur CoddyKit. Ceci est la leçon 4 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Agents, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Agents comprend 4 leçons au total.

Trois axes, choisissez-en deux

Tout choix de modèle implique un compromis entre :

  • Latence : durée de chaque réponse
  • Coût : par million de jetons
  • Capacités : qualité pour les tâches difficiles

Aucun modèle n'est le meilleur dans ces trois domaines.

Panorama des capacités

Haut de gammeGamme intermédiairePetits modèles
PropriétairesGPT-4o, Claude Sonnet 4.5GPT-4o-mini, Haiku—
OuvertsLlama 3.1 405BLlama 3.1 70B, Qwen 2.5 72BLlama 3.1 8B, Phi-3

Panorama de la latence

Latence p50 approximative pour un tour d'agent typique :

  • Groq Llama 3.1 70B : ~200 ms, extrêmement rapide
  • gpt-4o-mini : ~600 ms
  • gpt-4o : ~1500 ms
  • Llama 70B auto-hébergé sur 1xH100 : ~800 ms
  • Llama 8B auto-hébergé sur RTX 4090 : ~200 ms

Coût par million de tokens (approx.)

Ordre de grandeur à la mi-2025, en entrée/sortie :

  • GPT-4o : 2,50 $ / 10 $
  • GPT-4o-mini : 0,15 $ / 0,60 $
  • Claude Sonnet 4.5 : 3 $ / 15 $
  • Claude Haiku : 0,80 $ / 4 $
  • Together Llama 70B : 0,88 $ / 0,88 $
  • Groq Llama 70B : 0,59 $ / 0,79 $
  • Hébergement autonome (votre GPU) : pratiquement gratuit par token

Calculez votre seuil de rentabilité

L’hébergement autonome ne permet d’économiser de l’argent qu’au-delà d’un certain volume. Estimation approximative :

GPU_COST_PER_HOUR = 1.5
GPU_TOKENS_PER_SECOND = 50
TOKENS_PER_HOUR = GPU_TOKENS_PER_SECOND * 3600
# 180,000 tokens/hour
print(f"Tokens per hour: {TOKENS_PER_HOUR:,}")
breakeven_tokens = GPU_COST_PER_HOUR / 0.6e-6
print(f"Breakeven vs $0.60/1M closed-model price: {breakeven_tokens:,.0f} tokens/hour")
print("Far above typical small-app traffic")

Routage des modèles

Utilisez par défaut des modèles peu coûteux et ne passez à des modèles plus chers qu’en cas de besoin :

def answer(query):
    cheap = call_model('gpt-4o-mini', query)
    if confidence(cheap) > 0.8:
        return cheap
    return call_model('gpt-4o', query)

Routage à chaque étape

Au sein d’un agent, choisissez le modèle à chaque étape :

  • Planifiez avec GPT-4o (raisonnement complexe)
  • Effectuez les recherches avec Llama 8B (boucles peu coûteuses)
  • Faites la synthèse avec Claude (qualité rédactionnelle)

Parcours sensibles à la latence

Pour la voix et les conversations en temps réel :

  • Utilisez Groq, SambaNova ou Cerebras pour obtenir moins de 200 ms
  • Diffusez les tokens de manière intensive
  • Évitez les agents à plusieurs étapes sur le chemin critique

Parcours sensibles à la qualité

Pour les réponses finales et les tâches à forts enjeux :

  • Utilisez le meilleur modèle que vous pouvez vous permettre
  • Ajoutez une critique croisée entre modèles (GPT-4 rédige, Claude relit)
  • Ajoutez une vérification (exécutez le code, vérifiez les faits)

Coût total de possession

Le coût de l’hébergement autonome comprend :

  • La location d’un GPU ou les dépenses d’investissement
  • Le temps des ingénieurs consacré à la gestion de l’infrastructure
  • La surveillance et les astreintes
  • Un débit inférieur à celui des services hébergés

Pour la plupart des équipes, les API hébergées ont un TCO inférieur jusqu’à des volumes très élevés.

Quand payer pour de grands modèles propriétaires

  • Les réponses finales destinées aux utilisateurs
  • Le raisonnement de pointe
  • Le multimodal
  • Un contexte de 200 000 tokens ou plus

Évaluez votre tâche

Les évaluations publiques ne racontent qu’une partie de l’histoire. Constituez un ensemble d’évaluation de 50 questions à partir de vos données réelles et mesurez chaque modèle candidat sur cet ensemble. Choisissez le modèle le moins cher qui atteint le niveau de qualité requis.

Stratégie de routage

Quelle est la stratégie de routage des modèles la moins coûteuse qui permette malgré tout d’atteindre le niveau de qualité requis ?

Récapitulatif

Latence, coût, capacités : choisissez-en deux. Utilisez par défaut des modèles peu coûteux et passez à des modèles plus performants lorsque c’est nécessaire. Les API hébergées de modèles ouverts (Groq, Together) surpassent souvent les deux extrêmes.

Gratuit pour commencer

Apprends AI Agents avec un tuteur IA — gratuit

Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.

Cours
60
Leçons
239

Questions Fréquemment Posées

La leçon « Compromis : latence, coût et capacités » est-elle gratuite ?

Oui — le texte complet de « Compromis : latence, coût et capacités » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Agents, passe à CoddyKit PRO. Le cours AI Agents comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Compromis : latence, coût et capacités » ?

Les poids ouverts réduisent les coûts, mais demandent des heures d’ingénierie ; comparez les performances avant de vous engager. Tu pratiques AI Agents avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Agents ?

Aucune expérience préalable n'est requise. AI Agents sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 4.

Combien de temps prend la leçon « Compromis : latence, coût et capacités » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Agents ?

Oui. Chaque leçon AI Agents inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Présentation de Llama, Mistral et Qwen
  2. Exécuter des modèles locaux avec Ollama et llama.cpp
  3. Appels de fonctions avec des modèles ouverts (Hermes, Functionary)
  4. Compromis : latence, coût et capacités
← Retour à AI Agents