Pourquoi les contextes longs ne passent pas à l’échelle
Le coût augmente linéairement, la qualité se dégrade et le phénomène de « perte au milieu » fait oublier au modèle le contenu enfoui dans les prompts longs.
Pourquoi les contextes longs ne passent pas à l’échelle est une leçon AI Agents gratuite sur CoddyKit. Ceci est la leçon 2 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Agents, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Agents comprend 4 leçons au total.
Plus grand ne signifie pas toujours meilleur
Les modèles modernes disposent de fenêtres de contexte immenses — 200 k, 1 M, voire 2 M de jetons. Il est tentant de « tout y déverser » au lieu de construire une véritable mémoire.
Cette approche échoue en production pour trois raisons.
Raison 1 : coût
Chaque jeton de chaque appel coûte de l'argent. Une invite système de 100 k jetons avec 1 000 tours représente 100 M de jetons d'entrée, soit au total des dizaines de dollars par session.
La mise en cache des invites aide, mais n'élimine pas le coût.
Raison 2 : latence
Le traitement de 100 k jetons d'entrée ajoute 1 à 3 secondes au délai avant le premier jeton. Pour une interface de conversation, vous voulez un TTFT inférieur à 500 ms.
Raison 3 : baisse de qualité
Les modèles prêtent moins attention au contenu situé au milieu des invites longues — l'effet de « perte au milieu » décrit par Liu et al. en 2023.
Les informations situées au début ou à la fin sont rappelées avec précision ; celles du milieu sont souvent manquées.
Une vérification concrète
Insérez un fait unique à différentes positions d'un long document et demandez au modèle de le retrouver. Précision :
- début du document : 95 %
- fin du document : 90 %
- milieu : 50 à 70 %
Contexte long pour l'évaluation, pas pour la production
Les contextes longs sont utiles pour des tâches ponctuelles (analyser toute cette base de code), mais ne conviennent pas aux agents de production fonctionnant en continu.
En production, utilisez la recherche pour n'injecter que les 5 % pertinents à chaque tour.
Quand les contextes longs sont utiles
- analyse initiale d'une base de code
- questions-réponses sur un document entier en un seul appel
- comparaison de deux longs documents
Tâches ponctuelles sans réexécution.
Quand les contextes longs posent problème
- agents conversationnels avec des centaines de tours
- agents mutualisés entre plusieurs utilisateurs
- partout où le coût ou la latence compte
La bonne architecture
Pour les agents qui fonctionnent longtemps :
- tours récents dans l'invite (les 10 à 20 derniers)
- tours plus anciens résumés dans un résumé cumulatif
- faits vectorisés dans la mémoire à long terme
- récupération des K meilleurs souvenirs pertinents à chaque tour
Approche hybride
Combinez les techniques :
messages = [
{'role': 'system', 'content': PERSONA},
{'role': 'system', 'content': f'Conversation summary so far: {summary}'},
{'role': 'system', 'content': f'Relevant past facts: {retrieved_facts}'},
*last_n_turns,
]Déclencheurs de compactage
Décidez WHEN compacter :
- tous les N tours (simple)
- lorsque le nombre de jetons dépasse un seuil (mieux)
- lorsque le modèle commence à oublier (le mieux, mais difficile à détecter)
Perdu au milieu
Qu'est-ce que l'effet de « perte au milieu » ?
Récapitulatif
Ne résolvez pas le problème de mémoire en saturant le contexte. Utilisez des résumés et la recherche pour faire ressortir ce qui compte à chaque tour.
Questions Fréquemment Posées
La leçon « Pourquoi les contextes longs ne passent pas à l’échelle » est-elle gratuite ?
Oui — le texte complet de « Pourquoi les contextes longs ne passent pas à l’échelle » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Agents, passe à CoddyKit PRO. Le cours AI Agents comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Pourquoi les contextes longs ne passent pas à l’échelle » ?
Le coût augmente linéairement, la qualité se dégrade et le phénomène de « perte au milieu » fait oublier au modèle le contenu enfoui dans les prompts longs. Tu pratiques AI Agents avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer AI Agents ?
Aucune expérience préalable n'est requise. AI Agents sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 4.
Combien de temps prend la leçon « Pourquoi les contextes longs ne passent pas à l’échelle » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon AI Agents ?
Oui. Chaque leçon AI Agents inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Mémoire à court terme dans la fenêtre de contexte
- Pourquoi les contextes longs ne passent pas à l’échelle
- La synthèse comme compression
- Stockages mémoire simples (clé-valeur)