0Pricing
AI Prompt Engineering · Leçon

Fenêtres de contexte d’un million de jetons

Possibilités et pièges.

Fenêtres de contexte d’un million de jetons est une leçon AI Prompt Engineering gratuite sur CoddyKit. Ceci est la leçon 1 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Prompt Engineering, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Prompt Engineering comprend 4 leçons au total.

Ce que permet un million de jetons

Les fenêtres d'un million de jetons vous permettent de placer des bases de code entières, des corpus documentaires ou des transcriptions de plusieurs heures directement dans le contexte, sans système de recherche. La promesse est de pouvoir tout garder en contexte : le modèle raisonne sur le matériau brut plutôt que sur un résumé réducteur.

  • Raisonnement et remaniement à l'échelle de tout un dépôt.
  • Synthèse entre documents sans découpage en segments.
  • Conversations de longue durée qui conservent les détails initiaux.

Mais la capacité ne garantit pas une utilisation efficace.

Capacité et contexte effectif

La fenêtre annoncée est une limite supérieure, et non une garantie de rappel uniforme. Le contexte effectif — l'étendue sur laquelle le modèle retrouve et exploite les informations de manière fiable — est généralement plus restreint et inégal selon les positions.

Considérez la fenêtre comme un budget à valeur non uniforme : les jetons proches des extrémités sont mieux rappelés que ceux enfouis au milieu.

Réalités de la latence et du coût

Le coût de l'attention augmente avec la longueur du contexte, tout comme le délai avant le premier jeton. Une requête d'un million de jetons peut entraîner plusieurs secondes de latence de préremplissage et un coût important par appel, même lorsque la réponse est courte.

  • Le préremplissage domine la latence pour les requêtes gigantesques.
  • Le coût évolue avec le nombre de jetons d'entrée, quelle que soit la taille de la sortie.
  • Ajouter du contexte dont vous n'avez pas besoin revient à payer pour embrouiller le modèle.
# Rough mental model: input tokens drive both $ and prefill ms.
# 900k tokens of haystack to answer one question is rarely optimal.

Distraction et dilution

Davantage de contexte peut nuire à la précision. Les éléments non pertinents diluent l'attention et introduisent des distractions auxquelles le modèle peut s'accrocher. Une requête ciblée de 20 000 jetons surpasse souvent une requête bruyante de 500 000 jetons pour une question précise.

La règle est la suivante : incluez ce qui aide la tâche et excluez ce qui pourrait simplement être pertinent.

Quand le long contexte l'emporte sur la recherche

Le long contexte l'emporte lorsque la tâche exige un raisonnement global et transversal que la recherche fragmenterait : « trouver chaque endroit où cet invariant est violé dans le dépôt », « résoudre les contradictions entre les dix contrats ». Une recherche par segments peut manquer le lien qui s'étend sur plusieurs segments.

Utilisez le contexte complet pour la synthèse et la recherche pour retrouver une information précise dans d'immenses corpus.

Quand la recherche l'emporte sur le long contexte

La recherche l'emporte lorsque la fraction pertinente est très faible et stable. Récupérer les 5 pages pertinentes sur 50 000 est moins coûteux, plus rapide et souvent plus précis que d'injecter les 50 000 pages en espérant que le modèle les trouve.

  • Requêtes fréquentes sur un corpus statique → indexez une fois et recherchez à faible coût.
  • Synthèse globale ponctuelle → utilisez le long contexte.

De nombreux systèmes combinent les deux : recherchez pour restreindre, puis utilisez le long contexte pour synthétiser.

def route(task):
    if task.is_global_synthesis: return 'long_context'
    if task.relevant_fraction < 0.05: return 'retrieval'
    return 'hybrid'

La position est une ressource

Comme le rappel varie selon la position, l'endroit où vous placez le contenu constitue un choix de conception. Placez l'instruction de la tâche et le contenu le plus essentiel aux extrémités que le modèle rappelle le mieux, et évitez d'enfouir les faits indispensables au milieu du contexte.

Gérez la position délibérément, plutôt que de la laisser dépendre par accident de l'ordre de concaténation.

Vérifier le rappel dans un long contexte

Ne supposez jamais que le modèle a utilisé un fait enfoui. Sondez-le. Insérez un fait sentinelle connu à une profondeur connue et demandez-le-lui ; mesurez le rappel à différentes profondeurs afin de caractériser votre modèle sur la structure de votre requête avant de lui faire confiance en production.

canary = 'The internal code name is BLUE_HERON.'
# Place at depth d, then ask: 'What is the internal code name?'
# Sweep d across the window to map recall vs position.

Compactage plutôt qu'accumulation

Au cours de longues sessions avec agent, ne laissez pas le contexte croître sans limite. Compactez-le périodiquement : résumez les tours obsolètes dans un objet d'état dense et supprimez l'historique brut. Vous préservez ainsi le signal, récupérez du budget et réduisez la dilution.

L'accumulation est le comportement par défaut et le piège ; le compactage est la discipline à appliquer.

state = summarize(old_turns)  # dense facts, decisions, open items
context = [system, state] + recent_turns

Architectures hybrides

Les conceptions les plus solides combinent les stratégies : récupérez un ensemble ciblé de candidats, placez-le de manière réfléchie, mettez le préfixe stable en cache et compactez la conversation. Le long contexte est un outil parmi d'autres dans une boîte à outils de gestion du budget, et non un substitut à l'ingénierie.

  • Recherchez pour réduire.
  • Positionnez pour exposer.
  • Mettez en cache pour réduire le coût.
  • Compactez pour durer.

Heuristiques de décision

Avant d'utiliser la fenêtre complète, posez-vous les questions suivantes :

  • La tâche exige-t-elle un raisonnement global ou la recherche d'une information précise ? Information précise → recherchez.
  • La fraction pertinente est-elle faible et stable ? Oui → recherchez et mettez en cache.
  • La latence et le coût d'un préremplissage énorme seront-ils acceptables ? Non → réduisez.
  • Avez-vous vérifié le rappel à la profondeur sur laquelle vous comptez ? Si ce n'est pas le cas, effectuez d'abord une vérification ciblée.

La capacité est une possibilité, pas un plan.

Vérification rapide

Vous devez répondre à une question factuelle très précise, dont la réponse se trouve sur environ 3 pages parmi une archive statique de 40 000 pages, et vous exécuterez cette requête des milliers de fois par jour.

Récapitulatif : fenêtres d'un million de jetons

Une fenêtre immense est un budget non uniforme, pas une mémoire libre. Le contexte réellement exploitable est inférieur à la capacité, la latence et le coût augmentent avec la taille de l'entrée, et les éléments non pertinents diluent la précision. Utilisez le contexte long pour la synthèse globale, la récupération pour les éléments précis et des approches hybrides pour le reste — en plaçant le contenu crucial dans les zones où le rappel est fiable, en mettant en cache les préfixes stables, en condensant les longues sessions et en vérifiant toujours le rappel avant de faire confiance à un fait enfoui.

Questions Fréquemment Posées

La leçon « Fenêtres de contexte d’un million de jetons » est-elle gratuite ?

Oui — le texte complet de « Fenêtres de contexte d’un million de jetons » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Prompt Engineering, passe à CoddyKit PRO. Le cours AI Prompt Engineering comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Fenêtres de contexte d’un million de jetons » ?

Possibilités et pièges. Tu pratiques AI Prompt Engineering avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Prompt Engineering ?

Aucune expérience préalable n'est requise. AI Prompt Engineering sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 1 sur 4.

Combien de temps prend la leçon « Fenêtres de contexte d’un million de jetons » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Prompt Engineering ?

Oui. Chaque leçon AI Prompt Engineering inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Fenêtres de contexte d’un million de jetons
  2. Perdu au milieu
  3. Structurer d’immenses prompts
  4. Mettre en cache les longs préfixes
← Retour à AI Prompt Engineering