0Pricing
AI Agents · Leçon

La synthèse comme compression

Remplacez périodiquement les anciens échanges par un résumé cumulatif, en échangeant la restitution exacte contre de l’espace dans la fenêtre de contexte.

La synthèse comme compression est une leçon AI Agents gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Agents, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Agents comprend 4 leçons au total.

La compression comme mémoire

Lorsqu'une conversation devient longue, remplacez les anciens tours par un court résumé. Vous échangez le recall exact contre de l'espace de contexte.

Le résumé restitue l'essentiel (faits, décisions, éléments en attente) — le texte exact a disparu.

Quand résumer

Déclenchez le résumé lorsque :

  • le nombre total de jetons dépasse un seuil (par exemple 8 k)
  • le nombre de tours dépasse N (par exemple 20)
  • l'utilisateur commence un nouveau sujet

Résumer les tours plus anciens

Conservez les tours récents tels quels ; résumez uniquement ceux qui sont sortis du contexte :

def compact(messages, keep_recent=10):
    system = messages[0]
    old = messages[1:-keep_recent]
    recent = messages[-keep_recent:]
    if not old:
        return messages
    summary = summarise(old)
    return [
        system,
        {'role': 'system', 'content': f'Earlier conversation summary:\n{summary}'},
        *recent
    ]

Invite de résumé

Utilisez un appel distinct à un modèle peu coûteux pour produire le résumé :

def summarise(messages):
    text = '\n'.join(f'{m["role"]}: {m["content"]}' for m in messages)
    response = client.chat.completions.create(
        model='gpt-4o-mini',
        messages=[
            {'role': 'system', 'content': 'Summarise this conversation in 5 bullet points. Preserve facts, decisions, and pending TODOs.'},
            {'role': 'user', 'content': text}
        ],
        max_tokens=300,
    )
    return response.choices[0].message.content

Résumés cumulatifs

Conservez un seul résumé évolutif au lieu de tout résumer à nouveau depuis le début à chaque fois :

running_summary = ''

def extend_summary(new_messages):
    global running_summary
    response = client.chat.completions.create(
        model='gpt-4o-mini',
        messages=[
            {'role': 'system', 'content': 'Extend the existing summary with the new turns. Keep it under 200 words.'},
            {'role': 'user', 'content': f'Existing summary:\n{running_summary}\n\nNew turns:\n{format(new_messages)}'}
        ],
        max_tokens=500,
    )
    running_summary = response.choices[0].message.content

Résumés structurés

Demandez au résumé d'extraire des champs précis :

summary_schema = {
    'topics_discussed': '...',
    'user_facts': {'name': '...', 'preferences': '...'},
    'open_questions': ['...'],
    'decisions_made': ['...']
}
# Use json_object response_format to enforce.
import json
print(json.dumps(summary_schema, indent=2))

Résumés hiérarchiques

Pour les historiques très longs :

  • résumés tous les 100 tours (niveau intermédiaire)
  • résumés tous les 1 000 tours (niveau supérieur)
  • résumé sur toute la durée de vie (niveau extrême)

N'injectez dans le contexte que le niveau approprié.

Perte de détails

Les résumés perdent les citations précises et la formulation exacte. Si l'utilisateur demande « qu'ai-je dit exactement au sujet des tarifs plus tôt ? », le modèle ne peut pas répondre.

Pour un recall mot à mot, vous avez besoin soit d'un contexte plus grand, soit d'une archive avec recherche vectorielle.

Associer les deux à une archive vectorielle

Le meilleur des deux approches :

  1. résumez les anciens tours dans le message système
  2. ALSO vectorisez chaque tour dans une base vectorielle
  3. si l'utilisateur demande des précisions, récupérez le texte exact dans la base vectorielle

La qualité des résumés compte

Un résumé de mauvaise qualité est pire que l'absence de résumé. Utilisez un modèle peu coûteux mais performant (gpt-4o-mini, haiku) — et non le niveau le moins cher — pour les appels de résumé.

Les mises à jour des résumés sont coûteuses

Résumer 8 000 jetons de conversation est un véritable appel LLM — 1 à 2 secondes, 0,5 centime. Faites-le de manière asynchrone entre les tours plutôt que sur le chemin critique.

Le compromis du résumé

Quel est le principal compromis lorsque vous utilisez le résumé comme mémoire ?

Récapitulatif

Le résumé est le moyen peu coûteux d'étendre la mémoire. Combinez-le avec la recherche vectorielle pour obtenir un recall de citations exactes.

Questions Fréquemment Posées

La leçon « La synthèse comme compression » est-elle gratuite ?

Oui — le texte complet de « La synthèse comme compression » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Agents, passe à CoddyKit PRO. Le cours AI Agents comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « La synthèse comme compression » ?

Remplacez périodiquement les anciens échanges par un résumé cumulatif, en échangeant la restitution exacte contre de l’espace dans la fenêtre de contexte. Tu pratiques AI Agents avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Agents ?

Aucune expérience préalable n'est requise. AI Agents sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.

Combien de temps prend la leçon « La synthèse comme compression » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Agents ?

Oui. Chaque leçon AI Agents inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Mémoire à court terme dans la fenêtre de contexte
  2. Pourquoi les contextes longs ne passent pas à l’échelle
  3. La synthèse comme compression
  4. Stockages mémoire simples (clé-valeur)
← Retour à AI Agents