0Pricing
AI Agents · Lezione

La summarisation come compressione

Sostituisca periodicamente i turni meno recenti con un riepilogo progressivo, rinunciando al ricordo esatto per liberare spazio nella finestra di contesto.

La summarisation come compressione è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 3 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.

La compressione come memoria

Quando una conversazione diventa lunga, sostituisca i turni meno recenti con un breve riepilogo. Scambia il recupero esatto con spazio nel contesto.

Il riepilogo cattura l’essenziale (fatti, decisioni, elementi in sospeso): il testo verbatim viene perso.

Quando riepilogare

Attivi il riepilogo quando:

  • Il totale dei token supera una soglia (ad esempio 8k)
  • Il numero di turni supera N (ad esempio 20)
  • L’utente inizia un nuovo argomento

Riepiloghi i turni meno recenti

Mantenga i turni recenti verbatim; riepiloghi solo ciò che è stato escluso:

def compact(messages, keep_recent=10):
    system = messages[0]
    old = messages[1:-keep_recent]
    recent = messages[-keep_recent:]
    if not old:
        return messages
    summary = summarise(old)
    return [
        system,
        {'role': 'system', 'content': f'Earlier conversation summary:\n{summary}'},
        *recent
    ]

Prompt per il riepilogo

Utilizzi una chiamata separata a un modello economico per creare il riepilogo:

def summarise(messages):
    text = '\n'.join(f'{m["role"]}: {m["content"]}' for m in messages)
    response = client.chat.completions.create(
        model='gpt-4o-mini',
        messages=[
            {'role': 'system', 'content': 'Summarise this conversation in 5 bullet points. Preserve facts, decisions, and pending TODOs.'},
            {'role': 'user', 'content': text}
        ],
        max_tokens=300,
    )
    return response.choices[0].message.content

Riepiloghi progressivi

Mantenga un unico riepilogo in crescita invece di riepilogare tutto da zero ogni volta:

running_summary = ''

def extend_summary(new_messages):
    global running_summary
    response = client.chat.completions.create(
        model='gpt-4o-mini',
        messages=[
            {'role': 'system', 'content': 'Extend the existing summary with the new turns. Keep it under 200 words.'},
            {'role': 'user', 'content': f'Existing summary:\n{running_summary}\n\nNew turns:\n{format(new_messages)}'}
        ],
        max_tokens=500,
    )
    running_summary = response.choices[0].message.content

Riepiloghi strutturati

Obblighi il riepilogo a estrarre campi specifici:

summary_schema = {
    'topics_discussed': '...',
    'user_facts': {'name': '...', 'preferences': '...'},
    'open_questions': ['...'],
    'decisions_made': ['...']
}
# Use json_object response_format to enforce.
import json
print(json.dumps(summary_schema, indent=2))

Riepiloghi gerarchici

Per cronologie molto lunghe:

  • Riepiloghi ogni 100 turni (livello intermedio)
  • Riepiloghi ogni 1000 turni (livello generale)
  • Riepilogo dell’intera vita (livello estremo)

Inserisca nel contesto solo il livello appropriato.

Perdita di dettagli

I riepiloghi perdono le citazioni specifiche e le formulazioni esatte. Se l’utente chiede "che cosa ho detto esattamente prima sui prezzi?", il modello non può rispondere.

Per recuperare il testo verbatim, serve un contesto più ampio oppure un archivio con ricerca vettoriale.

Entrambi: riepilogo e archivio vettoriale

Il meglio dei due approcci:

  1. Riepiloghi i turni meno recenti nel messaggio di sistema
  2. Inoltre, trasformi ogni turno in un embedding e lo salvi in un vector store
  3. Se l’utente chiede dettagli, recuperi il testo verbatim dal vector store

La qualità del riepilogo è importante

Un riepilogo scadente è peggio di nessun riepilogo. Utilizzi un modello economico ma capace (gpt-4o-mini, haiku), non il livello più economico, per le chiamate di riepilogo.

Gli aggiornamenti del riepilogo sono costosi

Riepilogare 8000 token di conversazione è una vera chiamata LLM: richiede 1-2 secondi e costa 0,5 centesimi. Lo faccia in modo asincrono tra un turno e l’altro, anziché nel percorso critico.

Compromesso del riepilogo

Qual è il principale compromesso quando si usa il riepilogo come memoria?

Riepilogo

Il riepilogo è il modo economico per estendere la memoria. Lo combini con il retrieval vettoriale per recuperare citazioni esatte.

Domande Frequenti

La lezione «La summarisation come compressione» è gratuita?

Sì — il testo completo di «La summarisation come compressione» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.

Cosa imparerò in «La summarisation come compressione»?

Sostituisca periodicamente i turni meno recenti con un riepilogo progressivo, rinunciando al ricordo esatto per liberare spazio nella finestra di contesto. Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare AI Agents?

Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 3 di 4.

Quanto tempo richiede la lezione «La summarisation come compressione»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione AI Agents?

Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Memoria a breve termine nella finestra di contesto
  2. Perché i contesti lunghi non scalano
  3. La summarisation come compressione
  4. Archivi di memoria semplici (chiave-valore)
← Torna a AI Agents