Perché i contesti lunghi non scalano
I costi crescono linearmente, la qualità peggiora e il fenomeno "lost-in-the-middle" fa dimenticare al modello i contenuti sepolti nei prompt lunghi.
Perché i contesti lunghi non scalano è una lezione AI Agents gratuita su CoddyKit. Questa è la lezione 2 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento AI Agents, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso AI Agents include 4 lezioni in totale.
Più grande non significa sempre migliore
I modelli moderni hanno finestre di contesto enormi: 200k, 1M e persino 2M di token. È allettante "inserire semplicemente tutto" invece di costruire una vera memoria.
In produzione, questo approccio fallisce per tre motivi.
Motivo 1: costo
Ogni token di ogni chiamata ha un costo. Un prompt di sistema di 100k token con 1000 turni equivale a 100M di token in input, per un totale di decine di dollari per sessione.
Il caching dei prompt aiuta, ma non elimina il costo.
Motivo 2: latenza
L’elaborazione di 100k token in input aggiunge da 1 a 3 secondi al tempo necessario per ricevere il primo token. Per una buona esperienza di chat, è consigliabile mantenere il TTFT sotto i 500 ms.
Motivo 3: la qualità diminuisce
I modelli prestano meno attenzione ai contenuti al centro dei prompt lunghi: è l’effetto "lost-in-the-middle" documentato da Liu et al. nel 2023.
Le informazioni all’inizio o alla fine vengono ricordate con precisione; quelle al centro vengono spesso ignorate.
Un test concreto
Inserisca un fatto univoco in posizioni diverse di un documento lungo e chieda al modello di recuperarlo. Precisione:
- Inizio del documento: 95%
- Fine del documento: 90%
- Centro: 50-70%
Contesto lungo per la valutazione, non per la produzione
I contesti lunghi sono utili per attività una tantum (analizzare l’intera codebase), ma non sono adatti agli agenti di produzione in esecuzione continua.
In produzione, utilizzi il retrieval per inserire solo il 5% rilevante a ogni turno.
Quando i contesti lunghi sono utili
- Analisi iniziale della codebase
- Domande e risposte su un documento intero in una singola chiamata
- Confronto tra due documenti lunghi
Attività one-shot senza ripetizione.
Quando i contesti lunghi sono dannosi
- Chatbot con centinaia di turni
- Agenti multi-tenant condivisi tra più utenti
- Qualsiasi situazione in cui costo o latenza siano importanti
L’architettura corretta
Per gli agenti di lunga durata:
- Turni recenti nel prompt (gli ultimi 10-20)
- Turni meno recenti riepilogati in un riepilogo progressivo
- Fatti trasformati in vettori e salvati nella memoria a lungo termine
- Recupero delle memorie più rilevanti per ogni turno
Approccio ibrido
Combini le tecniche:
messages = [
{'role': 'system', 'content': PERSONA},
{'role': 'system', 'content': f'Conversation summary so far: {summary}'},
{'role': 'system', 'content': f'Relevant past facts: {retrieved_facts}'},
*last_n_turns,
]Trigger della compattazione
Decida QUANDO compattare:
- Ogni N turni (semplice)
- Quando il conteggio dei token supera una soglia (migliore)
- Quando il modello inizia a dimenticare (ottimale, ma difficile da rilevare)
Lost in the Middle
Che cos’è l’effetto "lost-in-the-middle"?
Riepilogo
Non risolva il problema della memoria portando il contesto al limite. Utilizzi riepiloghi e retrieval per far emergere ciò che conta a ogni turno.
Domande Frequenti
La lezione «Perché i contesti lunghi non scalano» è gratuita?
Sì — il testo completo di «Perché i contesti lunghi non scalano» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso AI Agents, passa a CoddyKit PRO. Il corso AI Agents include 4 lezioni in totale.
Cosa imparerò in «Perché i contesti lunghi non scalano»?
I costi crescono linearmente, la qualità peggiora e il fenomeno "lost-in-the-middle" fa dimenticare al modello i contenuti sepolti nei prompt lunghi. Eserciti AI Agents con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.
Ho bisogno di esperienza per iniziare AI Agents?
Non è richiesta alcuna esperienza precedente. AI Agents su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 2 di 4.
Quanto tempo richiede la lezione «Perché i contesti lunghi non scalano»?
La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.
Posso scrivere ed eseguire codice in questa lezione AI Agents?
Sì. Ogni lezione AI Agents include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.
Tutte le lezioni di questo corso
- Memoria a breve termine nella finestra di contesto
- Perché i contesti lunghi non scalano
- La summarisation come compressione
- Archivi di memoria semplici (chiave-valore)