Dlaczego długie konteksty się nie skalują
Koszt rośnie liniowo, jakość spada, a zjawisko „lost-in-the-middle” sprawia, że model zapomina treści ukryte w długich promptach.
Dlaczego długie konteksty się nie skalują to bezpłatna lekcja AI Agents na CoddyKit. To lekcja 2 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Agents, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Agents zawiera 4 lekcji w sumie.
Większy nie zawsze znaczy lepszy
Nowoczesne modele mają ogromne okna kontekstu — 200 tys., 1 mln, a nawet 2 mln tokenów. Kuszące jest „po prostu wrzucić wszystko”, zamiast budować prawdziwą pamięć.
To podejście zawodzi na produkcji z trzech powodów.
Powód 1: koszt
Każdy token w każdym wywołaniu kosztuje. Prompt systemowy zawierający 100 tys. tokenów przy 1000 turach oznacza łącznie 100 mln tokenów wejściowych, czyli dziesiątki dolarów za sesję.
Buforowanie promptu pomaga, ale nie eliminuje kosztów.
Powód 2: opóźnienie
Przetwarzanie 100 tys. tokenów wejściowych wydłuża czas do pierwszego tokenu o 1–3 sekundy. W przypadku interfejsu czatu warto dążyć do TTFT poniżej 500 ms.
Powód 3: spadek jakości
Modele zwracają mniej uwagi na treści znajdujące się w środku długich promptów — to efekt „zagubienia w środku” opisany przez Liu i in. w 2023 roku.
Informacje na początku lub końcu są odtwarzane dokładnie, natomiast informacje ze środka są często pomijane.
Praktyczny test
Umieść unikatowy fakt w różnych miejscach długiego dokumentu i poproś model o jego odtworzenie. Dokładność:
- Początek dokumentu: 95%
- Koniec dokumentu: 90%
- Środek: 50–70%
Długi kontekst do ewaluacji, nie na produkcję
Długie konteksty są przydatne w zadaniach jednorazowych (na przykład „przeanalizuj całą bazę kodu”), ale nie nadają się do agentów produkcyjnych działających w trybie ciągłym.
Na produkcji używaj wyszukiwania, aby w każdej turze wstrzykiwać tylko 5% istotnych informacji.
Kiedy długie konteksty pomagają
- Wstępna analiza bazy kodu
- Pytania i odpowiedzi dotyczące całego dokumentu w jednym wywołaniu
- Porównywanie dwóch długich dokumentów
Zadania jednorazowe, w których nie trzeba odtwarzać kontekstu.
Kiedy długie konteksty szkodzą
- Chatboty z setkami tur
- Agenci obsługujący wielu użytkowników
- Wszędzie tam, gdzie znaczenie mają koszt lub opóźnienie
Właściwa architektura
W przypadku agentów działających przez długi czas:
- Najnowsze tury w prompcie (ostatnie 10–20)
- Starsze tury podsumowane w narastającym podsumowaniu
- Fakty przekształcone w wektory i zapisane w pamięci długotrwałej
- Pobieranie najbardziej istotnych wspomnień (top-K) w każdej turze
Podejście hybrydowe
Połącz techniki:
messages = [
{'role': 'system', 'content': PERSONA},
{'role': 'system', 'content': f'Conversation summary so far: {summary}'},
{'role': 'system', 'content': f'Relevant past facts: {retrieved_facts}'},
*last_n_turns,
]Wyzwalacze kompaktowania
Ustal, KIEDY kompaktować kontekst:
- Co N tur (proste)
- Po przekroczeniu progu liczby tokenów (lepsze)
- Gdy model zaczyna zapominać (najlepsze, ale trudne do wykrycia)
Zagubienie w środku
Na czym polega efekt „zagubienia w środku”?
Podsumowanie
Nie rozwiązuj problemu pamięci przez maksymalne zwiększanie kontekstu. Używaj podsumowań i wyszukiwania, aby w każdej turze uwidaczniać to, co istotne.
Ucz się AI Agents dzięki korepetycjom AI — za darmo
Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.
- Kursy
- 60
- Lekcje
- 239
Często zadawane pytania
Czy lekcja „Dlaczego długie konteksty się nie skalują” jest bezpłatna?
Tak — pełny tekst „Dlaczego długie konteksty się nie skalują” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Agents, przejdź na CoddyKit PRO. Kurs AI Agents zawiera 4 lekcji w sumie.
Co nauczysz się w „Dlaczego długie konteksty się nie skalują”?
Koszt rośnie liniowo, jakość spada, a zjawisko „lost-in-the-middle” sprawia, że model zapomina treści ukryte w długich promptach. Ćwiczysz AI Agents z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć AI Agents?
Nie wymagamy żadnego doświadczenia. AI Agents w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 2 z 4.
Ile czasu zajmuje lekcja „Dlaczego długie konteksty się nie skalują”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji AI Agents?
Tak. Każda lekcja AI Agents zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Pamięć krótkotrwała w oknie kontekstu
- Dlaczego długie konteksty się nie skalują
- Streszczanie jako kompresja
- Proste magazyny pamięci (klucz-wartość)