AI Agents · Lekcja

Dlaczego długie konteksty się nie skalują

Koszt rośnie liniowo, jakość spada, a zjawisko „lost-in-the-middle” sprawia, że model zapomina treści ukryte w długich promptach.

Lekcja 2 z 413 kroki

Dlaczego długie konteksty się nie skalują to bezpłatna lekcja AI Agents na CoddyKit. To lekcja 2 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej AI Agents, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs AI Agents zawiera 4 lekcji w sumie.

Większy nie zawsze znaczy lepszy

Nowoczesne modele mają ogromne okna kontekstu — 200 tys., 1 mln, a nawet 2 mln tokenów. Kuszące jest „po prostu wrzucić wszystko”, zamiast budować prawdziwą pamięć.

To podejście zawodzi na produkcji z trzech powodów.

Powód 1: koszt

Każdy token w każdym wywołaniu kosztuje. Prompt systemowy zawierający 100 tys. tokenów przy 1000 turach oznacza łącznie 100 mln tokenów wejściowych, czyli dziesiątki dolarów za sesję.

Buforowanie promptu pomaga, ale nie eliminuje kosztów.

Powód 2: opóźnienie

Przetwarzanie 100 tys. tokenów wejściowych wydłuża czas do pierwszego tokenu o 1–3 sekundy. W przypadku interfejsu czatu warto dążyć do TTFT poniżej 500 ms.

Powód 3: spadek jakości

Modele zwracają mniej uwagi na treści znajdujące się w środku długich promptów — to efekt „zagubienia w środku” opisany przez Liu i in. w 2023 roku.

Informacje na początku lub końcu są odtwarzane dokładnie, natomiast informacje ze środka są często pomijane.

Praktyczny test

Umieść unikatowy fakt w różnych miejscach długiego dokumentu i poproś model o jego odtworzenie. Dokładność:

  • Początek dokumentu: 95%
  • Koniec dokumentu: 90%
  • Środek: 50–70%

Długi kontekst do ewaluacji, nie na produkcję

Długie konteksty są przydatne w zadaniach jednorazowych (na przykład „przeanalizuj całą bazę kodu”), ale nie nadają się do agentów produkcyjnych działających w trybie ciągłym.

Na produkcji używaj wyszukiwania, aby w każdej turze wstrzykiwać tylko 5% istotnych informacji.

Kiedy długie konteksty pomagają

  • Wstępna analiza bazy kodu
  • Pytania i odpowiedzi dotyczące całego dokumentu w jednym wywołaniu
  • Porównywanie dwóch długich dokumentów

Zadania jednorazowe, w których nie trzeba odtwarzać kontekstu.

Kiedy długie konteksty szkodzą

  • Chatboty z setkami tur
  • Agenci obsługujący wielu użytkowników
  • Wszędzie tam, gdzie znaczenie mają koszt lub opóźnienie

Właściwa architektura

W przypadku agentów działających przez długi czas:

  1. Najnowsze tury w prompcie (ostatnie 10–20)
  2. Starsze tury podsumowane w narastającym podsumowaniu
  3. Fakty przekształcone w wektory i zapisane w pamięci długotrwałej
  4. Pobieranie najbardziej istotnych wspomnień (top-K) w każdej turze

Podejście hybrydowe

Połącz techniki:

messages = [
    {'role': 'system', 'content': PERSONA},
    {'role': 'system', 'content': f'Conversation summary so far: {summary}'},
    {'role': 'system', 'content': f'Relevant past facts: {retrieved_facts}'},
    *last_n_turns,
]

Wyzwalacze kompaktowania

Ustal, KIEDY kompaktować kontekst:

  • Co N tur (proste)
  • Po przekroczeniu progu liczby tokenów (lepsze)
  • Gdy model zaczyna zapominać (najlepsze, ale trudne do wykrycia)

Zagubienie w środku

Na czym polega efekt „zagubienia w środku”?

Podsumowanie

Nie rozwiązuj problemu pamięci przez maksymalne zwiększanie kontekstu. Używaj podsumowań i wyszukiwania, aby w każdej turze uwidaczniać to, co istotne.

Bezpłatny start

Ucz się AI Agents dzięki korepetycjom AI — za darmo

Pisz i uruchamiaj kod w przeglądarce, otrzymuj natychmiastową pomoc od korepetytora AI dostępnego 24/7 i kontynuuj naukę w sieci lub w aplikacji.

Kursy
60
Lekcje
239

Często zadawane pytania

Czy lekcja „Dlaczego długie konteksty się nie skalują” jest bezpłatna?

Tak — pełny tekst „Dlaczego długie konteksty się nie skalują” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu AI Agents, przejdź na CoddyKit PRO. Kurs AI Agents zawiera 4 lekcji w sumie.

Co nauczysz się w „Dlaczego długie konteksty się nie skalują”?

Koszt rośnie liniowo, jakość spada, a zjawisko „lost-in-the-middle” sprawia, że model zapomina treści ukryte w długich promptach. Ćwiczysz AI Agents z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć AI Agents?

Nie wymagamy żadnego doświadczenia. AI Agents w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 2 z 4.

Ile czasu zajmuje lekcja „Dlaczego długie konteksty się nie skalują”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji AI Agents?

Tak. Każda lekcja AI Agents zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Pamięć krótkotrwała w oknie kontekstu
  2. Dlaczego długie konteksty się nie skalują
  3. Streszczanie jako kompresja
  4. Proste magazyny pamięci (klucz-wartość)
← Powrót do AI Agents