Почему длинные контексты не масштабируются
Стоимость растёт линейно, качество снижается, а эффект «потерянного в середине» заставляет модель забывать содержимое, спрятанное в длинных промптах.
«Почему длинные контексты не масштабируются» — бесплатный урок AI Agents на CoddyKit. Это урок 2 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.
Больше — не всегда лучше
Современные модели имеют огромные контекстные окна — 200k, 1M и даже 2M токенов. Возникает соблазн «просто загрузить туда всё» вместо создания настоящей памяти.
В рабочей среде такой подход не работает по трём причинам.
Причина 1: стоимость
Каждый токен в каждом вызове стоит денег. Системный промпт на 100k токенов и 1000 ходов = 100M входных токенов, что в сумме составляет десятки долларов за сеанс.
Кэширование промптов помогает, но не устраняет расходы.
Причина 2: задержка
Обработка 100k входных токенов добавляет 1–3 секунды к времени до первого токена. Для удобного чата нужно, чтобы TTFT составляло менее 500 мс.
Причина 3: снижение качества
Модели уделяют меньше внимания содержимому в середине длинных промптов — это эффект «потерянного в середине», описанный Liu et al. в 2023 году.
Информация в начале или конце воспроизводится точно, а информация в середине часто упускается.
Конкретная проверка
Вставьте уникальный факт в разные позиции длинного документа и попросите модель найти его. Точность:
- Начало документа: 95%
- Конец документа: 90%
- Середина: 50–70%
Длинный контекст для оценки, а не для рабочей среды
Длинные контексты полезны для разовых задач (например, для анализа всей этой кодовой базы), но не подходят для постоянно работающих агентов.
В рабочей среде используйте поиск, чтобы добавлять в каждый ход только релевантные 5%.
Когда длинные контексты помогают
- Первичный анализ кодовой базы
- Вопросы и ответы по всему документу за один вызов
- Сравнение двух длинных документов
Одноразовые задачи без повторного воспроизведения.
Когда длинные контексты вредят
- Чат-боты с сотнями ходов
- Агенты для нескольких клиентов, общие для разных пользователей
- Любые сценарии, где важны стоимость или задержка
Правильная архитектура
Для долго работающих агентов:
- Последние ходы в промпте (последние 10–20)
- Более старые ходы суммируются в накапливаемую сводку
- Факты преобразуются в векторы и сохраняются в долговременной памяти
- Для каждого хода извлекаются наиболее релевантные воспоминания — top-K
Гибридный подход
Объединяйте методы:
messages = [
{'role': 'system', 'content': PERSONA},
{'role': 'system', 'content': f'Conversation summary so far: {summary}'},
{'role': 'system', 'content': f'Relevant past facts: {retrieved_facts}'},
*last_n_turns,
]Триггеры сжатия
Определите WHEN выполнять compact:
- Каждые N ходов (просто)
- Когда количество токенов превышает порог (лучше)
- Когда модель начинает забывать (лучший вариант, но это трудно обнаружить)
Эффект «потерянного в середине»
Что такое эффект «потерянного в середине»?
Итоги
Не решайте проблему памяти, максимально увеличивая контекст. Используйте сводки и поиск, чтобы добавлять в каждый ход наиболее важную информацию.
Часто задаваемые вопросы
Урок «Почему длинные контексты не масштабируются» бесплатный?
Да — полный текст урока «Почему длинные контексты не масштабируются» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.
Чему я научусь в уроке «Почему длинные контексты не масштабируются»?
Стоимость растёт линейно, качество снижается, а эффект «потерянного в середине» заставляет модель забывать содержимое, спрятанное в длинных промптах. Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать AI Agents?
Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 4.
Сколько времени занимает урок «Почему длинные контексты не масштабируются»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке AI Agents?
Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Кратковременная память в контекстном окне
- Почему длинные контексты не масштабируются
- Суммаризация как сжатие
- Простые хранилища памяти (ключ–значение)