0Pricing
AI Agents · Урок

Почему длинные контексты не масштабируются

Стоимость растёт линейно, качество снижается, а эффект «потерянного в середине» заставляет модель забывать содержимое, спрятанное в длинных промптах.

«Почему длинные контексты не масштабируются» — бесплатный урок AI Agents на CoddyKit. Это урок 2 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.

Больше — не всегда лучше

Современные модели имеют огромные контекстные окна — 200k, 1M и даже 2M токенов. Возникает соблазн «просто загрузить туда всё» вместо создания настоящей памяти.

В рабочей среде такой подход не работает по трём причинам.

Причина 1: стоимость

Каждый токен в каждом вызове стоит денег. Системный промпт на 100k токенов и 1000 ходов = 100M входных токенов, что в сумме составляет десятки долларов за сеанс.

Кэширование промптов помогает, но не устраняет расходы.

Причина 2: задержка

Обработка 100k входных токенов добавляет 1–3 секунды к времени до первого токена. Для удобного чата нужно, чтобы TTFT составляло менее 500 мс.

Причина 3: снижение качества

Модели уделяют меньше внимания содержимому в середине длинных промптов — это эффект «потерянного в середине», описанный Liu et al. в 2023 году.

Информация в начале или конце воспроизводится точно, а информация в середине часто упускается.

Конкретная проверка

Вставьте уникальный факт в разные позиции длинного документа и попросите модель найти его. Точность:

  • Начало документа: 95%
  • Конец документа: 90%
  • Середина: 50–70%

Длинный контекст для оценки, а не для рабочей среды

Длинные контексты полезны для разовых задач (например, для анализа всей этой кодовой базы), но не подходят для постоянно работающих агентов.

В рабочей среде используйте поиск, чтобы добавлять в каждый ход только релевантные 5%.

Когда длинные контексты помогают

  • Первичный анализ кодовой базы
  • Вопросы и ответы по всему документу за один вызов
  • Сравнение двух длинных документов

Одноразовые задачи без повторного воспроизведения.

Когда длинные контексты вредят

  • Чат-боты с сотнями ходов
  • Агенты для нескольких клиентов, общие для разных пользователей
  • Любые сценарии, где важны стоимость или задержка

Правильная архитектура

Для долго работающих агентов:

  1. Последние ходы в промпте (последние 10–20)
  2. Более старые ходы суммируются в накапливаемую сводку
  3. Факты преобразуются в векторы и сохраняются в долговременной памяти
  4. Для каждого хода извлекаются наиболее релевантные воспоминания — top-K

Гибридный подход

Объединяйте методы:

messages = [
    {'role': 'system', 'content': PERSONA},
    {'role': 'system', 'content': f'Conversation summary so far: {summary}'},
    {'role': 'system', 'content': f'Relevant past facts: {retrieved_facts}'},
    *last_n_turns,
]

Триггеры сжатия

Определите WHEN выполнять compact:

  • Каждые N ходов (просто)
  • Когда количество токенов превышает порог (лучше)
  • Когда модель начинает забывать (лучший вариант, но это трудно обнаружить)

Эффект «потерянного в середине»

Что такое эффект «потерянного в середине»?

Итоги

Не решайте проблему памяти, максимально увеличивая контекст. Используйте сводки и поиск, чтобы добавлять в каждый ход наиболее важную информацию.

Часто задаваемые вопросы

Урок «Почему длинные контексты не масштабируются» бесплатный?

Да — полный текст урока «Почему длинные контексты не масштабируются» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.

Чему я научусь в уроке «Почему длинные контексты не масштабируются»?

Стоимость растёт линейно, качество снижается, а эффект «потерянного в середине» заставляет модель забывать содержимое, спрятанное в длинных промптах. Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать AI Agents?

Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 2 из 4.

Сколько времени занимает урок «Почему длинные контексты не масштабируются»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке AI Agents?

Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Кратковременная память в контекстном окне
  2. Почему длинные контексты не масштабируются
  3. Суммаризация как сжатие
  4. Простые хранилища памяти (ключ–значение)
← Назад к AI Agents