Что решает RAG (ограниченность знаний, галлюцинации)
RAG извлекает релевантный контекст во время запроса, поэтому LLM ссылается на реальные источники, а не выдумывает факты.
«Что решает RAG (ограниченность знаний, галлюцинации)» — бесплатный урок AI Agents на CoddyKit. Это урок 1 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.
Две проблемы обычных LLM
Даже у лучших LLM есть две структурные проблемы:
- Ограничение даты знаний — они знают только то, что было в их обучающих данных. Спросите GPT-4 о вчерашнем событии — и он ничего о нём не знает.
- Галлюцинации — когда модель чего-то не знает, она уверенно выдумывает ответ.
Что такое RAG
Генерация с дополнением извлечёнными данными (RAG) означает:
- Найти в базе знаний релевантные фрагменты
- Поместить эти фрагменты в запрос
- Попросить LLM ответить, используя только (ONLY) эти фрагменты
Вместо опоры на зафиксированные в весах знания модель становится «читателем» внешней информации.
Конкретный пример
Пользователь: «Каковы наши правила возврата вскрытой электроники?»
- Найти в базе знаний компании (KB) «правила возврата электроники» — получить 3 абзаца из справочной документации
- Составить запрос: «Используя приведённый ниже контекст, ответьте: ...»
- Модель выдаёт точный ответ со ссылками на источники
Почему RAG лучше дообучения
Для фактических знаний RAG > дообучения, потому что:
- Базу знаний можно обновлять без повторного обучения
- Данные каждого пользователя или клиента легко отделить
- Можно добавлять ссылки на источники (Вы знаете, КАКОЙ (WHICH) фрагмент породил ответ)
- Поддержка обходится дешевле
Почему RAG уменьшает галлюцинации
Если указать модели отвечать только (ONLY) на основе предоставленного контекста, а контекст содержит правду, вероятность правильного ответа будет гораздо выше, чем при опоре на память.
Это не даёт идеального результата — модели всё ещё иногда выдумывают ответы, — но количество галлюцинаций значительно сокращается.
Три этапа
Каждая система RAG состоит из трёх этапов:
- Загрузка данных (офлайн) — разделить документы на фрагменты, получить эмбеддинги, сохранить
- Извлечение (онлайн) — получить эмбеддинг запроса, найти K лучших фрагментов
- Генерация (онлайн) — LLM создаёт ответ с использованием найденных фрагментов
Наивный и продвинутый RAG
Наивный RAG (прототип из 5 строк):
- Разбиение на фрагменты фиксированного размера
- Извлечение по одному вектору
- Помещение K лучших результатов в запрос
Продвинутый RAG добавляет переранжирование, переписывание запросов, HyDE, несколько векторов и оценку — каждый компонент повышает качество, но также увеличивает сложность.
Когда RAG помогает
- Базы знаний и документация компании
- Поддержка клиентов по руководству к продукту
- Фактические вопросы с длинным хвостом
- Персональные помощники, работающие с данными пользователя
Когда RAG мешает
- Простой разговор (факты не нужны)
- Задачи, требующие рассуждений, а не фактов
- Случаи, когда корпус и так достаточно мал, чтобы поместиться в контексте
Шаблон запроса
Типичный запрос RAG выглядит так:
prompt = f'''
Answer the user\'s question using ONLY the context below.
If the answer is not in the context, say 'I do not know'.
Context:
{retrieved_chunks}
Question:
{user_question}
Answer:
'''Ссылки на источники
Оформите фрагменты с идентификаторами источников и попросите модель указывать их в ответе:
context = '\n'.join(
f'[doc {i+1}] {chunk.text}'
for i, chunk in enumerate(chunks)
)
# Then ask: 'Cite the relevant [doc N] for each claim.'Цель RAG
Какую основную проблему решает RAG?
Итоги
RAG превращает LLM в учеников, сдающих тест с открытой книгой. Далее: как правильно разделять документы на фрагменты для извлечения.
Часто задаваемые вопросы
Урок «Что решает RAG (ограниченность знаний, галлюцинации)» бесплатный?
Да — полный текст урока «Что решает RAG (ограниченность знаний, галлюцинации)» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.
Чему я научусь в уроке «Что решает RAG (ограниченность знаний, галлюцинации)»?
RAG извлекает релевантный контекст во время запроса, поэтому LLM ссылается на реальные источники, а не выдумывает факты. Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать AI Agents?
Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 4.
Сколько времени занимает урок «Что решает RAG (ограниченность знаний, галлюцинации)»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке AI Agents?
Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Что решает RAG (ограниченность знаний, галлюцинации)
- Стратегии разбиения (фиксированные, по предложениям, семантические)
- Индексация набора документов
- Создание простого RAG с FAISS или Chroma