Основы генерации с дополнением поиска (RAG)
Узнайте, как RAG основывает ответы LLM на собственных документах: извлекает релевантный контекст во время запроса и передаёт его в запрос.
«Основы генерации с дополнением поиска (RAG)» — бесплатный урок Prompt Engineering & LLM Optimization for Developers на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Prompt Engineering & LLM Optimization for Developers, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Prompt Engineering & LLM Optimization for Developers содержит 4 уроков всего.
Части этого урока еще не переведены и отображаются на английском.
The Knowledge Gap
An LLM only knows what it was trained on. It cannot answer questions about your private docs or recent events. RAG (Retrieval-Augmented Generation) closes this gap by fetching relevant text and putting it in the prompt.
The Core Idea
Instead of fine-tuning the model on your data, you retrieve the most relevant snippets at query time and let the model answer using them as context. Cheaper, faster to update, and easy to cite.
Step 1: Chunking
Documents are split into small chunks (a few hundred tokens each). Chunks small enough to be precise, large enough to keep meaning.
chunks = split(document, size=500, overlap=50)Step 2: Embeddings
Each chunk is converted to a vector with an embedding model. Similar meanings produce nearby vectors, enabling semantic search.
vector = embed("Refunds are processed in 5 days.")
// -> [0.012, -0.43, 0.88, ...]Step 3: The Vector Store
Vectors are saved in a vector database like Pinecone, Weaviate, or pgvector. It supports fast nearest-neighbor search over millions of chunks.
Step 4: Retrieve at Query Time
When a user asks a question, you embed the question and find the top-k most similar chunks.
q = embed(userQuestion);
results = store.search(q, topK=4);Step 5: Augment the Prompt
The retrieved chunks are inserted into the prompt as context, and the model is told to answer using only that context.
Use only the context below to answer.
Context:
{retrieved_chunks}
Question: {user_question}Grounding and Citations
Because the answer is built from real chunks, you can show citations back to the source documents, and you can instruct the model to say I do not know when the context lacks the answer.
Why Not Just Fine-Tune?
- RAG updates instantly: change a doc, re-index, done.
- Fine-tuning is slow and bakes knowledge in.
- RAG gives traceable sources; fine-tuning does not.
Common RAG Problems
Poor chunking, weak embeddings, or retrieving too few chunks all hurt quality. If answers are wrong, inspect what was retrieved first; the issue is usually retrieval, not the model.
Improving Retrieval
- Add overlap between chunks.
- Use hybrid keyword + vector search.
- Re-rank results with a cross-encoder.
- Tune top-k for your context window.
Quick Check
Test your understanding of RAG.
Recap
RAG chunks documents, embeds them into a vector store, retrieves the most relevant chunks for each query, and augments the prompt. It grounds answers, enables citations, and stays current without retraining.
Часто задаваемые вопросы
Урок «Основы генерации с дополнением поиска (RAG)» бесплатный?
Да — полный текст урока «Основы генерации с дополнением поиска (RAG)» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Prompt Engineering & LLM Optimization for Developers, подпишись на CoddyKit PRO. Курс Prompt Engineering & LLM Optimization for Developers содержит 4 уроков всего.
Чему я научусь в уроке «Основы генерации с дополнением поиска (RAG)»?
Узнайте, как RAG основывает ответы LLM на собственных документах: извлекает релевантный контекст во время запроса и передаёт его в запрос. Ты практикуешь Prompt Engineering & LLM Optimization for Developers с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать Prompt Engineering & LLM Optimization for Developers?
Предыдущий опыт не требуется. Prompt Engineering & LLM Optimization for Developers на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.
Сколько времени занимает урок «Основы генерации с дополнением поиска (RAG)»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке Prompt Engineering & LLM Optimization for Developers?
Да. Каждый урок Prompt Engineering & LLM Optimization for Developers включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Взаимодействие с API LLM (OpenAI, Anthropic)
- Основы LangChain и LlamaIndex
- Управление промптами и версионирование
- Основы генерации с дополнением поиска (RAG)