0Pricing
Vector Databases: Pinecone, Weaviate & pgvector · Урок

Стратегии разбиения для RAG

Научитесь разбивать документы на эффективные фрагменты для создания эмбеддингов, чтобы система RAG извлекала точный и релевантный контекст.

«Стратегии разбиения для RAG» — бесплатный урок Vector Databases: Pinecone, Weaviate & pgvector на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Vector Databases: Pinecone, Weaviate & pgvector, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Vector Databases: Pinecone, Weaviate & pgvector содержит 4 уроков всего.

Части этого урока еще не переведены и отображаются на английском.

Why Chunking Matters

Before embedding, documents are split into chunks. Chunk quality directly determines retrieval quality — too large dilutes relevance, too small loses context.

Fixed-Size Chunking

The simplest method splits text every N characters or tokens. Fast but can cut sentences mid-thought.

def fixed_chunks(text, size=500):
    return [text[i:i+size] for i in range(0, len(text), size)]

Overlapping Windows

Add overlap between chunks so context spanning a boundary is not lost. A 10-20% overlap is common.

def overlap_chunks(text, size=500, overlap=100):
    step = size - overlap
    return [text[i:i+size] for i in range(0, len(text), step)]

Sentence-Aware Splitting

Split on sentence boundaries so each chunk stays grammatically whole. This usually improves embedding quality over raw character splits.

import re
sentences = re.split(r'(?<=[.!?])\s+', document_text)

Recursive Chunking

Recursive splitting tries large separators first (paragraphs), then smaller ones (sentences, words) until chunks fit the size limit. It respects natural structure.

Semantic Chunking

Semantic chunking groups sentences by meaning similarity, starting a new chunk when topic shifts. More expensive but very precise.

Chunk Size vs Model

Match chunk size to your embedding model's context window and your LLM's prompt budget.

  • Small chunks: precise but fragmented
  • Large chunks: rich but noisy

Keeping Metadata

Store source, page, and position metadata with each chunk so you can cite sources and reconstruct context later.

chunk = {
  'text': part,
  'source': 'guide.pdf',
  'page': 4,
  'position': idx
}

Parent-Child Chunks

Embed small child chunks for precise matching, but return their larger parent chunk to the LLM for full context. Best of both worlds.

Evaluating Chunking

Test different chunking configs with the same queries and measure retrieval hit rate. There is no universal best — measure for your data.

Practical Defaults

A solid starting point:

  • Recursive splitting
  • ~500 tokens per chunk
  • ~50-100 token overlap
  • Attach source metadata

Quick Check

Test your chunking knowledge.

Recap

You learned fixed, overlapping, sentence-aware, recursive, and semantic chunking, plus parent-child retrieval and metadata. Good chunking is the foundation of accurate RAG retrieval.

Часто задаваемые вопросы

Урок «Стратегии разбиения для RAG» бесплатный?

Да — полный текст урока «Стратегии разбиения для RAG» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Vector Databases: Pinecone, Weaviate & pgvector, подпишись на CoddyKit PRO. Курс Vector Databases: Pinecone, Weaviate & pgvector содержит 4 уроков всего.

Чему я научусь в уроке «Стратегии разбиения для RAG»?

Научитесь разбивать документы на эффективные фрагменты для создания эмбеддингов, чтобы система RAG извлекала точный и релевантный контекст. Ты практикуешь Vector Databases: Pinecone, Weaviate & pgvector с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать Vector Databases: Pinecone, Weaviate & pgvector?

Предыдущий опыт не требуется. Vector Databases: Pinecone, Weaviate & pgvector на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.

Сколько времени занимает урок «Стратегии разбиения для RAG»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке Vector Databases: Pinecone, Weaviate & pgvector?

Да. Каждый урок Vector Databases: Pinecone, Weaviate & pgvector включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Обзор архитектуры системы RAG
  2. Интеграция с платформами LLM
  3. Контекстное извлечение информации
  4. Стратегии разбиения для RAG
← Назад к Vector Databases: Pinecone, Weaviate & pgvector