0Pricing
LangChain / RAG / Vector DBs · Урок

Работа с метаданными документов и фильтрация

Научитесь добавлять, обогащать и фильтровать метаданные документов, чтобы конвейер RAG ограничивал поиск подходящими источниками.

«Работа с метаданными документов и фильтрация» — бесплатный урок LangChain / RAG / Vector DBs на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения LangChain / RAG / Vector DBs, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс LangChain / RAG / Vector DBs содержит 4 уроков всего.

Части этого урока еще не переведены и отображаются на английском.

Why Metadata Matters

Every document chunk in LangChain carries a page_content string and a metadata dictionary. While the content feeds the embedding model, metadata drives filtering, attribution, and traceability.

  • Source file or URL
  • Page number or section
  • Author, date, language

The Document Object

A LangChain Document is a lightweight container. You can construct one directly and pass any JSON-serializable values in metadata.

from langchain_core.documents import Document

doc = Document(
    page_content="Annual revenue grew 12%.",
    metadata={"source": "report.pdf", "page": 4, "year": 2025}
)
print(doc.metadata["source"])

Automatic Metadata from Loaders

Most loaders inject metadata for free. A PyPDFLoader adds source and page, while a WebBaseLoader adds the URL and page title.

from langchain_community.document_loaders import PyPDFLoader

loader = PyPDFLoader("handbook.pdf")
pages = loader.load()
print(pages[0].metadata)
# {"source": "handbook.pdf", "page": 0}

Enriching Metadata After Load

You often need to add fields the loader does not know about, like a category or tenant id. Iterate and mutate the dictionary.

for d in pages:
    d.metadata["department"] = "finance"
    d.metadata["sensitive"] = False
print(pages[0].metadata["department"])

Metadata Survives Splitting

When you split documents, the splitter copies the parent metadata onto each child chunk. This means filters set before splitting still apply afterward.

from langchain_text_splitters import RecursiveCharacterTextSplitter

splitter = RecursiveCharacterTextSplitter(chunk_size=200)
chunks = splitter.split_documents(pages)
print(chunks[0].metadata["source"])

Filtering at Retrieval Time

Vector stores accept a filter argument so you only search the relevant slice. This is faster and reduces irrelevant matches.

results = vectorstore.similarity_search(
    "vacation policy",
    k=3,
    filter={"department": "hr"}
)

Self-Query Retrieval

A SelfQueryRetriever lets the LLM translate a natural-language query into both a semantic search and a metadata filter automatically.

You describe the metadata schema once, and the model decides when to filter.

Cleaning Noisy Metadata

Loaders sometimes produce verbose or nested metadata that vector stores reject. Flatten or whitelist the keys you need.

def clean(d):
    keep = {"source", "page", "department"}
    d.metadata = {k: v for k, v in d.metadata.items() if k in keep}
    return d

cleaned = [clean(d) for d in chunks]

Metadata for Citations

Storing the source and page lets you cite where an answer came from. After retrieval, format the metadata into a human-readable reference.

for r in results:
    src = r.metadata["source"]
    pg = r.metadata.get("page", "?")
    print(f"[{src} p.{pg}]")

Type Constraints

Many vector databases only allow scalar metadata values: strings, numbers, and booleans. Lists or dicts must be serialized to JSON strings or removed.

  • Good: {"page": 4}
  • Reject: {"tags": ["a","b"]}

A Practical Filter Pipeline

Combine enrichment, cleaning, and filtered search into one flow so every query is scoped to the correct subset of your corpus.

docs = PyPDFLoader("policy.pdf").load()
for d in docs:
    d.metadata["region"] = "EU"
chunks = splitter.split_documents(docs)
# index chunks, then:
vectorstore.similarity_search("data retention", filter={"region": "EU"})

Quick Check

Test your understanding of metadata handling.

Recap

You learned to work with document metadata:

  • Loaders auto-add fields like source and page
  • Enrich and clean metadata for filtering and citations
  • Metadata propagates through splitting
  • Use filter or a self-query retriever to scope searches

Часто задаваемые вопросы

Урок «Работа с метаданными документов и фильтрация» бесплатный?

Да — полный текст урока «Работа с метаданными документов и фильтрация» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс LangChain / RAG / Vector DBs, подпишись на CoddyKit PRO. Курс LangChain / RAG / Vector DBs содержит 4 уроков всего.

Чему я научусь в уроке «Работа с метаданными документов и фильтрация»?

Научитесь добавлять, обогащать и фильтровать метаданные документов, чтобы конвейер RAG ограничивал поиск подходящими источниками. Ты практикуешь LangChain / RAG / Vector DBs с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать LangChain / RAG / Vector DBs?

Предыдущий опыт не требуется. LangChain / RAG / Vector DBs на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.

Сколько времени занимает урок «Работа с метаданными документов и фильтрация»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке LangChain / RAG / Vector DBs?

Да. Каждый урок LangChain / RAG / Vector DBs включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Загрузка различных типов документов
  2. Стратегии разбиения текста
  3. Настройка разбиения документов
  4. Работа с метаданными документов и фильтрация
← Назад к LangChain / RAG / Vector DBs