0Pricing
AI Agents · Урок

Загрузчики и разборщики документов

Используйте загрузчики LlamaHub для более чем 200 типов источников и разборщики, сохраняющие структуру (таблицы, заголовки).

«Загрузчики и разборщики документов» — бесплатный урок AI Agents на CoddyKit. Это урок 1 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.

Части этого урока еще не переведены и отображаются на английском.

LlamaIndex и LangChain

LlamaIndex (ранее GPT-Index) — ещё один крупный фреймворк для агентов. Он ориентирован на RAG и агентов, работающих с документами.

Преимущества: более понятные абстракции для типов индексов, улучшенный разбор PDF и структурированных документов, расширенные возможности синтеза ответов.

Install

# pip install llama-index
from llama_index.core import VectorStoreIndex, SimpleDirectoryReader

Easiest Path: SimpleDirectoryReader

documents = SimpleDirectoryReader('./docs').load_data()
print(f'{len(documents)} documents')
print(documents[0].text[:200])

LlamaHub

LlamaHub — это реестр сообщества, содержащий более 200 загрузчиков данных:

# pip install llama-index-readers-notion
from llama_index.readers.notion import NotionPageReader
reader = NotionPageReader(integration_token='...')
docs = reader.load_data(database_ids=['db-id'])

LlamaParse для PDF

LlamaParse — эталонный анализатор PDF: он обрабатывает таблицы, многоколоночные макеты и математические формулы:

# pip install llama-parse
from llama_parse import LlamaParse
parser = LlamaParse(result_type='markdown', api_key='...')
docs = parser.load_data('handbook.pdf')

Таблицы — это сложно

Стандартные анализаторы PDF плохо обрабатывают таблицы. LlamaParse извлекает их как корректные таблицы Markdown — это критически важно для финансовых и научных документов.

Web Loaders

from llama_index.readers.web import SimpleWebPageReader
docs = SimpleWebPageReader().load_data(['https://example.com'])

Database Loaders

from llama_index.readers.database import DatabaseReader
reader = DatabaseReader(sql_database=SQLDatabase(engine))
docs = reader.load_data(query='SELECT * FROM articles')

Метаданные документов

У каждого объекта Document есть метаданные, которые можно использовать для фильтрации и указания источников:

doc = documents[0]
print(doc.text)
print(doc.metadata)
# {'file_name': 'handbook.pdf', 'page_label': '1'}

Добавление пользовательских метаданных

Дополняйте документы после загрузки:

for doc in documents:
    doc.metadata['department'] = 'engineering'
    doc.metadata['last_reviewed'] = '2024-08'

Исключение метаданных из LLM

Некоторые метаданные предназначены только для фильтрации и не должны быть видны LLM:

doc.excluded_llm_metadata_keys = ['internal_id', 'file_path']
# LLM still sees the text, but not those keys.

Асинхронная загрузка

Многие загрузчики поддерживают асинхронную работу с большими пакетами:

docs = await reader.aload_data(['url1', 'url2', 'url3'])

Преимущество LlamaParse

Чем известен LlamaParse?

Повторение

SimpleDirectoryReader для быстрого старта, LlamaHub для источников SaaS, LlamaParse для сложных PDF-файлов. Document.metadata — Ваш надёжный помощник.

Часто задаваемые вопросы

Урок «Загрузчики и разборщики документов» бесплатный?

Да — полный текст урока «Загрузчики и разборщики документов» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.

Чему я научусь в уроке «Загрузчики и разборщики документов»?

Используйте загрузчики LlamaHub для более чем 200 типов источников и разборщики, сохраняющие структуру (таблицы, заголовки). Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать AI Agents?

Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 4.

Сколько времени занимает урок «Загрузчики и разборщики документов»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке AI Agents?

Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. Загрузчики и разборщики документов
  2. Иерархия индексов: векторный, древовидный, ключевой
  3. Механизмы запросов и синтез ответов
  4. Стратегия декомпозиции на подвопросы
← Назад к AI Agents