Загрузчики и разборщики документов
Используйте загрузчики LlamaHub для более чем 200 типов источников и разборщики, сохраняющие структуру (таблицы, заголовки).
«Загрузчики и разборщики документов» — бесплатный урок AI Agents на CoddyKit. Это урок 1 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения AI Agents, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс AI Agents содержит 4 уроков всего.
Части этого урока еще не переведены и отображаются на английском.
LlamaIndex и LangChain
LlamaIndex (ранее GPT-Index) — ещё один крупный фреймворк для агентов. Он ориентирован на RAG и агентов, работающих с документами.
Преимущества: более понятные абстракции для типов индексов, улучшенный разбор PDF и структурированных документов, расширенные возможности синтеза ответов.
Install
# pip install llama-index
from llama_index.core import VectorStoreIndex, SimpleDirectoryReaderEasiest Path: SimpleDirectoryReader
documents = SimpleDirectoryReader('./docs').load_data()
print(f'{len(documents)} documents')
print(documents[0].text[:200])LlamaHub
LlamaHub — это реестр сообщества, содержащий более 200 загрузчиков данных:
# pip install llama-index-readers-notion
from llama_index.readers.notion import NotionPageReader
reader = NotionPageReader(integration_token='...')
docs = reader.load_data(database_ids=['db-id'])LlamaParse для PDF
LlamaParse — эталонный анализатор PDF: он обрабатывает таблицы, многоколоночные макеты и математические формулы:
# pip install llama-parse
from llama_parse import LlamaParse
parser = LlamaParse(result_type='markdown', api_key='...')
docs = parser.load_data('handbook.pdf')Таблицы — это сложно
Стандартные анализаторы PDF плохо обрабатывают таблицы. LlamaParse извлекает их как корректные таблицы Markdown — это критически важно для финансовых и научных документов.
Web Loaders
from llama_index.readers.web import SimpleWebPageReader
docs = SimpleWebPageReader().load_data(['https://example.com'])Database Loaders
from llama_index.readers.database import DatabaseReader
reader = DatabaseReader(sql_database=SQLDatabase(engine))
docs = reader.load_data(query='SELECT * FROM articles')Метаданные документов
У каждого объекта Document есть метаданные, которые можно использовать для фильтрации и указания источников:
doc = documents[0]
print(doc.text)
print(doc.metadata)
# {'file_name': 'handbook.pdf', 'page_label': '1'}Добавление пользовательских метаданных
Дополняйте документы после загрузки:
for doc in documents:
doc.metadata['department'] = 'engineering'
doc.metadata['last_reviewed'] = '2024-08'Исключение метаданных из LLM
Некоторые метаданные предназначены только для фильтрации и не должны быть видны LLM:
doc.excluded_llm_metadata_keys = ['internal_id', 'file_path']
# LLM still sees the text, but not those keys.Асинхронная загрузка
Многие загрузчики поддерживают асинхронную работу с большими пакетами:
docs = await reader.aload_data(['url1', 'url2', 'url3'])Преимущество LlamaParse
Чем известен LlamaParse?
Повторение
SimpleDirectoryReader для быстрого старта, LlamaHub для источников SaaS, LlamaParse для сложных PDF-файлов. Document.metadata — Ваш надёжный помощник.
Часто задаваемые вопросы
Урок «Загрузчики и разборщики документов» бесплатный?
Да — полный текст урока «Загрузчики и разборщики документов» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс AI Agents, подпишись на CoddyKit PRO. Курс AI Agents содержит 4 уроков всего.
Чему я научусь в уроке «Загрузчики и разборщики документов»?
Используйте загрузчики LlamaHub для более чем 200 типов источников и разборщики, сохраняющие структуру (таблицы, заголовки). Ты практикуешь AI Agents с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.
Нужен ли мне опыт, чтобы начать AI Agents?
Предыдущий опыт не требуется. AI Agents на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 1 из 4.
Сколько времени занимает урок «Загрузчики и разборщики документов»?
Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.
Можно ли писать и запускать код в этом уроке AI Agents?
Да. Каждый урок AI Agents включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.
Все уроки этого курса
- Загрузчики и разборщики документов
- Иерархия индексов: векторный, древовидный, ключевой
- Механизмы запросов и синтез ответов
- Стратегия декомпозиции на подвопросы