ドキュメントローダーとパーサー
200種類以上のソースに対応するLlamaHubローダーと、構造(表、見出し)を保持するパーサーを使います。
「ドキュメントローダーとパーサー」はCoddyKit上の無料AI Agentsレッスンです。 これはレッスン1/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはAI Agents学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 AI Agentsコースには全4レッスンが含まれています。
このレッスンの一部はまだ翻訳されておらず、英語で表示されています。
LlamaIndexとLangChain
LlamaIndex(旧称GPT-Index)は、もう1つの主要なエージェントフレームワークです。RAGとドキュメント中心のエージェントに重点を置いています。
強み: インデックス種別向けのより洗練された抽象化、PDFや構造化ドキュメントの優れた解析、応答合成の豊富なオプションです。
Install
# pip install llama-index
from llama_index.core import VectorStoreIndex, SimpleDirectoryReaderEasiest Path: SimpleDirectoryReader
documents = SimpleDirectoryReader('./docs').load_data()
print(f'{len(documents)} documents')
print(documents[0].text[:200])LlamaHub
LlamaHubは、200種類を超えるデータローダーを集めたコミュニティレジストリです:
# pip install llama-index-readers-notion
from llama_index.readers.notion import NotionPageReader
reader = NotionPageReader(integration_token='...')
docs = reader.load_data(database_ids=['db-id'])PDF用のLlamaParse
LlamaParseは最高水準のPDFパーサーです。表、複数段組みのレイアウト、数式に対応しています:
# pip install llama-parse
from llama_parse import LlamaParse
parser = LlamaParse(result_type='markdown', api_key='...')
docs = parser.load_data('handbook.pdf')テーブルは難しい
標準的なPDFパーサーでは、テーブルを正しく処理できません。LlamaParseはテーブルを適切なMarkdownテーブルとして抽出します。財務文書や科学文書には不可欠です。
Web Loaders
from llama_index.readers.web import SimpleWebPageReader
docs = SimpleWebPageReader().load_data(['https://example.com'])Database Loaders
from llama_index.readers.database import DatabaseReader
reader = DatabaseReader(sql_database=SQLDatabase(engine))
docs = reader.load_data(query='SELECT * FROM articles')ドキュメントのメタデータ
すべてのDocumentには、フィルタリングや引用に使用できるメタデータがあります:
doc = documents[0]
print(doc.text)
print(doc.metadata)
# {'file_name': 'handbook.pdf', 'page_label': '1'}カスタムメタデータの追加
読み込み後にドキュメントを拡張します:
for doc in documents:
doc.metadata['department'] = 'engineering'
doc.metadata['last_reviewed'] = '2024-08'LLMからメタデータを除外する
一部のメタデータはフィルタリング専用で、LLMに見せないものです:
doc.excluded_llm_metadata_keys = ['internal_id', 'file_path']
# LLM still sees the text, but not those keys.非同期読み込み
多くのローダーは、大規模なバッチ処理向けに非同期処理をサポートしています:
docs = await reader.aload_data(['url1', 'url2', 'url3'])LlamaParseの強み
LlamaParseは何で知られていますか?
復習
クイックスタートには SimpleDirectoryReader、SaaS ソースには LlamaHub、本格的な PDF には LlamaParse を使います。Document.metadata は強い味方です。
よくある質問
「ドキュメントローダーとパーサー」レッスンは無料ですか?
はい。「ドキュメントローダーとパーサー」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、AI Agentsコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 AI Agentsコースには全4レッスンが含まれています。
「ドキュメントローダーとパーサー」で何を学びますか?
200種類以上のソースに対応するLlamaHubローダーと、構造(表、見出し)を保持するパーサーを使います。 ブラウザで直接実行するハンズオンコードでAI Agentsを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。
AI Agentsを始めるのに経験は必要ですか?
事前経験は必要ありません。CoddyKitのAI Agentsは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン1/4です。
「ドキュメントローダーとパーサー」レッスンにはどのくらい時間がかかりますか?
ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。
このAI Agentsレッスンでコードを書いて実行できますか?
はい。すべてのAI Agentsレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。
このコースのすべてのレッスン
- ドキュメントローダーとパーサー
- インデックス階層:ベクトル、ツリー、キーワード
- クエリエンジンとレスポンス合成
- サブクエリ分解戦略