0Pricing
AI Agents · レッスン

ドキュメントローダーとパーサー

200種類以上のソースに対応するLlamaHubローダーと、構造(表、見出し)を保持するパーサーを使います。

「ドキュメントローダーとパーサー」はCoddyKit上の無料AI Agentsレッスンです。 これはレッスン1/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはAI Agents学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 AI Agentsコースには全4レッスンが含まれています。

このレッスンの一部はまだ翻訳されておらず、英語で表示されています。

LlamaIndexとLangChain

LlamaIndex(旧称GPT-Index)は、もう1つの主要なエージェントフレームワークです。RAGとドキュメント中心のエージェントに重点を置いています。

強み: インデックス種別向けのより洗練された抽象化、PDFや構造化ドキュメントの優れた解析、応答合成の豊富なオプションです。

Install

# pip install llama-index
from llama_index.core import VectorStoreIndex, SimpleDirectoryReader

Easiest Path: SimpleDirectoryReader

documents = SimpleDirectoryReader('./docs').load_data()
print(f'{len(documents)} documents')
print(documents[0].text[:200])

LlamaHub

LlamaHubは、200種類を超えるデータローダーを集めたコミュニティレジストリです:

# pip install llama-index-readers-notion
from llama_index.readers.notion import NotionPageReader
reader = NotionPageReader(integration_token='...')
docs = reader.load_data(database_ids=['db-id'])

PDF用のLlamaParse

LlamaParseは最高水準のPDFパーサーです。表、複数段組みのレイアウト、数式に対応しています:

# pip install llama-parse
from llama_parse import LlamaParse
parser = LlamaParse(result_type='markdown', api_key='...')
docs = parser.load_data('handbook.pdf')

テーブルは難しい

標準的なPDFパーサーでは、テーブルを正しく処理できません。LlamaParseはテーブルを適切なMarkdownテーブルとして抽出します。財務文書や科学文書には不可欠です。

Web Loaders

from llama_index.readers.web import SimpleWebPageReader
docs = SimpleWebPageReader().load_data(['https://example.com'])

Database Loaders

from llama_index.readers.database import DatabaseReader
reader = DatabaseReader(sql_database=SQLDatabase(engine))
docs = reader.load_data(query='SELECT * FROM articles')

ドキュメントのメタデータ

すべてのDocumentには、フィルタリングや引用に使用できるメタデータがあります:

doc = documents[0]
print(doc.text)
print(doc.metadata)
# {'file_name': 'handbook.pdf', 'page_label': '1'}

カスタムメタデータの追加

読み込み後にドキュメントを拡張します:

for doc in documents:
    doc.metadata['department'] = 'engineering'
    doc.metadata['last_reviewed'] = '2024-08'

LLMからメタデータを除外する

一部のメタデータはフィルタリング専用で、LLMに見せないものです:

doc.excluded_llm_metadata_keys = ['internal_id', 'file_path']
# LLM still sees the text, but not those keys.

非同期読み込み

多くのローダーは、大規模なバッチ処理向けに非同期処理をサポートしています:

docs = await reader.aload_data(['url1', 'url2', 'url3'])

LlamaParseの強み

LlamaParseは何で知られていますか?

復習

クイックスタートには SimpleDirectoryReader、SaaS ソースには LlamaHub、本格的な PDF には LlamaParse を使います。Document.metadata は強い味方です。

よくある質問

「ドキュメントローダーとパーサー」レッスンは無料ですか?

はい。「ドキュメントローダーとパーサー」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、AI Agentsコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 AI Agentsコースには全4レッスンが含まれています。

「ドキュメントローダーとパーサー」で何を学びますか?

200種類以上のソースに対応するLlamaHubローダーと、構造(表、見出し)を保持するパーサーを使います。 ブラウザで直接実行するハンズオンコードでAI Agentsを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。

AI Agentsを始めるのに経験は必要ですか?

事前経験は必要ありません。CoddyKitのAI Agentsは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン1/4です。

「ドキュメントローダーとパーサー」レッスンにはどのくらい時間がかかりますか?

ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。

このAI Agentsレッスンでコードを書いて実行できますか?

はい。すべてのAI Agentsレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。

このコースのすべてのレッスン

  1. ドキュメントローダーとパーサー
  2. インデックス階層:ベクトル、ツリー、キーワード
  3. クエリエンジンとレスポンス合成
  4. サブクエリ分解戦略
← AI Agentsに戻る