Chargeurs et analyseurs de documents
Utilisez les chargeurs LlamaHub pour plus de 200 types de sources et des analyseurs qui préservent la structure (tableaux, titres).
Chargeurs et analyseurs de documents est une leçon AI Agents gratuite sur CoddyKit. Ceci est la leçon 1 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Agents, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Agents comprend 4 leçons au total.
Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.
LlamaIndex et LangChain
LlamaIndex (anciennement GPT-Index) est l’autre grand cadre pour les agents. Il se concentre sur le RAG et les agents centrés sur les documents.
Points forts : abstractions plus claires pour les types d’index, meilleure analyse des PDF et des documents structurés, et davantage d’options pour la synthèse des réponses.
Install
# pip install llama-index
from llama_index.core import VectorStoreIndex, SimpleDirectoryReaderEasiest Path: SimpleDirectoryReader
documents = SimpleDirectoryReader('./docs').load_data()
print(f'{len(documents)} documents')
print(documents[0].text[:200])LlamaHub
LlamaHub est un registre communautaire de plus de 200 chargeurs de données :
# pip install llama-index-readers-notion
from llama_index.readers.notion import NotionPageReader
reader = NotionPageReader(integration_token='...')
docs = reader.load_data(database_ids=['db-id'])LlamaParse pour les PDF
LlamaParse est l’analyseur de PDF de référence : il gère les tableaux, les mises en page à plusieurs colonnes et les mathématiques :
# pip install llama-parse
from llama_parse import LlamaParse
parser = LlamaParse(result_type='markdown', api_key='...')
docs = parser.load_data('handbook.pdf')Les tableaux sont difficiles
Les analyseurs PDF standard massacrent les tableaux. LlamaParse les extrait sous forme de véritables tableaux Markdown — ce qui est essentiel pour les documents financiers et scientifiques.
Web Loaders
from llama_index.readers.web import SimpleWebPageReader
docs = SimpleWebPageReader().load_data(['https://example.com'])Database Loaders
from llama_index.readers.database import DatabaseReader
reader = DatabaseReader(sql_database=SQLDatabase(engine))
docs = reader.load_data(query='SELECT * FROM articles')Métadonnées des documents
Chaque Document possède des métadonnées que vous pouvez utiliser pour le filtrage et les citations :
doc = documents[0]
print(doc.text)
print(doc.metadata)
# {'file_name': 'handbook.pdf', 'page_label': '1'}Ajouter des métadonnées personnalisées
Enrichissez les documents après leur chargement :
for doc in documents:
doc.metadata['department'] = 'engineering'
doc.metadata['last_reviewed'] = '2024-08'Exclure les métadonnées du LLM
Certaines métadonnées servent uniquement au filtrage et ne doivent pas être visibles par le LLM :
doc.excluded_llm_metadata_keys = ['internal_id', 'file_path']
# LLM still sees the text, but not those keys.Chargement asynchrone
De nombreux chargeurs prennent en charge l’asynchrone pour les gros lots :
docs = await reader.aload_data(['url1', 'url2', 'url3'])Point fort de LlamaParse
Pour quelle fonctionnalité LlamaParse est-il connu ?
Récapitulatif
SimpleDirectoryReader pour démarrer rapidement, LlamaHub pour les sources SaaS et LlamaParse pour les PDF complexes. Document.metadata est votre allié.
Questions Fréquemment Posées
La leçon « Chargeurs et analyseurs de documents » est-elle gratuite ?
Oui — le texte complet de « Chargeurs et analyseurs de documents » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Agents, passe à CoddyKit PRO. Le cours AI Agents comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Chargeurs et analyseurs de documents » ?
Utilisez les chargeurs LlamaHub pour plus de 200 types de sources et des analyseurs qui préservent la structure (tableaux, titres). Tu pratiques AI Agents avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer AI Agents ?
Aucune expérience préalable n'est requise. AI Agents sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 1 sur 4.
Combien de temps prend la leçon « Chargeurs et analyseurs de documents » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon AI Agents ?
Oui. Chaque leçon AI Agents inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Chargeurs et analyseurs de documents
- Hiérarchie des index : vectoriel, arborescent, par mots-clés
- Moteurs de requêtes et synthèse des réponses
- Stratégie de décomposition en sous-questions