AI Agents · Leçon

Chargeurs, découpeurs et stockages vectoriels

Utilisez DocumentLoaders pour les PDF et HTML, TextSplitters pour le découpage et VectorStores pour la recherche.

Leçon 2 sur 415 étapes

Chargeurs, découpeurs et stockages vectoriels est une leçon AI Agents gratuite sur CoddyKit. Ceci est la leçon 2 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage AI Agents, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours AI Agents comprend 4 leçons au total.

Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.

Les trois piliers du RAG dans LangChain

  1. Chargeurs de documents — lisent les données brutes dans des Documents
  2. Séparateurs de texte — découpent les Documents en segments
  3. Magasins de vecteurs — vectorisent et indexent les segments

Chargeurs de documents

LangChain propose plus de 100 chargeurs. Exemples :

from langchain_community.document_loaders import PyPDFLoader, WebBaseLoader, TextLoader

pdf_docs = PyPDFLoader('handbook.pdf').load()
web_docs = WebBaseLoader('https://example.com').load()
md_docs = TextLoader('README.md').load()

L’objet Document

Chaque chargeur renvoie une liste de Documents :

doc = pdf_docs[0]
print(doc.page_content)   # the text
print(doc.metadata)       # {'source': 'handbook.pdf', 'page': 1}

Chargeurs courants

  • Chargeur de PDF, chargeur de fichiers non structurés — PDF
  • Chargeur WebBase, chargeur de plans de site — pages web
  • Chargeur Notion, chargeur Google Drive — logiciels en tant que service
  • Chargeur Git — dépôts de code
  • Chargeur de base de données SQL — lignes de base de données

Séparateurs de texte

Convertissez les Documents en segments plus petits :

from langchain.text_splitter import RecursiveCharacterTextSplitter

splitter = RecursiveCharacterTextSplitter(
    chunk_size=800,
    chunk_overlap=100,
    separators=['\n\n', '\n', '. ', ' ']
)
chunks = splitter.split_documents(pdf_docs)

Séparateurs spécialisés

  • Séparateur de texte par en-têtes Markdown — découpe selon les en-têtes
  • Séparateur de texte récursif par caractères — tient compte des paragraphes et des phrases
  • Séparateur de texte par en-têtes HTML — tient compte du HTML
  • Spécifiques au langage (Python, Markdown, LaTeX)

Découpage basé sur les jetons

Utilisez le tokenizer du modèle pour des découpages précis au niveau des jetons :

splitter = RecursiveCharacterTextSplitter.from_tiktoken_encoder(
    encoding_name='cl100k_base',
    chunk_size=400,
    chunk_overlap=50
)

Magasins de vecteurs

Vectorisez et stockez les segments :

from langchain_openai import OpenAIEmbeddings
from langchain_community.vectorstores import Chroma

embeddings = OpenAIEmbeddings(model='text-embedding-3-small')
store = Chroma.from_documents(
    documents=chunks,
    embedding=embeddings,
    persist_directory='./db'
)

Retrieval

retriever = store.as_retriever(search_kwargs={'k': 4})
results = retriever.invoke('What is our return policy?')
for d in results:
    print(d.page_content[:200])

Persistance

Chroma persiste sur le disque si vous lui fournissez persist_directory. Pour recharger :

store = Chroma(persist_directory='./db', embedding_function=embeddings)

Autres magasins de vecteurs

La même interface, avec une infrastructure différente :

from langchain_community.vectorstores import FAISS, Pinecone, Qdrant, Weaviate

store = FAISS.from_documents(chunks, embeddings)
store.save_local('./faiss_db')

MultiVectorRetriever

Indexez de petits segments, mais récupérez leurs documents parents plus volumineux :

from langchain.retrievers import MultiVectorRetriever
# Use the parent-child pattern automatically.

Récupérateurs par auto-requête

Laissez le LLM générer des filtres de métadonnées à partir du langage naturel :

from langchain.retrievers.self_query.base import SelfQueryRetriever
# 'What did Alice say in 2023?' -> filter={author: 'Alice', year: 2023}

Sortie du récupérateur

Que renvoie un récupérateur LangChain ?

Récapitulatif

Chargeurs + séparateurs + magasins de vecteurs = une pile RAG complète. Ensuite : leur composition avec LCEL en une chaîne complète.

Gratuit pour commencer

Apprends AI Agents avec un tuteur IA — gratuit

Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.

Cours
60
Leçons
239

Questions Fréquemment Posées

La leçon « Chargeurs, découpeurs et stockages vectoriels » est-elle gratuite ?

Oui — le texte complet de « Chargeurs, découpeurs et stockages vectoriels » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours AI Agents, passe à CoddyKit PRO. Le cours AI Agents comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Chargeurs, découpeurs et stockages vectoriels » ?

Utilisez DocumentLoaders pour les PDF et HTML, TextSplitters pour le découpage et VectorStores pour la recherche. Tu pratiques AI Agents avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer AI Agents ?

Aucune expérience préalable n'est requise. AI Agents sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 4.

Combien de temps prend la leçon « Chargeurs, découpeurs et stockages vectoriels » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon AI Agents ?

Oui. Chaque leçon AI Agents inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Architecture de LangChain : modèles, prompts et chaînes
  2. Chargeurs, découpeurs et stockages vectoriels
  3. LCEL (langage d’expressions de LangChain)
  4. Construire une chaîne RAG de bout en bout
← Retour à AI Agents