0Pricing
NLP Academy · Leçon

Découper et vectoriser des documents

Préparer une base de connaissances interrogeable

Découper et vectoriser des documents est une leçon NLP Academy gratuite sur CoddyKit. Ceci est la leçon 2 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage NLP Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours NLP Academy comprend 4 leçons au total.

Certaines parties de cette leçon n'ont pas encore été traduites et s'affichent en anglais.

Documents Are Too Big to Search Whole

A long PDF holds many topics at once. To retrieve precisely, you first split it into smaller pieces called chunks.

What Makes a Good Chunk

A good chunk is one coherent thought: a paragraph or two. Too big buries the answer; too small loses the surrounding context.

Splitting by Size

The simplest method cuts text every fixed number of characters or tokens. It is quick but can slice a sentence in half.

chunks = [text[i:i+500] for i in range(0, len(text), 500)]

Overlapping Chunks

To avoid cutting an idea apart, let chunks share an overlap. Repeating the last lines keeps context flowing across boundaries.

Splitting on Structure

Smarter splitters break on paragraphs or headings first. Respecting structure keeps each chunk on a single, clean topic.

From Text to Vectors

Search needs numbers, not words. An embedding turns each chunk into a dense vector that captures its meaning.

Meaning Lives in Distance

Embeddings place similar text close together. Two chunks about the same idea sit near each other in vector space.

Calling an Embedding Model

You pass text to an embedding model and get back a list of floats. The same model must encode both chunks and queries.

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("all-MiniLM-L6-v2")

Encoding Your Chunks

Run every chunk through the model to build its vector. One call can encode the whole list at once for speed.

vectors = model.encode(chunks)

Vector Dimensions

Each vector has a fixed length, its dimension. A small model may give 384 numbers; larger ones give 768 or more.

print(vectors.shape)  # (n_chunks, 384)

Store Chunk and Vector Together

Keep each vector linked to its original text and source. Later you retrieve by vector but show the human-readable chunk.

Quick Check

Consider why we add overlap when splitting documents.

Recap

You split documents into chunks, optionally overlapping, then embed each into a vector. Store text and vector together for retrieval. ✅

Questions Fréquemment Posées

La leçon « Découper et vectoriser des documents » est-elle gratuite ?

Oui — le texte complet de « Découper et vectoriser des documents » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours NLP Academy, passe à CoddyKit PRO. Le cours NLP Academy comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Découper et vectoriser des documents » ?

Préparer une base de connaissances interrogeable Tu pratiques NLP Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer NLP Academy ?

Aucune expérience préalable n'est requise. NLP Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 4.

Combien de temps prend la leçon « Découper et vectoriser des documents » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon NLP Academy ?

Oui. Chaque leçon NLP Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Pourquoi les LLM ont besoin de recherche documentaire
  2. Découper et vectoriser des documents
  3. Recherche vectorielle avec un magasin de vecteurs
  4. Intégrer la recherche au prompt
← Retour à NLP Academy