0Pricing
NLP Academy · Leçon

Tokens, spans et objets Doc

Parcourir les structures de données de spaCy

Tokens, spans et objets Doc est une leçon NLP Academy gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage NLP Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours NLP Academy comprend 4 leçons au total.

Trois objets essentiels

spaCy vous fournit trois éléments fondamentaux : le document, le jeton et le segment. Apprenez-les et toute la bibliothèque vous deviendra accessible.

Le conteneur document

Un document est le document entièrement traité. Il contient le texte original, ainsi que chaque jeton et toute l’analyse produite par spaCy.

doc = nlp("Maria leads the data team.")

Indexez comme une liste

Vous pouvez récupérer un élément par sa position, car un document est indexable. L’indexation renvoie un seul jeton, comme dans une liste Python.

first = doc[0]

Ce que contient un jeton

Un jeton est une unité de texte accompagnée de métadonnées riches : sa catégorie grammaticale, son lemme et l’indication qu’il s’agit ou non d’une ponctuation.

print(doc[0].text, doc[0].pos_)

Des indicateurs de jeton utiles

Les jetons possèdent des indicateurs pratiques comme is_stop, is_alpha et is_punct. Ils vous permettent de filtrer les mots sans écrire vos propres vérifications.

for t in doc:
    print(t.text, t.is_stop)

Découpez pour obtenir un segment

Découpez un document et vous obtenez un segment, c’est-à-dire une suite contiguë de jetons. C’est idéal pour des expressions désignant, par exemple, une personne ou un lieu.

phrase = doc[0:2]

Les segments conservent leur contexte

Un segment n’est pas une copie. Il pointe toujours vers le document, connaît donc sa position et partage toute l’analyse originale.

Les entités sont des segments

Les entités nommées apparaissent comme des segments dans doc.ents. Chacune regroupe les mots et une étiquette comme PERSON ou ORG.

for ent in doc.ents:
    print(ent.text, ent.label_)

Groupes nominaux

spaCy propose également noun_chunks, des groupes nominaux de base fournis sous forme de segments. Ils permettent rapidement d’extraire les éléments dont parle une phrase.

list(doc.noun_chunks)

Les phrases sous forme de segments

Vous avez besoin des phrases ? Parcourez doc.sents. Chaque phrase est renvoyée comme un segment : la segmentation est déjà prise en charge.

for sent in doc.sents:
    print(sent.text)

Le texte original est conservé

Tout au long du traitement, la chaîne originale est conservée dans doc.text. Les jetons et les segments sont des vues, jamais des modifications destructrices.

Vérification rapide

Qu’obtenez-vous lorsque vous découpez un document avec doc[0:3] ?

Récapitulatif

Le document contient tout, l’indexation fournit un jeton et le découpage fournit un segment. Les entités, les groupes nominaux et les phrases sont tous renvoyés sous forme de segments. 🧩

Questions Fréquemment Posées

La leçon « Tokens, spans et objets Doc » est-elle gratuite ?

Oui — le texte complet de « Tokens, spans et objets Doc » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours NLP Academy, passe à CoddyKit PRO. Le cours NLP Academy comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Tokens, spans et objets Doc » ?

Parcourir les structures de données de spaCy Tu pratiques NLP Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer NLP Academy ?

Aucune expérience préalable n'est requise. NLP Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.

Combien de temps prend la leçon « Tokens, spans et objets Doc » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon NLP Academy ?

Oui. Chaque leçon NLP Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Pourquoi choisir spaCy pour les projets réels
  2. Charger un modèle et traiter un document
  3. Tokens, spans et objets Doc
  4. Personnaliser le pipeline
← Retour à NLP Academy