Tokenisation et normalisation
Techniques de prétraitement du texte
Tokenisation et normalisation est une leçon Learn AI with Python gratuite sur CoddyKit. Ceci est la leçon 2 sur 5. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Learn AI with Python, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Learn AI with Python comprend 5 leçons au total.
Notions fondamentales du prétraitement de texte
Tokenisation et normalisation
Le prétraitement de texte est une étape essentielle du TAL. Il consiste à transformer un texte brut en un format structuré pour l’analyse. Les principales étapes de prétraitement comprennent la tokenisation et la normalisation.

Qu'est-ce que la tokenisation ?
Qu'est-ce que la tokenisation ?
La tokenisation consiste à décomposer le texte en unités plus petites appelées jetons. Les jetons peuvent être des mots, des phrases ou des caractères.
Par exemple :
Texte : "NLP is amazing!"
Jetons : ["NLP", "is", "amazing", "!"]
Exemple de tokenisation en Python
Exemple de tokenisation en Python
Avec la bibliothèque NLTK, nous pouvons découper le texte en mots ou en phrases :
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)Qu'est-ce que la normalisation ?
Qu'est-ce que la normalisation ?
La normalisation consiste à nettoyer et à standardiser le texte. Les techniques courantes de normalisation comprennent :
- Passage en minuscules : Conversion de tout le texte en minuscules.
- Suppression de la ponctuation : Élimination des signes de ponctuation.
- Racinisation : Réduction des mots à leur racine (par exemple, « running » → « run »).
- Lemmatisation : Réduction des mots à leur forme de base en fonction du contexte (par exemple, « better » → « good »).
Passage en minuscules et suppression de la ponctuation
Passage en minuscules et suppression de la ponctuation
Voici comment normaliser le texte en le convertissant en minuscules et en supprimant la ponctuation :
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)Racinisation et lemmatisation
Racinisation et lemmatisation
Racinisation : Elle ramène les mots à leur racine en supprimant leurs suffixes. Cette méthode repose sur des règles et ne produit pas toujours des mots valides.
Lemmatisation : Elle utilise un vocabulaire et des règles grammaticales pour ramener les mots à leur forme de base porteuse de sens.
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))Suppression des mots vides
Suppression des mots vides
Les mots vides sont des mots courants (par exemple, « est », « et », « le ») qui ne portent souvent pas de sens important. Les supprimer peut simplifier l'analyse du texte :
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)Défis du prétraitement du texte
Défis du prétraitement du texte
Le prétraitement du texte peut être difficile en raison des éléments suivants :
- Ambiguïté : Des mots comme « avocat » peuvent avoir plusieurs sens.
- Contexte : La lemmatisation nécessite de comprendre le contexte du mot.
- Variations linguistiques : Prise en compte de différentes langues et de différents dialectes.
Résumé et prochaines étapes
Résumé et prochaines étapes
Dans cette leçon, nous avons :
- Découvert la tokenisation et la normalisation.
- Exploré des techniques comme la racinisation, la lemmatisation et la suppression des mots vides.
- Mis en pratique le prétraitement de texte avec Python.
Ensuite, nous analyserons les motifs textuels à l’aide de modèles de N-grammes.

Questions Fréquemment Posées
La leçon « Tokenisation et normalisation » est-elle gratuite ?
Oui — le texte complet de « Tokenisation et normalisation » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Learn AI with Python, passe à CoddyKit PRO. Le cours Learn AI with Python comprend 5 leçons au total.
Qu'est-ce que j'apprendrai dans « Tokenisation et normalisation » ?
Techniques de prétraitement du texte Tu pratiques Learn AI with Python avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer Learn AI with Python ?
Aucune expérience préalable n'est requise. Learn AI with Python sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 2 sur 5.
Combien de temps prend la leçon « Tokenisation et normalisation » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon Learn AI with Python ?
Oui. Chaque leçon Learn AI with Python inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Travailler avec des données textuelles
- Tokenisation et normalisation
- Modèles en N-grammes
- Notions d'analyse des sentiments
- Modèles fondés sur les transformeurs