Nettoyer le texte pour l’IA avec les expressions régulières
Supprimer les balises HTML, la ponctuation, les URL et les e-mails — construire des fonctions de prétraitement du texte.
Nettoyer le texte pour l’IA avec les expressions régulières est une leçon Learn AI with Python gratuite sur CoddyKit. Ceci est la leçon 4 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Learn AI with Python, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Learn AI with Python comprend 4 leçons au total.
Pourquoi nettoyer le texte pour l’IA ?
Le texte brut provenant du Web est rempli de bruit : balises HTML, URL, adresses e-mail, espaces superflus et caractères spéciaux. Fournir tout cela à un modèle gaspille ses capacités et dégrade la qualité.
Les expressions régulières sont l’outil principal du prétraitement du texte. Nous allons construire une chaîne de traitement étape par étape.
Un exemple désordonné
Voici le type de chaîne que vous pourriez extraire. Chaque étape de nettoyage cible un type de bruit.
raw = "<p>Contact us at info@shop.com or visit https://shop.com NOW!!! Thanks</p>"Supprimer les balises HTML
Les balises HTML ressemblent à <tag>. Le motif <[^>]+> correspond à un <, à tous les caractères qui ne sont pas >, puis à >.
Remplacez-les par une chaîne vide. (Pour un HTML complexe, préférez un analyseur comme BeautifulSoup, mais les expressions régulières conviennent pour un nettoyage rapide.)
import re
text = re.sub("<[^>]+>", "", raw)
print(text) # "Contact us at info@shop.com or visit https://shop.com NOW!!! Thanks"Supprimer les URL
Les URL commencent par http:// ou https://, suivis de caractères qui ne sont pas des espaces. Faites-les correspondre, puis supprimez-les.
import re
text = re.sub("https?://\S+", "", text)
print(text) # URL removedSupprimer les adresses e-mail
Un motif simple pour une adresse e-mail : des caractères de mot, un @, un domaine, un point et un domaine de premier niveau.
import re
text = re.sub("\S+@\S+\.\S+", "", text)
print(text) # email removedMasquer plutôt que supprimer
Pour les jeux de données contenant des informations personnelles, vous devez souvent masquer les données sensibles plutôt que les supprimer, afin de préserver la structure des phrases.
import re
masked = re.sub("\S+@\S+\.\S+", "[EMAIL]", "reach me at a@b.com please")
print(masked) # "reach me at [EMAIL] please"Supprimer les caractères spéciaux
Conservez les lettres, les chiffres et les espaces ; supprimez la ponctuation et les symboles à l’aide d’un ensemble complémenté. Selon la tâche, décidez s’il faut conserver certains signes de ponctuation.
import re
text = re.sub("[^A-Za-z0-9 ]", "", "Hello!! @world #2026")
print(text) # "Hello world 2026"Normaliser les espaces blancs
Le nettoyage laisse des espaces doubles et des sauts de ligne isolés. Réduisez toute suite d’espaces blancs à un seul espace avec \s+, puis appliquez strip() aux extrémités.
import re
text = re.sub("\s+", " ", "Hello world\n\n again").strip()
print(text) # "Hello world again"Passage en minuscules et importance de l’ordre
Le passage en minuscules est courant pour assurer la cohérence, mais effectuez-le avec précaution. De plus, l’ordre est important : supprimez les balises HTML avant les caractères spéciaux, puis normalisez les espaces blancs en dernier afin que les suppressions précédentes ne laissent pas d’espaces inutiles.
text = text.lower()
# Pipeline order: tags -> urls -> emails -> specials -> whitespace -> lowercaseConstruire une chaîne de traitement
Regroupez les étapes dans une seule fonction afin que chaque document reçoive le même traitement. Précompilez les motifs pour accélérer le traitement de nombreux documents.
import re
def clean_text(s):
s = re.sub("<[^>]+>", " ", s) # html tags
s = re.sub("https?://\S+", " ", s) # urls
s = re.sub("\S+@\S+\.\S+", " ", s) # emails
s = re.sub("[^A-Za-z0-9 ]", " ", s) # special chars
s = re.sub("\s+", " ", s).strip() # whitespace
return s.lower()
print(clean_text(raw))Appliquer la chaîne de traitement à un DataFrame
Exécutez le nettoyeur sur toute une colonne de texte avec apply afin de produire une colonne prête pour le modèle.
import pandas as pd
df["clean"] = df["text"].apply(clean_text)
print(df[["text", "clean"]].head())Vérification rapide : normalisation des espaces blancs
Après le nettoyage, votre texte contient des suites de plusieurs espaces et des sauts de ligne que vous souhaitez réduire à des espaces simples.
Récapitulatif : nettoyage du texte avec les expressions régulières
Vous avez construit une véritable chaîne de traitement du prétraitement :
- Supprimer les balises HTML avec
<[^>]+> - Supprimer les URL (
https?://\S+) et les adresses e-mail - Masquer les données sensibles avec des marqueurs comme
[EMAIL] - Supprimer les caractères spéciaux avec un ensemble complémenté
- Normaliser les espaces blancs avec
\s++strip() - Regrouper le tout dans une fonction et l’appliquer à une colonne avec
apply
La partie consacrée aux expressions régulières pour le texte destiné à l’IA est terminée. Ensuite : les bases de données pour les projets d’IA.
Questions Fréquemment Posées
La leçon « Nettoyer le texte pour l’IA avec les expressions régulières » est-elle gratuite ?
Oui — le texte complet de « Nettoyer le texte pour l’IA avec les expressions régulières » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Learn AI with Python, passe à CoddyKit PRO. Le cours Learn AI with Python comprend 4 leçons au total.
Qu'est-ce que j'apprendrai dans « Nettoyer le texte pour l’IA avec les expressions régulières » ?
Supprimer les balises HTML, la ponctuation, les URL et les e-mails — construire des fonctions de prétraitement du texte. Tu pratiques Learn AI with Python avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.
Dois-je avoir de l'expérience pour commencer Learn AI with Python ?
Aucune expérience préalable n'est requise. Learn AI with Python sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 4.
Combien de temps prend la leçon « Nettoyer le texte pour l’IA avec les expressions régulières » ?
La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.
Peux-tu écrire et exécuter du code dans cette leçon Learn AI with Python ?
Oui. Chaque leçon Learn AI with Python inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.
Toutes les leçons de ce cours
- Motifs d’expressions régulières et classes de caractères
- Module re : recherche, correspondance, extraction et remplacement
- Groupes capturants et groupes nommés
- Nettoyer le texte pour l’IA avec les expressions régulières