0Pricing
Learn AI with Python · Leçon

Nettoyer le texte pour l’IA avec les expressions régulières

Supprimer les balises HTML, la ponctuation, les URL et les e-mails — construire des fonctions de prétraitement du texte.

Nettoyer le texte pour l’IA avec les expressions régulières est une leçon Learn AI with Python gratuite sur CoddyKit. Ceci est la leçon 4 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage Learn AI with Python, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours Learn AI with Python comprend 4 leçons au total.

Pourquoi nettoyer le texte pour l’IA ?

Le texte brut provenant du Web est rempli de bruit : balises HTML, URL, adresses e-mail, espaces superflus et caractères spéciaux. Fournir tout cela à un modèle gaspille ses capacités et dégrade la qualité.

Les expressions régulières sont l’outil principal du prétraitement du texte. Nous allons construire une chaîne de traitement étape par étape.

Un exemple désordonné

Voici le type de chaîne que vous pourriez extraire. Chaque étape de nettoyage cible un type de bruit.

raw = "<p>Contact us at info@shop.com or visit https://shop.com NOW!!!   Thanks</p>"

Supprimer les balises HTML

Les balises HTML ressemblent à <tag>. Le motif <[^>]+> correspond à un <, à tous les caractères qui ne sont pas >, puis à >.

Remplacez-les par une chaîne vide. (Pour un HTML complexe, préférez un analyseur comme BeautifulSoup, mais les expressions régulières conviennent pour un nettoyage rapide.)

import re

text = re.sub("<[^>]+>", "", raw)
print(text)   # "Contact us at info@shop.com or visit https://shop.com NOW!!!   Thanks"

Supprimer les URL

Les URL commencent par http:// ou https://, suivis de caractères qui ne sont pas des espaces. Faites-les correspondre, puis supprimez-les.

import re

text = re.sub("https?://\S+", "", text)
print(text)   # URL removed

Supprimer les adresses e-mail

Un motif simple pour une adresse e-mail : des caractères de mot, un @, un domaine, un point et un domaine de premier niveau.

import re

text = re.sub("\S+@\S+\.\S+", "", text)
print(text)   # email removed

Masquer plutôt que supprimer

Pour les jeux de données contenant des informations personnelles, vous devez souvent masquer les données sensibles plutôt que les supprimer, afin de préserver la structure des phrases.

import re

masked = re.sub("\S+@\S+\.\S+", "[EMAIL]", "reach me at a@b.com please")
print(masked)   # "reach me at [EMAIL] please"

Supprimer les caractères spéciaux

Conservez les lettres, les chiffres et les espaces ; supprimez la ponctuation et les symboles à l’aide d’un ensemble complémenté. Selon la tâche, décidez s’il faut conserver certains signes de ponctuation.

import re

text = re.sub("[^A-Za-z0-9 ]", "", "Hello!! @world #2026")
print(text)   # "Hello world 2026"

Normaliser les espaces blancs

Le nettoyage laisse des espaces doubles et des sauts de ligne isolés. Réduisez toute suite d’espaces blancs à un seul espace avec \s+, puis appliquez strip() aux extrémités.

import re

text = re.sub("\s+", " ", "Hello    world\n\n  again").strip()
print(text)   # "Hello world again"

Passage en minuscules et importance de l’ordre

Le passage en minuscules est courant pour assurer la cohérence, mais effectuez-le avec précaution. De plus, l’ordre est important : supprimez les balises HTML avant les caractères spéciaux, puis normalisez les espaces blancs en dernier afin que les suppressions précédentes ne laissent pas d’espaces inutiles.

text = text.lower()
# Pipeline order: tags -> urls -> emails -> specials -> whitespace -> lowercase

Construire une chaîne de traitement

Regroupez les étapes dans une seule fonction afin que chaque document reçoive le même traitement. Précompilez les motifs pour accélérer le traitement de nombreux documents.

import re

def clean_text(s):
    s = re.sub("<[^>]+>", " ", s)          # html tags
    s = re.sub("https?://\S+", " ", s)     # urls
    s = re.sub("\S+@\S+\.\S+", " ", s)    # emails
    s = re.sub("[^A-Za-z0-9 ]", " ", s)     # special chars
    s = re.sub("\s+", " ", s).strip()       # whitespace
    return s.lower()

print(clean_text(raw))

Appliquer la chaîne de traitement à un DataFrame

Exécutez le nettoyeur sur toute une colonne de texte avec apply afin de produire une colonne prête pour le modèle.

import pandas as pd

df["clean"] = df["text"].apply(clean_text)
print(df[["text", "clean"]].head())

Vérification rapide : normalisation des espaces blancs

Après le nettoyage, votre texte contient des suites de plusieurs espaces et des sauts de ligne que vous souhaitez réduire à des espaces simples.

Récapitulatif : nettoyage du texte avec les expressions régulières

Vous avez construit une véritable chaîne de traitement du prétraitement :

  • Supprimer les balises HTML avec <[^>]+>
  • Supprimer les URL (https?://\S+) et les adresses e-mail
  • Masquer les données sensibles avec des marqueurs comme [EMAIL]
  • Supprimer les caractères spéciaux avec un ensemble complémenté
  • Normaliser les espaces blancs avec \s+ + strip()
  • Regrouper le tout dans une fonction et l’appliquer à une colonne avec apply

La partie consacrée aux expressions régulières pour le texte destiné à l’IA est terminée. Ensuite : les bases de données pour les projets d’IA.

Questions Fréquemment Posées

La leçon « Nettoyer le texte pour l’IA avec les expressions régulières » est-elle gratuite ?

Oui — le texte complet de « Nettoyer le texte pour l’IA avec les expressions régulières » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours Learn AI with Python, passe à CoddyKit PRO. Le cours Learn AI with Python comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Nettoyer le texte pour l’IA avec les expressions régulières » ?

Supprimer les balises HTML, la ponctuation, les URL et les e-mails — construire des fonctions de prétraitement du texte. Tu pratiques Learn AI with Python avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer Learn AI with Python ?

Aucune expérience préalable n'est requise. Learn AI with Python sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 4.

Combien de temps prend la leçon « Nettoyer le texte pour l’IA avec les expressions régulières » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon Learn AI with Python ?

Oui. Chaque leçon Learn AI with Python inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Motifs d’expressions régulières et classes de caractères
  2. Module re : recherche, correspondance, extraction et remplacement
  3. Groupes capturants et groupes nommés
  4. Nettoyer le texte pour l’IA avec les expressions régulières
← Retour à Learn AI with Python