0Pricing
NLP Academy · Leçon

Astuces de tokenisation avec les expressions régulières

Découper le texte exactement comme vous le souhaitez

Astuces de tokenisation avec les expressions régulières est une leçon NLP Academy gratuite sur CoddyKit. Ceci est la leçon 4 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage NLP Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours NLP Academy comprend 4 leçons au total.

Créer des tokens avec des motifs

Vous pouvez créer des tokens en décrivant l’apparence d’un token, puis en laissant une expression régulière trouver chaque élément correspondant à votre définition.

Reconnaître directement les mots

Le motif \w+ avec findall récupère chaque suite de caractères alphanumériques, ce qui vous donne une liste propre de mots en ignorant les espaces qui les séparent.

re.findall("\w+", "Hello, world!")

Diviser plutôt que faire correspondre

La fonction re.split découpe le texte partout où un motif apparaît. Diviser sur les espaces transforme rapidement une phrase en une liste de jetons approximatifs.

re.split("\s+", "one  two three")

Diviser avec plusieurs séparateurs

Avec une classe de caractères, re.split peut diviser sur plusieurs séparateurs à la fois, comme les espaces, les virgules et les points-virgules, en un seul passage.

re.split("[ ,;]+", "a, b;c d")

Conserver la ponctuation comme jetons

Parfois, la ponctuation est importante. Un motif comme \w+|[^\w\s] capture séparément les mots et les symboles isolés, afin que rien ne soit supprimé silencieusement.

L’opérateur d’alternance

La barre verticale signifie « ou ». Le motif cat|dog correspond à l’un ou l’autre mot, ce qui permet à une expression régulière de décrire plusieurs formes de jetons recherchées.

re.findall("cat|dog", "a dog, a cat")

Reconnaître les nombres et les décimales

Les nombres nécessitent leur propre règle. Le motif \d+\.?\d* reconnaît les nombres entiers et décimaux, afin que les prix et les montants restent regroupés en un seul jeton.

re.findall("\d+\.?\d*", "buy 3 for 4.50")

Gérer les contractions

Une division naïve abîme les mots comme do not sous leur forme abrégée. Un motif de jeton plus élaboré peut conserver les apostrophes à l’intérieur d’un mot lorsqu’elles y ont leur place.

Les limites de mots sont utiles

L’ancre \b marque une limite de mot, c’est-à-dire la frontière entre un mot et un élément qui n’en fait pas partie. Elle vous aide à récupérer des mots entiers sans récupérer leurs voisins.

Construire un motif de jetons

Un analyseur lexical pratique combine souvent des règles avec l’alternance : reconnaître d’abord les URL, puis les nombres, les mots et enfin les symboles, dans cet ordre de priorité.

Compiler pour gagner en vitesse

Si vous réutilisez souvent un motif, re.compile le transforme en objet réutilisable. Le code est plus lisible et s’exécute plus rapidement sur de nombreuses chaînes.

tok = re.compile("\w+")

Vérification rapide

Vous voulez découper une chaîne partout où apparaissent un ou plusieurs espaces. Quelle fonction convient le mieux ?

Récapitulatif : les analyseurs lexicaux par expressions régulières

Vous avez utilisé findall, split, alternation, and compile pour transformer du texte brut en exactement les jetons souhaités. Les expressions régulières vous offrent un contrôle total. 🎯

Questions Fréquemment Posées

La leçon « Astuces de tokenisation avec les expressions régulières » est-elle gratuite ?

Oui — le texte complet de « Astuces de tokenisation avec les expressions régulières » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours NLP Academy, passe à CoddyKit PRO. Le cours NLP Academy comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Astuces de tokenisation avec les expressions régulières » ?

Découper le texte exactement comme vous le souhaitez Tu pratiques NLP Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer NLP Academy ?

Aucune expérience préalable n'est requise. NLP Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 4 sur 4.

Combien de temps prend la leçon « Astuces de tokenisation avec les expressions régulières » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon NLP Academy ?

Oui. Chaque leçon NLP Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Les expressions régulières en 5 minutes
  2. Trouver des adresses e-mail et des URL
  3. Groupes de capture et remplacements
  4. Astuces de tokenisation avec les expressions régulières
← Retour à NLP Academy