Learn AI with Python · Lezione

Pulizia del testo per l’IA con le regex

Rimozione di tag HTML, punteggiatura, URL ed email: creazione di funzioni di preprocessing del testo.

Lezione 4 di 413 passaggi

Pulizia del testo per l’IA con le regex è una lezione Learn AI with Python gratuita su CoddyKit. Questa è la lezione 4 di 4. Puoi leggere la lezione completa qui gratuitamente — poi esercitati direttamente nel browser con un editor di codice integrato e un tutor IA disponibile 24/7. Fa parte del percorso di apprendimento Learn AI with Python, e i tuoi progressi si sincronizzano tra il web e l'app CoddyKit. Il corso Learn AI with Python include 4 lezioni in totale.

Perché pulire il testo per l'IA?

Il testo grezzo proveniente dal web è pieno di rumore: tag HTML, URL, indirizzi email, spazi bianchi superflui e caratteri speciali. Inviare tutto questo a un modello spreca capacità e riduce la qualità.

Le espressioni regolari sono lo strumento principale del preprocessing del testo. Costruiremo una pipeline di pulizia passo dopo passo.

Un esempio disordinato

Ecco il tipo di stringa che potrebbe estrarre. Ogni fase di pulizia interviene su un tipo di rumore.

raw = "<p>Contact us at info@shop.com or visit https://shop.com NOW!!!   Thanks</p>"

Rimuovere i tag HTML

I tag HTML hanno un aspetto simile a <tag>. Il pattern <[^>]+> trova un <, qualsiasi carattere diverso da >, quindi >.

Sostituisca i tag con una stringa vuota. (Per HTML complesso, preferisca un parser come BeautifulSoup, ma per una pulizia rapida le espressioni regolari sono sufficienti.)

import re

text = re.sub("<[^>]+>", "", raw)
print(text)   # "Contact us at info@shop.com or visit https://shop.com NOW!!!   Thanks"

Rimuovere gli URL

Gli URL iniziano con http:// o https://, seguiti da caratteri diversi dagli spazi. Li trovi e li rimuova.

import re

text = re.sub("https?://\S+", "", text)
print(text)   # URL removed

Rimuovere gli indirizzi email

Un pattern semplice per gli indirizzi email: caratteri di parola, un @, un dominio, un punto e un dominio di primo livello.

import re

text = re.sub("\S+@\S+\.\S+", "", text)
print(text)   # email removed

Mascherare invece di rimuovere

Nei dataset per la privacy spesso si mascherano i dati sensibili invece di eliminarli, preservando la struttura delle frasi.

import re

masked = re.sub("\S+@\S+\.\S+", "[EMAIL]", "reach me at a@b.com please")
print(masked)   # "reach me at [EMAIL] please"

Rimuovere i caratteri speciali

Mantenga lettere, cifre e spazi; elimini la punteggiatura e i simboli con un set negato. In base all'attività, decida se conservare alcuni segni di punteggiatura.

import re

text = re.sub("[^A-Za-z0-9 ]", "", "Hello!! @world #2026")
print(text)   # "Hello world 2026"

Normalizzare gli spazi bianchi

La pulizia lascia doppi spazi e nuove righe isolate. Riduca qualsiasi sequenza di spazi bianchi a un singolo spazio con \s+, quindi applichi strip() alle estremità.

import re

text = re.sub("\s+", " ", "Hello    world\n\n  again").strip()
print(text)   # "Hello world again"

Conversione in minuscolo e ordine delle operazioni

La conversione in minuscolo è comune per garantire la coerenza, ma va applicata con attenzione. Anche l'ordine delle operazioni è importante: rimuova l'HTML prima dei caratteri speciali e normalizzi gli spazi bianchi per ultimi, così le rimozioni precedenti non lasceranno spazi vuoti.

text = text.lower()
# Pipeline order: tags -> urls -> emails -> specials -> whitespace -> lowercase

Costruire una pipeline di pulizia

Raccolga i passaggi in un'unica funzione, così ogni documento riceverà lo stesso trattamento. Precompili i pattern per velocizzare l'elaborazione di molti documenti.

import re

def clean_text(s):
    s = re.sub("<[^>]+>", " ", s)          # html tags
    s = re.sub("https?://\S+", " ", s)     # urls
    s = re.sub("\S+@\S+\.\S+", " ", s)    # emails
    s = re.sub("[^A-Za-z0-9 ]", " ", s)     # special chars
    s = re.sub("\s+", " ", s).strip()       # whitespace
    return s.lower()

print(clean_text(raw))

Applicare la pipeline a un DataFrame

Esegua la funzione di pulizia su un'intera colonna di testo con apply, creando una colonna pronta per il modello.

import pandas as pd

df["clean"] = df["text"].apply(clean_text)
print(df[["text", "clean"]].head())

Verifica rapida: normalizzazione degli spazi bianchi

Dopo la pulizia, il testo contiene sequenze di più spazi e nuove righe che desidera ridurre a singoli spazi.

Riepilogo: pulizia del testo con le espressioni regolari

Ha creato una vera pipeline di preprocessing:

  • Rimuovere l'HTML con <[^>]+>
  • Rimuovere URL (https?://\S+) e indirizzi email
  • Mascherare i dati sensibili con segnaposto come [EMAIL]
  • Eliminare i caratteri speciali con un set negato
  • Normalizzare gli spazi bianchi con \s+ + strip()
  • Raccogliere tutto in una funzione e applicarla a una colonna con apply

Con questo si conclude l'argomento delle espressioni regolari per l'IA testuale. Prossimo argomento: i database per i progetti di IA.

Gratis per iniziare

Impara Python con un tutor IA — gratis

Scrivi ed esegui vero codice nel tuo browser, ricevi aiuto istantaneo da un tutor IA disponibile 24/7, e riprendi da dove hai lasciato sul web o nell'app.

Corsi
53
Lezioni
225

Domande Frequenti

La lezione «Pulizia del testo per l’IA con le regex» è gratuita?

Sì — il testo completo di «Pulizia del testo per l’IA con le regex» è gratuito qui sul web. Per esercitarvi in modo interattivo (un editor di codice integrato e un tutor IA 24/7) e sbloccare il resto del corso Learn AI with Python, passa a CoddyKit PRO. Il corso Learn AI with Python include 4 lezioni in totale.

Cosa imparerò in «Pulizia del testo per l’IA con le regex»?

Rimozione di tag HTML, punteggiatura, URL ed email: creazione di funzioni di preprocessing del testo. Eserciti Learn AI with Python con codice pratico che esegui direttamente nel browser, e un tutor IA 24/7 risponde alle tue domande mentre lavori sulla lezione.

Ho bisogno di esperienza per iniziare Learn AI with Python?

Non è richiesta alcuna esperienza precedente. Learn AI with Python su CoddyKit è strutturato per principianti e studenti avanzati, quindi puoi iniziare da qui o dall'inizio e procedere al tuo ritmo. Questa è la lezione 4 di 4.

Quanto tempo richiede la lezione «Pulizia del testo per l’IA con le regex»?

La maggior parte delle lezioni CoddyKit richiede circa 5–10 minuti. Ogni lezione è breve e interattiva, quindi fai progressi costanti e riprendi esattamente da dove hai lasciato su web e app.

Posso scrivere ed eseguire codice in questa lezione Learn AI with Python?

Sì. Ogni lezione Learn AI with Python include un editor di codice integrato, quindi scrivi ed esegui codice reale direttamente nel tuo browser e ricevi feedback istantaneo dall'IA — nessuna configurazione locale necessaria.

Tutte le lezioni di questo corso

  1. Pattern regex e classi di caratteri
  2. Modulo re: search, match, findall, sub
  3. Gruppi di cattura e gruppi denominati
  4. Pulizia del testo per l’IA con le regex
← Torna a Learn AI with Python