Textbereinigung für KI mit Regex
HTML-Tags, Satzzeichen, URLs und E-Mail-Adressen entfernen – Funktionen zur Textvorverarbeitung erstellen.
Textbereinigung für KI mit Regex ist eine kostenlose Learn AI with Python-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Learn AI with Python-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.
Warum Text für KI bereinigen?
Rohtext aus dem Web enthält viel Ballast: HTML-Tags, URLs, E-Mail-Adressen, überflüssige Leerzeichen und Sonderzeichen. Wenn Sie solche Daten einem Modell zuführen, verschwenden Sie Kapazität und beeinträchtigen die Qualität.
Regex ist das wichtigste Werkzeug der Textvorverarbeitung. Wir bauen Schritt für Schritt eine Bereinigungspipeline auf.
Ein unübersichtliches Beispiel
Dies ist die Art von Zeichenkette, die Sie möglicherweise aus dem Web extrahieren. Jeder Bereinigungsschritt zielt auf eine bestimmte Art von Ballast ab.
raw = "<p>Contact us at info@shop.com or visit https://shop.com NOW!!! Thanks</p>"HTML-Tags entfernen
HTML-Tags sehen wie <tag> aus. Das Muster <[^>]+> findet ein <, beliebige Zeichen außer > und anschließend ein >.
Ersetzen Sie sie durch eine leere Zeichenkette. (Bei komplexem HTML sollten Sie einen Parser wie BeautifulSoup bevorzugen, für eine schnelle Bereinigung reicht Regex jedoch aus.)
import re
text = re.sub("<[^>]+>", "", raw)
print(text) # "Contact us at info@shop.com or visit https://shop.com NOW!!! Thanks"URLs entfernen
URLs beginnen mit http:// oder https://, gefolgt von Zeichen, die keine Leerzeichen sind. Finden und entfernen Sie sie.
import re
text = re.sub("https?://\S+", "", text)
print(text) # URL removedE-Mail-Adressen entfernen
Ein einfaches Muster für E-Mail-Adressen besteht aus Wortzeichen, einem @, einer Domain, einem Punkt und einer Top-Level-Domain.
import re
text = re.sub("\S+@\S+\.\S+", "", text)
print(text) # email removedMaskieren statt Entfernen
In Datenschutzdatensätzen maskieren Sie sensible Daten häufig, anstatt sie zu löschen, und erhalten so die Satzstruktur.
import re
masked = re.sub("\S+@\S+\.\S+", "[EMAIL]", "reach me at a@b.com please")
print(masked) # "reach me at [EMAIL] please"Sonderzeichen entfernen
Behalten Sie Buchstaben, Ziffern und Leerzeichen bei und entfernen Sie mit einer negierten Zeichenklasse Satz- und Sonderzeichen. Entscheiden Sie je nach Aufgabe, ob bestimmte Satzzeichen erhalten bleiben sollen.
import re
text = re.sub("[^A-Za-z0-9 ]", "", "Hello!! @world #2026")
print(text) # "Hello world 2026"Leerraum normalisieren
Nach der Bereinigung bleiben doppelte Leerzeichen und vereinzelte Zeilenumbrüche zurück. Fassen Sie jede Folge von Leerraum mit \s+ zu einem einzelnen Leerzeichen zusammen und wenden Sie anschließend strip() auf die Enden an.
import re
text = re.sub("\s+", " ", "Hello world\n\n again").strip()
print(text) # "Hello world again"Kleinschreibung und die richtige Reihenfolge
Die Umwandlung in Kleinschreibung ist für eine einheitliche Verarbeitung üblich, sollte aber sorgfältig angewendet werden. Außerdem ist die Reihenfolge wichtig: Entfernen Sie HTML vor den Sonderzeichen und normalisieren Sie den Leerraum zuletzt, damit frühere Entfernungsschritte keine Lücken hinterlassen.
text = text.lower()
# Pipeline order: tags -> urls -> emails -> specials -> whitespace -> lowercaseEine Bereinigungspipeline erstellen
Fassen Sie die Schritte in einer Funktion zusammen, damit jedes Dokument gleich behandelt wird. Kompilieren Sie Muster bei der Verarbeitung vieler Dokumente vorab, um die Ausführung zu beschleunigen.
import re
def clean_text(s):
s = re.sub("<[^>]+>", " ", s) # html tags
s = re.sub("https?://\S+", " ", s) # urls
s = re.sub("\S+@\S+\.\S+", " ", s) # emails
s = re.sub("[^A-Za-z0-9 ]", " ", s) # special chars
s = re.sub("\s+", " ", s).strip() # whitespace
return s.lower()
print(clean_text(raw))Die Pipeline auf einen DataFrame anwenden
Führen Sie die Bereinigung mit apply auf einer ganzen Textspalte aus und erzeugen Sie so eine für das Modell vorbereitete Spalte.
import pandas as pd
df["clean"] = df["text"].apply(clean_text)
print(df[["text", "clean"]].head())Kurztest: Leerraum normalisieren
Nach der Bereinigung enthält Ihr Text Folgen aus mehreren Leerzeichen und Zeilenumbrüchen, die Sie zu einzelnen Leerzeichen zusammenfassen möchten.
Zusammenfassung: Textbereinigung mit Regex
Sie haben eine echte Vorverarbeitungspipeline erstellt:
- HTML mit
<[^>]+>entfernen - URLs (
https?://\S+) und E-Mail-Adressen entfernen - Sensible Daten mit Platzhaltern wie
[EMAIL]maskieren - Sonderzeichen mit einer negierten Zeichenklasse entfernen
- Leerraum mit
\s+undstrip()normalisieren - Alles in eine Funktion verpacken und mit
applyauf eine Spalte anwenden
Damit ist das Thema Regex für Text-KI abgeschlossen. Als Nächstes geht es um Datenbanken für KI-Projekte.
Lerne Python mit einem KI-Tutor — kostenlos
Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.
- Kurse
- 53
- Lektionen
- 225
Häufig gestellte Fragen
Ist die Lektion „Textbereinigung für KI mit Regex“ kostenlos?
Ja — der vollständige Text von „Textbereinigung für KI mit Regex“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Learn AI with Python-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.
Was lerne ich in „Textbereinigung für KI mit Regex“?
HTML-Tags, Satzzeichen, URLs und E-Mail-Adressen entfernen – Funktionen zur Textvorverarbeitung erstellen. Du übst Learn AI with Python mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.
Brauche ich Erfahrung, um Learn AI with Python zu starten?
Keine Vorkenntnisse erforderlich. Learn AI with Python auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.
Wie lange dauert die Lektion „Textbereinigung für KI mit Regex“?
Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.
Kann ich in dieser Learn AI with Python-Lektion Code schreiben und ausführen?
Ja. Jede Learn AI with Python-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.
Alle Lektionen in diesem Kurs
- Regex-Muster und Zeichenklassen
- Modul re: search, match, findall, sub
- Capturing Groups und Named Groups
- Textbereinigung für KI mit Regex