Learn AI with Python · Lektion

Textbereinigung für KI mit Regex

HTML-Tags, Satzzeichen, URLs und E-Mail-Adressen entfernen – Funktionen zur Textvorverarbeitung erstellen.

Lektion 4 von 413 Schritte

Textbereinigung für KI mit Regex ist eine kostenlose Learn AI with Python-Lektion auf CoddyKit. Dies ist Lektion 4 von 4. Du kannst die komplette Lektion unten kostenlos lesen – dann übst du sie direkt im Browser mit einem integrierten Code-Editor und einem KI-Tutor rund um die Uhr. Sie ist Teil des Learn AI with Python-Lernpfads, und dein Fortschritt wird über Web und CoddyKit-App synchronisiert. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.

Warum Text für KI bereinigen?

Rohtext aus dem Web enthält viel Ballast: HTML-Tags, URLs, E-Mail-Adressen, überflüssige Leerzeichen und Sonderzeichen. Wenn Sie solche Daten einem Modell zuführen, verschwenden Sie Kapazität und beeinträchtigen die Qualität.

Regex ist das wichtigste Werkzeug der Textvorverarbeitung. Wir bauen Schritt für Schritt eine Bereinigungspipeline auf.

Ein unübersichtliches Beispiel

Dies ist die Art von Zeichenkette, die Sie möglicherweise aus dem Web extrahieren. Jeder Bereinigungsschritt zielt auf eine bestimmte Art von Ballast ab.

raw = "<p>Contact us at info@shop.com or visit https://shop.com NOW!!!   Thanks</p>"

HTML-Tags entfernen

HTML-Tags sehen wie <tag> aus. Das Muster <[^>]+> findet ein <, beliebige Zeichen außer > und anschließend ein >.

Ersetzen Sie sie durch eine leere Zeichenkette. (Bei komplexem HTML sollten Sie einen Parser wie BeautifulSoup bevorzugen, für eine schnelle Bereinigung reicht Regex jedoch aus.)

import re

text = re.sub("<[^>]+>", "", raw)
print(text)   # "Contact us at info@shop.com or visit https://shop.com NOW!!!   Thanks"

URLs entfernen

URLs beginnen mit http:// oder https://, gefolgt von Zeichen, die keine Leerzeichen sind. Finden und entfernen Sie sie.

import re

text = re.sub("https?://\S+", "", text)
print(text)   # URL removed

E-Mail-Adressen entfernen

Ein einfaches Muster für E-Mail-Adressen besteht aus Wortzeichen, einem @, einer Domain, einem Punkt und einer Top-Level-Domain.

import re

text = re.sub("\S+@\S+\.\S+", "", text)
print(text)   # email removed

Maskieren statt Entfernen

In Datenschutzdatensätzen maskieren Sie sensible Daten häufig, anstatt sie zu löschen, und erhalten so die Satzstruktur.

import re

masked = re.sub("\S+@\S+\.\S+", "[EMAIL]", "reach me at a@b.com please")
print(masked)   # "reach me at [EMAIL] please"

Sonderzeichen entfernen

Behalten Sie Buchstaben, Ziffern und Leerzeichen bei und entfernen Sie mit einer negierten Zeichenklasse Satz- und Sonderzeichen. Entscheiden Sie je nach Aufgabe, ob bestimmte Satzzeichen erhalten bleiben sollen.

import re

text = re.sub("[^A-Za-z0-9 ]", "", "Hello!! @world #2026")
print(text)   # "Hello world 2026"

Leerraum normalisieren

Nach der Bereinigung bleiben doppelte Leerzeichen und vereinzelte Zeilenumbrüche zurück. Fassen Sie jede Folge von Leerraum mit \s+ zu einem einzelnen Leerzeichen zusammen und wenden Sie anschließend strip() auf die Enden an.

import re

text = re.sub("\s+", " ", "Hello    world\n\n  again").strip()
print(text)   # "Hello world again"

Kleinschreibung und die richtige Reihenfolge

Die Umwandlung in Kleinschreibung ist für eine einheitliche Verarbeitung üblich, sollte aber sorgfältig angewendet werden. Außerdem ist die Reihenfolge wichtig: Entfernen Sie HTML vor den Sonderzeichen und normalisieren Sie den Leerraum zuletzt, damit frühere Entfernungsschritte keine Lücken hinterlassen.

text = text.lower()
# Pipeline order: tags -> urls -> emails -> specials -> whitespace -> lowercase

Eine Bereinigungspipeline erstellen

Fassen Sie die Schritte in einer Funktion zusammen, damit jedes Dokument gleich behandelt wird. Kompilieren Sie Muster bei der Verarbeitung vieler Dokumente vorab, um die Ausführung zu beschleunigen.

import re

def clean_text(s):
    s = re.sub("<[^>]+>", " ", s)          # html tags
    s = re.sub("https?://\S+", " ", s)     # urls
    s = re.sub("\S+@\S+\.\S+", " ", s)    # emails
    s = re.sub("[^A-Za-z0-9 ]", " ", s)     # special chars
    s = re.sub("\s+", " ", s).strip()       # whitespace
    return s.lower()

print(clean_text(raw))

Die Pipeline auf einen DataFrame anwenden

Führen Sie die Bereinigung mit apply auf einer ganzen Textspalte aus und erzeugen Sie so eine für das Modell vorbereitete Spalte.

import pandas as pd

df["clean"] = df["text"].apply(clean_text)
print(df[["text", "clean"]].head())

Kurztest: Leerraum normalisieren

Nach der Bereinigung enthält Ihr Text Folgen aus mehreren Leerzeichen und Zeilenumbrüchen, die Sie zu einzelnen Leerzeichen zusammenfassen möchten.

Zusammenfassung: Textbereinigung mit Regex

Sie haben eine echte Vorverarbeitungspipeline erstellt:

  • HTML mit <[^>]+> entfernen
  • URLs (https?://\S+) und E-Mail-Adressen entfernen
  • Sensible Daten mit Platzhaltern wie [EMAIL] maskieren
  • Sonderzeichen mit einer negierten Zeichenklasse entfernen
  • Leerraum mit \s+ und strip() normalisieren
  • Alles in eine Funktion verpacken und mit apply auf eine Spalte anwenden

Damit ist das Thema Regex für Text-KI abgeschlossen. Als Nächstes geht es um Datenbanken für KI-Projekte.

Kostenlos starten

Lerne Python mit einem KI-Tutor — kostenlos

Schreibe und führe echten Code in deinem Browser aus, bekomme sofortige Hilfe von einem 24/7 KI-Tutor und setze dein Lernen im Web oder in der App fort.

Kurse
53
Lektionen
225

Häufig gestellte Fragen

Ist die Lektion „Textbereinigung für KI mit Regex“ kostenlos?

Ja — der vollständige Text von „Textbereinigung für KI mit Regex“ ist hier im Web kostenlos zu lesen. Um sie interaktiv zu üben (integrierter Code-Editor und 24/7 KI-Tutor) und den Rest des Learn AI with Python-Kurses freizuschalten, upgrade auf CoddyKit PRO. Der Learn AI with Python-Kurs umfasst insgesamt 4 Lektionen.

Was lerne ich in „Textbereinigung für KI mit Regex“?

HTML-Tags, Satzzeichen, URLs und E-Mail-Adressen entfernen – Funktionen zur Textvorverarbeitung erstellen. Du übst Learn AI with Python mit praktischem Code, den du direkt im Browser ausführst, und ein 24/7 KI-Tutor beantwortet deine Fragen während du die Lektion bearbeitest.

Brauche ich Erfahrung, um Learn AI with Python zu starten?

Keine Vorkenntnisse erforderlich. Learn AI with Python auf CoddyKit ist für Anfänger bis fortgeschrittene Lernende strukturiert, sodass du hier starten oder von Anfang an beginnen und in deinem eigenen Tempo voranschreiten kannst. Dies ist Lektion 4 von 4.

Wie lange dauert die Lektion „Textbereinigung für KI mit Regex“?

Die meisten CoddyKit-Lektionen dauern etwa 5–10 Minuten. Jede ist kompakt und interaktiv, sodass du stetig Fortschritte machst und genau dort weitermachst, wo du aufgehört hast – im Web und in der App.

Kann ich in dieser Learn AI with Python-Lektion Code schreiben und ausführen?

Ja. Jede Learn AI with Python-Lektion enthält einen integrierten Code-Editor, sodass du echten Code direkt in deinem Browser schreibst und ausführst und sofort KI-Feedback erhältst — ohne lokale Einrichtung erforderlich.

Alle Lektionen in diesem Kurs

  1. Regex-Muster und Zeichenklassen
  2. Modul re: search, match, findall, sub
  3. Capturing Groups und Named Groups
  4. Textbereinigung für KI mit Regex
← Zurück zu Learn AI with Python