Leer AI met Python · Les

Tekst opschonen voor AI met regex

HTML-tags, leestekens, URL's en e-mailadressen verwijderen — functies voor tekstpreprocessing bouwen.

Les 4 van 413 stappen

Tekst opschonen voor AI met regex is een gratis Leer AI met Python-les op CoddyKit. Dit is les 4 van 4. Je kunt 3 lessen uit dit leerpad gratis volledig lezen — daarna ontgrendelt CoddyKit PRO alle lessen, plus praktische oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Leer AI met Python. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Leer AI met Python bevat in totaal 4 lessen.

Waarom tekst voor AI opschonen?

Ruwe tekst van het web zit vol ruis: HTML-tags, URL's, e-mailadressen, overbodige witruimte en speciale tekens. Als je die tekst aan een model voert, verspil je capaciteit en gaat de kwaliteit achteruit.

Reguliere expressies zijn het werkpaard van tekstvoorbewerking. We bouwen stap voor stap een opschoningsketen.

Een rommelig voorbeeld

Dit is het soort tekenreeks dat je mogelijk van een website haalt. Elke opschoningsstap richt zich op één soort ruis.

raw = "<p>Contact us at info@shop.com or visit https://shop.com NOW!!!   Thanks</p>"

HTML-tags verwijderen

HTML-tags zien eruit als <tag>. Het patroon <[^>]+> vindt een <, vervolgens willekeurige tekens die geen > zijn, en daarna >.

Vervang ze door een lege tekenreeks. (Gebruik voor complexe HTML bij voorkeur een parser zoals BeautifulSoup, maar voor snel opschonen volstaan reguliere expressies.)

import re

text = re.sub("<[^>]+>", "", raw)
print(text)   # "Contact us at info@shop.com or visit https://shop.com NOW!!!   Thanks"

URL's verwijderen

URL's beginnen met http:// of https://, gevolgd door tekens die geen spatie zijn. Vind ze en verwijder ze.

import re

text = re.sub("https?://\S+", "", text)
print(text)   # URL removed

E-mailadressen verwijderen

Een eenvoudig patroon voor e-mailadressen bestaat uit woordtekens, een @, een domein, een punt en een topleveldomein.

import re

text = re.sub("\S+@\S+\.\S+", "", text)
print(text)   # email removed

Maskeren in plaats van verwijderen

In privacydatasets maskeer je gevoelige gegevens vaak in plaats van ze te verwijderen, zodat de zinsstructuur behouden blijft.

import re

masked = re.sub("\S+@\S+\.\S+", "[EMAIL]", "reach me at a@b.com please")
print(masked)   # "reach me at [EMAIL] please"

Speciale tekens verwijderen

Behoud letters, cijfers en spaties; verwijder leestekens en symbolen met een negatieve tekenverzameling. Bepaal per taak of je bepaalde leestekens wilt behouden.

import re

text = re.sub("[^A-Za-z0-9 ]", "", "Hello!! @world #2026")
print(text)   # "Hello world 2026"

Witruimte normaliseren

Na het opschonen blijven dubbele spaties en losse regeleinden achter. Vervang elke reeks witruimte door één spatie met \s+ en pas daarna strip() toe op de uiteinden.

import re

text = re.sub("\s+", " ", "Hello    world\n\n  again").strip()
print(text)   # "Hello world again"

Kleine letters en het belang van de volgorde

Het gebruik van kleine letters is gebruikelijk voor consistentie, maar pas het zorgvuldig toe. Ook is de volgorde belangrijk: verwijder HTML voordat je speciale tekens verwijdert en normaliseer witruimte als laatste, zodat eerdere verwijderingen geen gaten achterlaten.

text = text.lower()
# Pipeline order: tags -> urls -> emails -> specials -> whitespace -> lowercase

Een opschoningsketen bouwen

Verpak de stappen in één functie, zodat elk document dezelfde behandeling krijgt. Compileer patronen vooraf voor betere snelheid bij het verwerken van veel documenten.

import re

def clean_text(s):
    s = re.sub("<[^>]+>", " ", s)          # html tags
    s = re.sub("https?://\S+", " ", s)     # urls
    s = re.sub("\S+@\S+\.\S+", " ", s)    # emails
    s = re.sub("[^A-Za-z0-9 ]", " ", s)     # special chars
    s = re.sub("\s+", " ", s).strip()       # whitespace
    return s.lower()

print(clean_text(raw))

De opschoningsketen op een DataFrame toepassen

Voer de opschoner uit op een volledige tekstkolom met apply en maak zo een kolom die klaar is voor het model.

import pandas as pd

df["clean"] = df["text"].apply(clean_text)
print(df[["text", "clean"]].head())

Korte controle: witruimte normaliseren

Na het opschonen bevat je tekst reeksen van meerdere spaties en regeleinden die je wilt terugbrengen tot enkele spaties.

Terugblik: tekst opschonen met reguliere expressies

Je hebt een echte voorbewerkingsketen gebouwd:

  • HTML verwijderen met <[^>]+>
  • URL's (https?://\S+) en e-mailadressen verwijderen
  • Gevoelige gegevens maskeren met plaatsaanduidingen zoals [EMAIL]
  • Speciale tekens verwijderen met een negatieve tekenverzameling
  • Witruimte normaliseren met \s+ + strip()
  • Alles in een functie verpakken en met apply op een kolom toepassen

Daarmee is het onderdeel over reguliere expressies voor AI-tekst afgerond. Volgende onderwerp: databases voor AI-projecten.

Gratis beginnen

Leer Python met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
53
Lessen
225

Veelgestelde vragen

Is de les “Tekst opschonen voor AI met regex” gratis?

Ja — je kunt hier op het web alle 3 lessen van het leerpad Leer AI met Python, waaronder “Tekst opschonen voor AI met regex”, gratis volledig lezen. Daarna ontgrendelt CoddyKit PRO alle lessen, plus interactieve oefeningen met een ingebouwde code-editor en een AI-tutor die 24/7 beschikbaar is. De cursus Leer AI met Python bevat in totaal 4 lessen.

Wat leer ik in “Tekst opschonen voor AI met regex”?

HTML-tags, leestekens, URL's en e-mailadressen verwijderen — functies voor tekstpreprocessing bouwen. Je oefent met Leer AI met Python door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met Leer AI met Python te beginnen?

Ervaring vooraf is niet nodig. Leer AI met Python op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 4 van 4.

Hoe lang duurt de les “Tekst opschonen voor AI met regex”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over Leer AI met Python?

Ja. Elke les over Leer AI met Python bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Regex-patronen en tekenklassen
  2. De module re: search, match, findall, sub
  3. Capturing groups en benoemde groepen
  4. Tekst opschonen voor AI met regex
← Terug naar Leer AI met Python