Lær AI med Python · Lektion

Tokenisering og normalisering

Teknikker til forbehandling af tekst

Lektion 2 af 510 trin

Tokenisering og normalisering er en gratis Lær AI med Python-lektion på CoddyKit. Dette er lektion 2 af 5. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Lær AI med Python, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Lær AI med Python-kurset indeholder 5 lektioner i alt.

Grundlæggende om tekstforbehandling

Tokenisering og normalisering

Tekstforbehandling er et afgørende trin i NLP. Det indebærer at omdanne rå tekst til et struktureret format til analyse. De vigtigste trin i forbehandlingen omfatter tokenisering og normalisering.

Tokenisering og normalisering — illustration 1

Hvad er tokenisering

Hvad er tokenisering?

Tokenisering er processen, hvor tekst opdeles i mindre enheder, der kaldes tokens. Tokens kan være ord, sætninger eller tegn.

For eksempel:

Tekst: "NLP is amazing!"

Tokens: ["NLP", "is", "amazing", "!"]

Eksempel på tokenisering i Python

Med NLTK-biblioteket kan vi tokenisere tekst til ord eller sætninger:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

Hvad er normalisering

Hvad er normalisering?

Normalisering indebærer at rense og standardisere tekst. Almindelige normaliseringsteknikker omfatter:

  • Konvertering til små bogstaver: Konvertering af al tekst til små bogstaver.
  • Fjernelse af tegnsætning: Fjernelse af tegnsætningstegn.
  • Stemming: Reduktion af ord til deres rodform (f.eks. "løbende" → "løb").
  • Lemmatisering: Reduktion af ord til deres grundform ved hjælp af kontekst (f.eks. "bedre" → "god").

Konvertering til små bogstaver og fjernelse af tegnsætning

Sådan normaliserer du tekst ved at konvertere den til små bogstaver og fjerne tegnsætning:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

Stemming og lemmatisering

Stemming: Reducerer ord til deres rod ved at fjerne endelser. Det er regelbaseret og giver ikke altid gyldige ord.

Lemmatisering: Bruger et ordforråd og grammatiske regler til at reducere ord til deres meningsfulde grundform.

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

Fjernelse af stopord

Stopord er almindelige ord (f.eks. "er", "og", "den"), som ofte ikke har nogen væsentlig betydning. Hvis de fjernes, kan tekstanalysen forenkles:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

Udfordringer ved tekstforbehandling

Tekstforbehandling kan være udfordrende på grund af:

  • Tvetydighed: Ord som "leder" kan have flere betydninger.
  • Kontekst: Lemmatisering kræver forståelse af ordets kontekst.
  • Sproglig variation: Håndtering af forskellige sprog og dialekter.

Opsummering og næste trin

I denne lektion:

  • Lærte vi om tokenisering og normalisering.
  • Udforskede vi teknikker som stamning, lemmatisering og fjernelse af stopord.
  • Øvede vi tekstforbehandling med Python.

Dernæst analyserer vi tekstmønstre ved hjælp af N-grammodeller.

Tokenisering og normalisering — illustration 10
Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
53
Lektioner
225

Ofte stillede spørgsmål

Er lektionen “Tokenisering og normalisering” gratis?

Ja — alle 3 lektioner i læringssporet Lær AI med Python, inklusive “Tokenisering og normalisering”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Lær AI med Python-kurset indeholder 5 lektioner i alt.

Hvad lærer jeg i “Tokenisering og normalisering”?

Teknikker til forbehandling af tekst Du øver dig i Lær AI med Python med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Lær AI med Python?

Der kræves ingen tidligere erfaring. Lær AI med Python på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 2 af 5.

Hvor lang tid tager lektionen “Tokenisering og normalisering”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Lær AI med Python-lektion?

Ja. Alle Lær AI med Python-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Arbejde med tekstdata
  2. Tokenisering og normalisering
  3. N-gram-modeller
  4. Begreber inden for sentimentanalyse
  5. Transformerbaserede modeller
← Tilbage til Lær AI med Python