Python Academy · Lektion

Tokenisering och normalisering

Tekniker för textförbehandling.

Lektion 2 av 510 steg

Tokenisering och normalisering är en gratis lektion i Python Academy på CoddyKit. Detta är lektion 2 av 5. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för Python Academy, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i Python Academy innehåller totalt 5 lektioner.

Grunderna i textförbehandling

Tokenisering och normalisering

Textförbehandling är ett viktigt steg inom NLP. Det innebär att omvandla råtext till ett strukturerat format för analys. Viktiga steg i förbehandlingen är tokenisering och normalisering.

Tokenisering och normalisering — illustration 1

Vad är tokenisering?

Tokenisering är processen att dela upp text i mindre enheter som kallas token. Tokener kan vara ord, meningar eller tecken.

Exempel:

Text: "NLP is amazing!"

Tokener: ["NLP", "is", "amazing", "!"]

Exempel på tokenisering i Python

Med hjälp av biblioteket NLTK kan vi tokenisera text till ord eller meningar:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

Vad är normalisering?

Normalisering innebär att rensa och standardisera text. Vanliga normaliseringstekniker är:

  • Konvertering till gemener: Att konvertera all text till gemener.
  • Borttagning av skiljetecken: Att ta bort skiljetecken.
  • Stemming: Att reducera ord till deras stamform genom att till exempel ta bort suffix (t.ex. "running" → "run").
  • Lemmatisering: Att reducera ord till deras grundform med hjälp av sammanhanget (t.ex. "better" → "good").

Konvertera till gemener och ta bort skiljetecken

Så här normaliserar du text genom att konvertera den till gemener och ta bort skiljetecken:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

Stemming och lemmatisering

Stemming: Reducerar ord till deras stam genom att ta bort suffix. Metoden är regelbaserad och ger inte alltid giltiga ord.

Lemmatisering: Använder ett ordförråd och grammatiska regler för att reducera ord till deras betydelsefulla grundform.

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

Borttagning av stoppord

Stoppord är vanliga ord (t.ex. "is", "and", "the") som ofta inte har någon betydande innebörd. Att ta bort dem kan förenkla textanalysen:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

Utmaningar vid textförbehandling

Textförbehandling kan vara utmanande på grund av:

  • Tvetydighet: Ord som "lead" kan ha flera betydelser.
  • Sammanhang: Lemmatisering kräver att man förstår ordets sammanhang.
  • Språklig variation: Att hantera olika språk och dialekter.

Sammanfattning och nästa steg

I den här lektionen har vi:

  • Lärt oss om tokenisering och normalisering.
  • Utforskat tekniker som stemming, lemmatisering och borttagning av stoppord.
  • Övat på textförbehandling med Python.

Härnäst ska vi analysera textmönster med hjälp av N-grammodeller.

Tokenisering och normalisering — illustration 10
Gratis att börja

Lär dig Python med en AI-lärare – gratis

Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.

Kurser
76
Lektioner
320

Vanliga frågor

Är lektionen ”Tokenisering och normalisering” gratis?

Ja – hela texten till ”Tokenisering och normalisering” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i Python Academy, kan Ni uppgradera till CoddyKit PRO. Kursen i Python Academy innehåller totalt 5 lektioner.

Vad lär jag mig i ”Tokenisering och normalisering”?

Tekniker för textförbehandling. Ni övar på Python Academy med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.

Behöver jag någon erfarenhet för att börja lära mig Python Academy?

Du behöver inga förkunskaper. Utbildningen i Python Academy på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 2 av 5.

Hur lång tid tar lektionen ”Tokenisering och normalisering”?

De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.

Kan jag skriva och köra kod i den här Python Academy-lektionen?

Ja. Varje Python Academy-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.

Alla lektioner i den här kursen

  1. Arbeta med textdata
  2. Tokenisering och normalisering
  3. N-grammodeller
  4. Begrepp inom sentimentanalys
  5. Transformerbaserade modeller
← Tillbaka till Python Academy