Tokenisering och normalisering
Tekniker för textförbehandling.
Tokenisering och normalisering är en gratis lektion i Python Academy på CoddyKit. Detta är lektion 2 av 5. Ni kan läsa hela lektionen gratis nedan och sedan öva praktiskt i webbläsaren med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt. Den ingår i lärvägen för Python Academy, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i Python Academy innehåller totalt 5 lektioner.
Grunderna i textförbehandling
Tokenisering och normalisering
Textförbehandling är ett viktigt steg inom NLP. Det innebär att omvandla råtext till ett strukturerat format för analys. Viktiga steg i förbehandlingen är tokenisering och normalisering.

Vad är tokenisering?
Tokenisering är processen att dela upp text i mindre enheter som kallas token. Tokener kan vara ord, meningar eller tecken.
Exempel:
Text: "NLP is amazing!"
Tokener: ["NLP", "is", "amazing", "!"]
Exempel på tokenisering i Python
Med hjälp av biblioteket NLTK kan vi tokenisera text till ord eller meningar:
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)Vad är normalisering?
Normalisering innebär att rensa och standardisera text. Vanliga normaliseringstekniker är:
- Konvertering till gemener: Att konvertera all text till gemener.
- Borttagning av skiljetecken: Att ta bort skiljetecken.
- Stemming: Att reducera ord till deras stamform genom att till exempel ta bort suffix (t.ex. "running" → "run").
- Lemmatisering: Att reducera ord till deras grundform med hjälp av sammanhanget (t.ex. "better" → "good").
Konvertera till gemener och ta bort skiljetecken
Så här normaliserar du text genom att konvertera den till gemener och ta bort skiljetecken:
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)Stemming och lemmatisering
Stemming: Reducerar ord till deras stam genom att ta bort suffix. Metoden är regelbaserad och ger inte alltid giltiga ord.
Lemmatisering: Använder ett ordförråd och grammatiska regler för att reducera ord till deras betydelsefulla grundform.
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))Borttagning av stoppord
Stoppord är vanliga ord (t.ex. "is", "and", "the") som ofta inte har någon betydande innebörd. Att ta bort dem kan förenkla textanalysen:
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)Utmaningar vid textförbehandling
Textförbehandling kan vara utmanande på grund av:
- Tvetydighet: Ord som "lead" kan ha flera betydelser.
- Sammanhang: Lemmatisering kräver att man förstår ordets sammanhang.
- Språklig variation: Att hantera olika språk och dialekter.
Sammanfattning och nästa steg
I den här lektionen har vi:
- Lärt oss om tokenisering och normalisering.
- Utforskat tekniker som stemming, lemmatisering och borttagning av stoppord.
- Övat på textförbehandling med Python.
Härnäst ska vi analysera textmönster med hjälp av N-grammodeller.

Lär dig Python med en AI-lärare – gratis
Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.
- Kurser
- 76
- Lektioner
- 320
Vanliga frågor
Är lektionen ”Tokenisering och normalisering” gratis?
Ja – hela texten till ”Tokenisering och normalisering” kan läsas gratis här på webben. Om Ni vill öva interaktivt med en inbyggd kodredigerare och en AI-handledare som är tillgänglig dygnet runt och låsa upp resten av kursen i Python Academy, kan Ni uppgradera till CoddyKit PRO. Kursen i Python Academy innehåller totalt 5 lektioner.
Vad lär jag mig i ”Tokenisering och normalisering”?
Tekniker för textförbehandling. Ni övar på Python Academy med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.
Behöver jag någon erfarenhet för att börja lära mig Python Academy?
Du behöver inga förkunskaper. Utbildningen i Python Academy på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 2 av 5.
Hur lång tid tar lektionen ”Tokenisering och normalisering”?
De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.
Kan jag skriva och köra kod i den här Python Academy-lektionen?
Ja. Varje Python Academy-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.
Alla lektioner i den här kursen
- Arbeta med textdata
- Tokenisering och normalisering
- N-grammodeller
- Begrepp inom sentimentanalys
- Transformerbaserade modeller