Tokenisering og normalisering
Teknikker for tekstforbehandling
Tokenisering og normalisering er en gratis leksjon i Python Academy på CoddyKit. Dette er leksjon 2 av 5. Du kan lese hele leksjonen gratis nedenfor – og deretter øve praktisk i nettleseren med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i Python Academy, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i Python Academy inneholder totalt 5 leksjoner.
Grunnleggende tekstforbehandling
Tokenisering og normalisering
Tekstforbehandling er et viktig trinn i NLP. Det innebærer å omforme råtekst til et strukturert format for analyse. Viktige trinn i forbehandlingen er tokenisering og normalisering.

Hva er tokenisering?
Tokenisering er prosessen med å dele opp tekst i mindre enheter som kalles token. Token kan være ord, setninger eller tegn.
For eksempel:
Tekst: "NLP is amazing!"
Token: ["NLP", "is", "amazing", "!"]
Eksempel på tokenisering i Python
Ved hjelp av NLTK-biblioteket kan vi tokenisere tekst til ord eller setninger:
from nltk.tokenize import word_tokenize, sent_tokenize
# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"
# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)
# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)Hva er normalisering?
Normalisering innebærer å rense og standardisere tekst. Vanlige teknikker for normalisering omfatter:
- Konvertering til små bokstaver: Konvertering av all tekst til små bokstaver.
- Fjerning av tegnsetting: Fjerning av tegn for tegnsetting.
- Stemming: Reduksjon av ord til rotformen deres (for eksempel "løping" → "løp").
- Lemmatisering: Reduksjon av ord til grunnformen ved hjelp av kontekst (for eksempel "bedre" → "god").
Konvertering til små bokstaver og fjerning av tegnsetting
Slik normaliserer vi tekst ved å konvertere den til små bokstaver og fjerne tegnsetting:
import string
# Example text
text = "Normalization in NLP is Important!"
# Lowercasing
text = text.lower()
# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)Stemming og lemmatisering
Stemming: Reduserer ord til roten ved å fjerne endelser. Metoden er regelbasert og gir ikke alltid gyldige ord.
Lemmatisering: Bruker et ordforråd og grammatiske regler for å redusere ord til deres meningsfulle grunnform.
from nltk.stem import PorterStemmer, WordNetLemmatizer
# Example text
word = "running"
# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))
# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))Fjerning av stoppord
Stoppord er vanlige ord (for eksempel "er", "og" og "den") som ofte ikke har vesentlig betydning. Fjerning av dem kan forenkle tekstanalyse:
from nltk.corpus import stopwords
# Example text
text = "This is a simple NLP example."
# Tokenize text
words = word_tokenize(text)
# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)Utfordringer ved tekstforbehandling
Tekstforbehandling kan være utfordrende på grunn av:
- Tvetydighet: Ord som "lead" kan ha flere betydninger.
- Kontekst: Lemmatisering krever forståelse av ordets kontekst.
- Språklig variasjon: Håndtering av ulike språk og dialekter.
Oppsummering og neste trinn
I denne leksjonen har vi:
- Lært om tokenisering og normalisering.
- Utforsket teknikker som stemming, lemmatisering og fjerning av stoppord.
- Øvd på tekstforbehandling med Python.
Deretter skal vi analysere tekstmønstre ved hjelp av N-gram-modeller.

Lær deg Python med en AI-veileder – gratis
Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.
- Kurs
- 76
- Leksjoner
- 320
Ofte stilte spørsmål
Er leksjonen «Tokenisering og normalisering» gratis?
Ja – hele teksten i «Tokenisering og normalisering» er gratis å lese her på nettet. For å øve interaktivt med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt, og for å låse opp resten av Python Academy-kurset, kan du oppgradere til CoddyKit PRO. Kurset i Python Academy inneholder totalt 5 leksjoner.
Hva lærer jeg i «Tokenisering og normalisering»?
Teknikker for tekstforbehandling Du øver på Python Academy med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.
Trenger jeg erfaring for å begynne med Python Academy?
Ingen tidligere erfaring er nødvendig. Python Academy på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 2 av 5.
Hvor lang tid tar leksjonen «Tokenisering og normalisering»?
De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.
Kan jeg skrive og kjøre kode i denne Python Academy-leksjonen?
Ja. Alle Python Academy-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.
Alle leksjonene i dette kurset
- Arbeid med tekstdata
- Tokenisering og normalisering
- N-gram-modeller
- Konsepter innen sentimentanalyse
- Transformerbaserte modeller