Lär Er AI med Python · Lektion

Tokenisering och normalisering

Tekniker för textförbehandling.

Lektion 2 av 510 steg

Tokenisering och normalisering är en gratis lektion i Lär Er AI med Python på CoddyKit. Detta är lektion 2 av 5. Du kan läsa vilka 3 lektioner som helst i den här lärvägen kostnadsfritt i sin helhet – därefter låser CoddyKit PRO upp alla lektioner, plus praktisk övning med en inbyggd kodredigerare och en AI-lärare dygnet runt. Den ingår i lärvägen för Lär Er AI med Python, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i Lär Er AI med Python innehåller totalt 5 lektioner.

Grunderna i textförbehandling

Tokenisering och normalisering

Textförbehandling är ett viktigt steg i NLP. Det innebär att råtext omvandlas till ett strukturerat format för analys. Viktiga steg i förbehandlingen är tokenisering och normalisering.

Tokenisering och normalisering — illustration 1

Vad är tokenisering?

Tokenisering är processen att dela upp text i mindre enheter, så kallade tokens. Tokens kan vara ord, meningar eller tecken.

Till exempel:

Text: "NLP is amazing!"

Tokens: ["NLP", "is", "amazing", "!"]

Exempel på tokenisering i Python

Med hjälp av NLTK-biblioteket kan text tokeniseras till ord eller meningar:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

Vad är normalisering?

Normalisering innebär att text rensas och standardiseras. Vanliga normaliseringstekniker omfattar:

  • Konvertering till gemener: Konvertering av all text till gemener.
  • Borttagning av skiljetecken: Borttagning av skiljetecken.
  • Stemming: Reducering av ord till deras stamform (t.ex. "running" → "run").
  • Lemmatisering: Reducering av ord till deras grundform med hjälp av sammanhanget (t.ex. "better" → "good").

Konvertering till gemener och borttagning av skiljetecken

Så här normaliseras text genom att konvertera den till gemener och ta bort skiljetecken:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

Stemming och lemmatisering

Stemming: Reducerar ord till deras stam genom att ta bort suffix. Metoden är regelbaserad och ger inte alltid giltiga ord.

Lemmatisering: Använder ett ordförråd och grammatiska regler för att reducera ord till deras meningsbärande grundform.

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

Borttagning av stoppord

Stoppord är vanliga ord (t.ex. "är", "och", "den") som ofta inte har någon betydande innebörd. Om de tas bort kan textanalysen förenklas:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

Utmaningar vid textförbehandling

Textförbehandling kan vara utmanande på grund av:

  • Tvetydighet: Ord som "lead" kan ha flera betydelser.
  • Sammanhang: Lemmatisering kräver förståelse av ordets sammanhang.
  • Språkvariation: Hantering av olika språk och dialekter.

Sammanfattning och nästa steg

I den här lektionen:

  • Lärde vi oss om tokenisering och normalisering.
  • Utforskade vi tekniker som stemming, lemmatisering och borttagning av stoppord.
  • Övade vi på textförbehandling med Python.

Härnäst analyserar vi textmönster med hjälp av N-Gram-modeller.

Tokenisering och normalisering — illustration 10
Gratis att börja

Lär dig Python med en AI-lärare – gratis

Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.

Kurser
53
Lektioner
225

Vanliga frågor

Är lektionen ”Tokenisering och normalisering” gratis?

Ja – du kan läsa vilka 3 lektioner som helst i lärvägen Lär Er AI med Python, inklusive ”Tokenisering och normalisering”, kostnadsfritt i sin helhet här på webben. Därefter låser CoddyKit PRO upp alla lektioner, plus interaktiv övning med en inbyggd kodredigerare och en AI-lärare dygnet runt. Kursen i Lär Er AI med Python innehåller totalt 5 lektioner.

Vad lär jag mig i ”Tokenisering och normalisering”?

Tekniker för textförbehandling. Ni övar på Lär Er AI med Python med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.

Behöver jag någon erfarenhet för att börja lära mig Lär Er AI med Python?

Du behöver inga förkunskaper. Utbildningen i Lär Er AI med Python på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 2 av 5.

Hur lång tid tar lektionen ”Tokenisering och normalisering”?

De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.

Kan jag skriva och köra kod i den här Lär Er AI med Python-lektionen?

Ja. Varje Lär Er AI med Python-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.

Alla lektioner i den här kursen

  1. Arbeta med textdata
  2. Tokenisering och normalisering
  3. N-grammodeller
  4. Begrepp inom sentimentanalys
  5. Transformerbaserade modeller
← Tillbaka till Lär Er AI med Python