Lær AI med Python · leksjon

Tokenisering og normalisering

Teknikker for tekstforbehandling.

Leksjon 2 av 510 trinn

Tokenisering og normalisering er en gratis leksjon i Lær AI med Python på CoddyKit. Dette er leksjon 2 av 5. Du kan lese valgfritt 3 leksjoner fra denne læringsstien gratis i sin helhet – deretter låser CoddyKit PRO opp alle leksjoner, samt praktisk øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i Lær AI med Python, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i Lær AI med Python inneholder totalt 5 leksjoner.

Grunnleggende om tekstforbehandling

Tokenisering og normalisering

Tekstforbehandling er et viktig trinn i NLP. Det innebærer å omforme råtekst til et strukturert format for analyse. Viktige trinn i forbehandlingen er tokenisering og normalisering.

Tokenisering og normalisering — illustrasjon 1

Hva er tokenisering?

Tokenisering er prosessen med å dele opp tekst i mindre enheter, kalt tokener. Tokenene kan være ord, setninger eller tegn.

For eksempel:

Tekst: "NLP is amazing!"

Tokener: ["NLP", "is", "amazing", "!"]

Tokeniseringseksempel i Python

Ved hjelp av NLTK-biblioteket kan vi tokenisere tekst til ord eller setninger:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

Hva er normalisering?

Normalisering innebærer å rense og standardisere tekst. Vanlige normaliseringsteknikker omfatter:

  • Konvertering til små bokstaver: Konvertering av all tekst til små bokstaver.
  • Fjerning av tegnsetting: Fjerning av skilletegn.
  • Stemming: Reduksjon av ord til rotformen deres ved å fjerne endelser (for eksempel "running" → "run").
  • Lemmatisering: Reduksjon av ord til grunnformen ved hjelp av kontekst (for eksempel "better" → "good").

Konvertering til små bokstaver og fjerning av tegnsetting

Slik normaliserer vi tekst ved å konvertere den til små bokstaver og fjerne tegnsetting:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

Stemming og lemmatisering

Stemming: Reduserer ord til roten ved å kutte bort endelser. Metoden er regelbasert og gir ikke alltid gyldige ord.

Lemmatisering: Bruker et vokabular og grammatiske regler til å redusere ord til deres meningsfulle grunnform.

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

Fjerning av stoppord

Stoppord er vanlige ord (for eksempel "is", "and" og "the") som ofte ikke har noen vesentlig betydning. Ved å fjerne dem kan tekstanalysen forenkles:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

Utfordringer ved tekstforbehandling

Tekstforbehandling kan være utfordrende på grunn av:

  • Tvetydighet: Ord som "lead" kan ha flere betydninger.
  • Kontekst: Lemmatisering krever forståelse av ordets kontekst.
  • Språkvariasjon: Håndtering av ulike språk og dialekter.

Sammendrag og neste trinn

I denne leksjonen:

  • Lærte vi om tokenisering og normalisering.
  • Utforsket vi teknikker som stemming, lemmatisering og fjerning av stoppord.
  • Øvde vi på tekstforbehandling med Python.

Deretter skal vi analysere tekstmønstre ved hjelp av N-grammodeller.

Tokenisering og normalisering — illustrasjon 10
Gratis å komme i gang

Lær deg Python med en AI-veileder – gratis

Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.

Kurs
53
Leksjoner
225

Ofte stilte spørsmål

Er leksjonen «Tokenisering og normalisering» gratis?

Ja – du kan lese valgfritt 3 av leksjonene i læringsstien Lær AI med Python, inkludert «Tokenisering og normalisering», gratis i sin helhet her på nettet. Deretter låser CoddyKit PRO opp alle leksjoner, samt interaktiv øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Kurset i Lær AI med Python inneholder totalt 5 leksjoner.

Hva lærer jeg i «Tokenisering og normalisering»?

Teknikker for tekstforbehandling. Du øver på Lær AI med Python med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.

Trenger jeg erfaring for å begynne med Lær AI med Python?

Ingen tidligere erfaring er nødvendig. Lær AI med Python på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 2 av 5.

Hvor lang tid tar leksjonen «Tokenisering og normalisering»?

De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.

Kan jeg skrive og kjøre kode i denne Lær AI med Python-leksjonen?

Ja. Alle Lær AI med Python-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.

Alle leksjonene i dette kurset

  1. Arbeid med tekstdata
  2. Tokenisering og normalisering
  3. N-gram-modeller
  4. Konsepter innen sentimentanalyse
  5. Modeller basert på transformere
← Tilbake til Lær AI med Python