Python Academy · Oppitunti

Tokenisointi ja normalisointi

Tekstin esikäsittelymenetelmät

Oppitunti 2/510 vaihetta

Tokenisointi ja normalisointi on ilmainen Python Academy-oppitunti CoddyKitissä. Tämä on oppitunti 2/5. Voit lukea koko oppitunnin alta ilmaiseksi ja harjoitella sen jälkeen käytännössä selaimessa sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla. Oppitunti kuuluu Python Academy-oppimispolkuun, ja edistymisesi synkronoituu verkon ja CoddyKit-sovelluksen välillä. Python Academy-kurssilla on yhteensä 5 oppituntia.

Tekstin esikäsittelyn perusteet

Tokenisointi ja normalisointi

Tekstin esikäsittely on NLP:n keskeinen vaihe. Siinä raakateksti muunnetaan jäsenneltyyn muotoon analyysia varten. Keskeisiä esikäsittelyvaiheita ovat tokenisointi ja normalisointi.

Tokenisointi ja normalisointi — kuvitus 1

Mitä tokenisointi on?

Tokenisointi tarkoittaa tekstin pilkkomista pienempiin yksiköihin, joita kutsutaan tokeneiksi. Tokenit voivat olla sanoja, lauseita tai merkkejä.

Esimerkiksi:

Teksti: "NLP is amazing!"

Tokenit: ["NLP", "is", "amazing", "!"]

Tokenisointiesimerkki Pythonilla

NLTK-kirjaston avulla voimme tokenisoida tekstin sanoiksi tai lauseiksi:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

Mitä normalisointi on?

Normalisointiin kuuluu tekstin puhdistaminen ja standardointi. Yleisiä normalisointitekniikoita ovat:

  • Pieniksi kirjaimiksi muuttaminen: koko tekstin muuttaminen pienaakkosiksi.
  • Välimerkkien poistaminen: välimerkkien poistaminen.
  • Stemming: sanojen lyhentäminen juurimuotoon (esim. "running" → "run").
  • Lemmatisointi: sanojen palauttaminen perusmuotoon asiayhteyden avulla (esim. "better" → "good").

Pieniksi kirjaimiksi muuttaminen ja välimerkkien poistaminen

Näin normalisoit tekstin muuttamalla sen pieniksi kirjaimiksi ja poistamalla välimerkit:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

Stemming ja lemmatisointi

Stemming: lyhentää sanat juurimuotoon katkaisemalla päätteet. Se perustuu sääntöihin, eikä tuloksena aina ole kelvollisia sanoja.

Lemmatisointi: käyttää sanastoa ja kielioppisääntöjä sanojen palauttamiseen niiden merkitykselliseen perusmuotoon.

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

Stop-sanojen poistaminen

Stop-sanat ovat yleisiä sanoja (esim. "is", "and" ja "the"), joilla ei usein ole merkittävää merkityssisältöä. Niiden poistaminen voi yksinkertaistaa tekstianalyysiä:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

Tekstin esikäsittelyn haasteet

Tekstin esikäsittely voi olla haastavaa seuraavista syistä:

  • Monimerkityksisyys: esimerkiksi sanalla "lead" voi olla useita merkityksiä.
  • Asiayhteys: lemmatisointi edellyttää sanan asiayhteyden ymmärtämistä.
  • Kielimuotojen vaihtelu: eri kielten ja murteiden käsitteleminen.

Yhteenveto ja seuraavat vaiheet

Tässä oppitunnissa:

  • Opimme tokenisoinnista ja normalisoinnista.
  • Tutustuimme tekniikoihin, kuten stemmingiin, lemmatisointiin ja stop-sanojen poistamiseen.
  • Harjoittelimme tekstin esikäsittelyä Pythonilla.

Seuraavaksi analysoimme tekstin kuvioita N-grammimalleilla.

Tokenisointi ja normalisointi — kuvitus 10
Aloita maksutta

Opi Python tekoälytuutorin avulla — ilmaiseksi

Kirjoita ja suorita oikeaa koodia selaimessa, saa välitöntä apua tekoälytuutorilta ympäri vuorokauden ja jatka siitä, mihin jäit, verkossa tai sovelluksessa.

Kurssit
76
Oppitunnit
320

Usein kysytyt kysymykset

Onko oppitunti ”Tokenisointi ja normalisointi” ilmainen?

Kyllä – oppitunnin ”Tokenisointi ja normalisointi” koko tekstin voi lukea täällä verkossa ilmaiseksi. Jos haluat harjoitella interaktiivisesti sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla sekä avata koko Python Academy-kurssin, päivitä CoddyKit PROhon. Python Academy-kurssilla on yhteensä 5 oppituntia.

Mitä opin oppitunnilla ”Tokenisointi ja normalisointi”?

Tekstin esikäsittelymenetelmät Harjoittelet Python Academy-aihetta koodilla, jonka suoritat suoraan selaimessa. Ympäri vuorokauden käytettävissä oleva tekoälytuutori vastaa kysymyksiisi oppitunnin aikana.

Tarvitsenko kokemusta aloittaakseni Python Academy-opiskelun?

Aiempi kokemus ei ole tarpeen. CoddyKitin Python Academy-oppimispolku sopii vasta-alkajista edistyneisiin, joten voit aloittaa tästä tai alusta ja edetä omaan tahtiisi. Tämä on oppitunti 2/5.

Kuinka kauan ”Tokenisointi ja normalisointi”-oppitunnin suorittaminen kestää?

Useimmat CoddyKitin oppitunnit kestävät noin 5–10 minuuttia. Jokainen oppitunti on lyhyt ja interaktiivinen, joten edistyt tasaisesti ja voit jatkaa siitä, mihin jäit – sekä verkossa että sovelluksessa.

Voinko kirjoittaa ja suorittaa koodia tällä Python Academy-oppitunnilla?

Kyllä. Jokainen Python Academy-oppitunti sisältää sisäänrakennetun koodieditorin, joten voit kirjoittaa ja suorittaa oikeaa koodia suoraan selaimessa ja saada välitöntä palautetta tekoälyltä – paikallista asennusta ei tarvita.

Kaikki tämän kurssin oppitunnit

  1. Tekstidatan käsittely
  2. Tokenisointi ja normalisointi
  3. N-gram-mallit
  4. Sentimenttianalyysin käsitteet
  5. Transformereihin perustuvat mallit
← Takaisin: Python Academy