Oppikaa tekoälyä Pythonilla · Oppitunti

Tokenisointi ja normalisointi

Tekstin esikäsittelytekniikat.

Oppitunti 2/510 vaihetta

Tokenisointi ja normalisointi on ilmainen Oppikaa tekoälyä Pythonilla-oppitunti CoddyKitissä. Tämä on oppitunti 2/5. Voit lukea tästä oppimispolusta kokonaan mitkä tahansa 3 oppituntia ilmaiseksi — sen jälkeen CoddyKit PRO avaa kaikki oppitunnit sekä käytännön harjoittelun sisäänrakennetulla koodieditorilla ja ympäri vuorokauden toimivalla tekoälytuutorilla. Oppitunti kuuluu Oppikaa tekoälyä Pythonilla-oppimispolkuun, ja edistymisesi synkronoituu verkon ja CoddyKit-sovelluksen välillä. Oppikaa tekoälyä Pythonilla-kurssilla on yhteensä 5 oppituntia.

Tekstin esikäsittelyn perusteet

Tokenisointi ja normalisointi

Tekstin esikäsittely on tärkeä NLP:n vaihe. Siinä raakateksti muunnetaan analyysia varten rakenteiseen muotoon. Keskeisiä esikäsittelyvaiheita ovat tokenisointi ja normalisointi.

Tokenisointi ja normalisointi — kuvitus 1

Mitä tokenisointi on?

Tokenisointi on prosessi, jossa teksti jaetaan pienempiin yksiköihin eli tokeneihin. Tokenit voivat olla sanoja, lauseita tai merkkejä.

Esimerkiksi:

Teksti: "NLP is amazing!"

Tokenit: ["NLP", "is", "amazing", "!"]

Tokenisointiesimerkki Pythonilla

NLTK-kirjaston avulla tekstin voi tokenisoida sanoiksi tai lauseiksi:

from nltk.tokenize import word_tokenize, sent_tokenize

# Example text
text = "Tokenization is a key step in NLP. Let's learn it!"

# Word Tokenization
word_tokens = word_tokenize(text)
print("Word Tokens:", word_tokens)

# Sentence Tokenization
sentence_tokens = sent_tokenize(text)
print("Sentence Tokens:", sentence_tokens)

Mitä normalisointi on?

Normalisointiin kuuluu tekstin puhdistaminen ja yhdenmukaistaminen. Yleisiä normalisointitekniikoita ovat:

  • Muuntaminen pienaakkosiksi: Koko tekstin muuntaminen pienaakkosiksi.
  • Välimerkkien poistaminen: Välimerkkien poistaminen.
  • Stemming: Sanojen palauttaminen niiden vartalomuotoon katkaisemalla päätteet (esim. "running" → "run").
  • Lemmatisaatio: Sanojen palauttaminen perusmuotoon asiayhteyden avulla (esim. "better" → "good").

Muuntaminen pienaakkosiksi ja välimerkkien poistaminen

Teksti normalisoidaan muuntamalla se pienaakkosiksi ja poistamalla välimerkit seuraavasti:

import string

# Example text
text = "Normalization in NLP is Important!"

# Lowercasing
text = text.lower()

# Removing Punctuation
text = text.translate(str.maketrans('', '', string.punctuation))
print("Normalized Text:", text)

Stemming ja lemmatisointi

Stemming: Palauttaa sanat niiden vartaloon poistamalla päätteitä. Se perustuu sääntöihin, eikä tuloksena aina ole oikea sana.

Lemmatisaatio: Käyttää sanastoa ja kielioppisääntöjä palauttaakseen sanat niiden merkitykselliseen perusmuotoon.

from nltk.stem import PorterStemmer, WordNetLemmatizer

# Example text
word = "running"

# Stemming
stemmer = PorterStemmer()
print("Stemmed Word:", stemmer.stem(word))

# Lemmatization
lemmatizer = WordNetLemmatizer()
print("Lemmatized Word:", lemmatizer.lemmatize(word, pos='v'))

Stop-sanojen poistaminen

Stop-sanat ovat yleisiä sanoja (esim. "is", "and" ja "the"), jotka eivät usein sisällä merkittävää tietoa. Niiden poistaminen voi yksinkertaistaa tekstianalyysia:

from nltk.corpus import stopwords

# Example text
text = "This is a simple NLP example."

# Tokenize text
words = word_tokenize(text)

# Remove stopwords
stop_words = set(stopwords.words('english'))
filtered_words = [word for word in words if word.lower() not in stop_words]
print("Filtered Words:", filtered_words)

Tekstin esikäsittelyn haasteet

Tekstin esikäsittely voi olla haastavaa seuraavista syistä:

  • Monitulkintaisuus: Sanoilla, kuten "lead", voi olla useita merkityksiä.
  • Asiayhteys: Lemmatisaatio edellyttää sanan asiayhteyden ymmärtämistä.
  • Kielten vaihtelu: Eri kielten ja murteiden käsitteleminen.

Yhteenveto ja seuraavat vaiheet

Tässä oppitunnissa:

  • Opimme tokenisoinnista ja normalisoinnista.
  • Tutustuimme tekniikoihin, kuten vartalointiin, lemmatisointiin ja stop-sanojen poistamiseen.
  • Harjoittelimme tekstin esikäsittelyä Pythonilla.

Seuraavaksi analysoimme tekstin kuvioita N-Gram-malleilla.

Tokenisointi ja normalisointi — kuvitus 10
Aloita maksutta

Opi Python tekoälytuutorin avulla — ilmaiseksi

Kirjoita ja suorita oikeaa koodia selaimessa, saa välitöntä apua tekoälytuutorilta ympäri vuorokauden ja jatka siitä, mihin jäit, verkossa tai sovelluksessa.

Kurssit
53
Oppitunnit
225

Usein kysytyt kysymykset

Onko oppitunti ”Tokenisointi ja normalisointi” ilmainen?

Kyllä — voit lukea täällä verkossa kokonaan ilmaiseksi mitkä tahansa Oppikaa tekoälyä Pythonilla-oppimispolun 3 oppituntia, myös oppitunnin “Tokenisointi ja normalisointi”. Sen jälkeen CoddyKit PRO avaa kaikki oppitunnit sekä interaktiiviset harjoitukset sisäänrakennetulla koodieditorilla ja ympäri vuorokauden toimivalla tekoälytuutorilla. Oppikaa tekoälyä Pythonilla-kurssilla on yhteensä 5 oppituntia.

Mitä opin oppitunnilla ”Tokenisointi ja normalisointi”?

Tekstin esikäsittelytekniikat. Harjoittelet Oppikaa tekoälyä Pythonilla-aihetta koodilla, jonka suoritat suoraan selaimessa. Ympäri vuorokauden käytettävissä oleva tekoälytuutori vastaa kysymyksiisi oppitunnin aikana.

Tarvitsenko kokemusta aloittaakseni Oppikaa tekoälyä Pythonilla-opiskelun?

Aiempi kokemus ei ole tarpeen. CoddyKitin Oppikaa tekoälyä Pythonilla-oppimispolku sopii vasta-alkajista edistyneisiin, joten voit aloittaa tästä tai alusta ja edetä omaan tahtiisi. Tämä on oppitunti 2/5.

Kuinka kauan ”Tokenisointi ja normalisointi”-oppitunnin suorittaminen kestää?

Useimmat CoddyKitin oppitunnit kestävät noin 5–10 minuuttia. Jokainen oppitunti on lyhyt ja interaktiivinen, joten edistyt tasaisesti ja voit jatkaa siitä, mihin jäit – sekä verkossa että sovelluksessa.

Voinko kirjoittaa ja suorittaa koodia tällä Oppikaa tekoälyä Pythonilla-oppitunnilla?

Kyllä. Jokainen Oppikaa tekoälyä Pythonilla-oppitunti sisältää sisäänrakennetun koodieditorin, joten voit kirjoittaa ja suorittaa oikeaa koodia suoraan selaimessa ja saada välitöntä palautetta tekoälyltä – paikallista asennusta ei tarvita.

Kaikki tämän kurssin oppitunnit

  1. Tekstidatan käsittely
  2. Tokenisointi ja normalisointi
  3. N-grammimallit
  4. Tunneanalyysin käsitteet
  5. Transformer-pohjaiset mallit
← Takaisin: Oppikaa tekoälyä Pythonilla