Tokenisering og fjerning av stoppord
Del tekst inn i token og filtrer bort lite informative ord med anti_join().
Tokenisering og fjerning av stoppord er en gratis leksjon i R Academy på CoddyKit. Dette er leksjon 1 av 4. Du kan lese valgfritt 3 leksjoner fra denne læringsstien gratis i sin helhet – deretter låser CoddyKit PRO opp alle leksjoner, samt praktisk øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i R Academy, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i R Academy inneholder totalt 4 leksjoner.
Hva er tekstutvinning?
Tekstutvinning (eller tekstanalyse) omformer ustrukturert tekst til strukturerte data som kan analyseres statistisk. Pakken tidytext gjør det mulig å bruke en tidy-tilnærming: hver rad er ett token (ord, bigram eller setning), noe som gjør dataene kompatible med dplyr og ggplot2.
library(tidytext)
library(dplyr)
# A simple text corpus
text_df <- tibble::tibble(
doc_id = 1:3,
text = c(
'The quick brown fox jumps over the lazy dog.',
'Text mining with R is powerful and fun.',
'Natural language processing enables many applications.'
)
)
cat('Input: ', nrow(text_df), 'documents\n')
cat('Columns:', names(text_df), '\n')unnest_tokens: Tokenisering av ord
unnest_tokens(output, input) deler tekst opp i et format med én rad per token. Som standard tokeniserer den etter ord, gjør teksten om til små bokstaver og fjerner tegnsetting. Argumentet token støtter blant annet 'words', 'ngrams' og 'sentences'.
library(tidytext)
library(dplyr)
text_df <- tibble::tibble(
doc_id = 1:2,
text = c(
'R is a great language for data analysis.',
'Text mining reveals hidden patterns in documents.'
)
)
# Tokenise into words
tokens <- text_df |>
unnest_tokens(word, text)
cat('Tokens extracted:', nrow(tokens), '\n')
print(tokens)Datasettet stop_words
tidytext leveres med en innebygd tibble kalt stop_words, som inneholder 1 149 vanlige engelske stoppord fra tre leksikoner: SMART, Snowball og onix. Disse ordene («the», «is», «and» …) har liten semantisk betydning og fjernes vanligvis før analysen.
library(tidytext)
library(dplyr)
# Inspect the stop_words dataset
cat('Total stop words:', nrow(stop_words), '\n')
cat('Lexicons:', paste(unique(stop_words$lexicon), collapse = ', '), '\n')
# First few stop words from each lexicon
stop_words |>
group_by(lexicon) |>
slice_head(n = 3) |>
print()anti_join: Fjerne stoppord
anti_join(tokens, stop_words, by = 'word') fjerner alle rader der word samsvarer med en oppføring i stop_words. Dette er standardmønsteret i tidytext for å fjerne stoppord – ryddig, lesbart og enkelt å utvide.
library(tidytext)
library(dplyr)
text_df <- tibble::tibble(
doc_id = 1:3,
text = c(
'The quick brown fox jumps over the lazy dog',
'A stitch in time saves nine important words',
'To be or not to be that is the question'
)
)
tokens <- text_df |>
unnest_tokens(word, text)
cat('Before removing stop words:', nrow(tokens), '\n')
tokens_clean <- tokens |>
anti_join(stop_words, by = 'word')
cat('After removing stop words:', nrow(tokens_clean), '\n')
print(tokens_clean)count: Termfrekvens
Etter at De har tokenisert teksten og fjernet stoppord, kan De bruke count(word, sort = TRUE) til å beregne termfrekvensen. Dette er grunnlaget for mange tekstutvinningsanalyser – de mest hyppige meningsbærende ordene kjennetegner dokumentets temaer.
library(tidytext)
library(dplyr)
# Use Jane Austen's novels from janeaustenr package
# For demo: simulate a small corpus
corpus <- tibble::tibble(
text = c(
'data science involves statistics programming analysis',
'machine learning algorithms data patterns training',
'statistics probability distributions random variables data',
'programming languages python r julia statistics',
'analysis patterns distributions algorithms science'
)
)
word_counts <- corpus |>
unnest_tokens(word, text) |>
anti_join(stop_words, by = 'word') |>
count(word, sort = TRUE)
cat('Top 8 words:\n')
print(head(word_counts, 8))Egendefinerte stoppord
Fagspesifikke korpus inneholder ofte hyppige ord som er irrelevante (for eksempel «patient» og «doctor» i medisinske notater). Opprett en egendefinert tibble med stoppord, og slå den sammen med det innebygde leksikonet ved hjelp av bind_rows().
library(tidytext)
library(dplyr)
# Domain-specific words to remove
custom_stops <- tibble::tibble(
word = c('data', 'analysis', 'r', 'using', 'also'),
lexicon = 'custom'
)
# Combine with built-in stop words
all_stops <- bind_rows(stop_words, custom_stops)
cat('Total stop words after custom:', nrow(all_stops), '\n')
corpus <- tibble::tibble(
text = c(
'Using R for data analysis and machine learning models',
'Statistical data analysis also involves data visualisation'
)
)
clean_tokens <- corpus |>
unnest_tokens(word, text) |>
anti_join(all_stops, by = 'word') |>
count(word, sort = TRUE)
print(clean_tokens)Bigram-tokenisering
Angi token = 'ngrams', n = 2 for å tokenisere teksten i etterfølgende ordpar (bigrammer). Bigrammer fanger opp uttrykk som «machine learning» eller «data science», som enkeltord ikke fanger opp, og gir dermed en rikere kontekst.
library(tidytext)
library(dplyr)
corpus <- tibble::tibble(
doc_id = 1:2,
text = c(
'machine learning and deep learning are powerful techniques',
'natural language processing uses machine learning methods'
)
)
bigrams <- corpus |>
unnest_tokens(bigram, text, token = 'ngrams', n = 2)
cat('Bigrams extracted:', nrow(bigrams), '\n')
print(bigrams)
# Count most common bigrams
bigram_counts <- bigrams |> count(bigram, sort = TRUE)
cat('\nTop bigrams:\n')
print(head(bigram_counts, 5))Filtrere bigrammer for bedre kvalitet
De hyppigste bigrammene inneholder ofte stoppordpar som «of the». Del bigrammet i to kolonner med tidyr::separate(), filtrer bort rader der ett av ordene er et stoppord, og sett deretter ordene sammen igjen for å få meningsfulle uttrykkspar.
library(tidytext)
library(dplyr)
library(tidyr)
corpus <- tibble::tibble(
text = c(
'the field of machine learning and deep learning is growing',
'natural language processing is a subfield of artificial intelligence'
)
)
bigrams_filtered <- corpus |>
unnest_tokens(bigram, text, token = 'ngrams', n = 2) |>
separate(bigram, into = c('word1', 'word2'), sep = ' ') |>
filter(
!word1 %in% stop_words$word,
!word2 %in% stop_words$word
) |>
unite(bigram, word1, word2, sep = ' ') |>
count(bigram, sort = TRUE)
print(bigrams_filtered)Visualisere ordfrekvenser
Plott ordfrekvenser som et stolpediagram ved hjelp av ggplot2. Sorter stolpene med reorder(word, n), og bruk coord_flip() for vannrette etiketter. Dette er en av de mest formidlende visualiseringene i tekstutvinning.
library(tidytext)
library(dplyr)
library(ggplot2)
corpus <- tibble::tibble(
text = c(
'statistics probability machine learning algorithms patterns',
'data science programming analysis visualisation models',
'machine learning deep learning neural networks patterns',
'probability statistics hypothesis testing distributions',
'algorithms optimisation gradient descent models training'
)
)
top_words <- corpus |>
unnest_tokens(word, text) |>
anti_join(stop_words, by = 'word') |>
count(word, sort = TRUE) |>
slice_head(n = 10)
ggplot(top_words, aes(reorder(word, n), n)) +
geom_col(fill = 'steelblue') +
coord_flip() +
labs(x = 'Word', y = 'Count', title = 'Top 10 Terms') +
theme_minimal()Ordantall per dokument
Når korpuset inneholder flere dokumenter, legger De til en kolonne med dokumentidentifikator og grupperer etter doc_id, word for å beregne termfrekvenser per dokument. Dette kan brukes direkte som grunnlag for TF-IDF- og emnemodellanalyser.
library(tidytext)
library(dplyr)
docs <- tibble::tibble(
doc_id = c(1, 1, 1, 2, 2, 2, 3, 3, 3),
text = c(
'machine learning models training',
'neural networks deep learning',
'algorithms gradient descent optimisation',
'statistical analysis probability distributions',
'hypothesis testing confidence intervals regression',
'bayesian inference prior posterior likelihood',
'data visualisation plots charts dashboards',
'ggplot2 ggvis plotly interactive graphics',
'colour scales aesthetics themes layers'
)
)
word_counts <- docs |>
unnest_tokens(word, text) |>
anti_join(stop_words, by = 'word') |>
count(doc_id, word, sort = TRUE)
cat('Word-doc pairs:', nrow(word_counts), '\n')
print(head(word_counts, 10))Setningstokenisering
Angi token = 'sentences' for å dele teksten ved setningsgrenser. Token på setningsnivå er nyttige for sentimentanalyse (gi hver setning en skår), oppsummering (velg representative setninger) og oppgaver med spørsmål og svar.
library(tidytext)
library(dplyr)
doc <- tibble::tibble(
id = 1L,
text = paste(
'R is a statistical programming language.',
'It is widely used in data science and machine learning.',
'The tidyverse makes data manipulation easy.',
'Text mining with tidytext is elegant and powerful.'
)
)
sentences <- doc |>
unnest_tokens(sentence, text, token = 'sentences')
cat('Sentences found:', nrow(sentences), '\n')
print(sentences$sentence)Kort kontrollspørsmål
De har tokenisert et korpus til ord ved hjelp av unnest_tokens() og ønsker å fjerne vanlige engelske ord. Hvilken operasjon gjør dette ved hjelp av det innebygde datasettet stop_words?
Oppsummering: Tokenisering og stoppord
Viktigste punkter:
unnest_tokens(word, text)gjør rå tekst om til et ryddig format med én rad per ord- Standard: små bokstaver og fjerning av tegnsetting; støtter
'words','ngrams'og'sentences' stop_wordser en innebygd tibble med 1 149 vanlige engelske ord fra 3 leksikoneranti_join(tokens, stop_words, by = 'word')fjerner stoppord- Kombiner med
bind_rows()for å legge til egendefinerte, fagspesifikke stoppord count(word, sort = TRUE)beregner termfrekvens fra ryddige token- Bigrammer:
unnest_tokens(bigram, text, token = 'ngrams', n = 2)
library(tidytext)
library(dplyr)
tibble::tibble(text = 'The quick brown fox jumps over the lazy dog') |>
unnest_tokens(word, text) |>
anti_join(stop_words, by = 'word') |>
count(word, sort = TRUE) |>
print()Lær deg R med en AI-veileder – gratis
Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.
- Kurs
- 43
- Leksjoner
- 159
Ofte stilte spørsmål
Er leksjonen «Tokenisering og fjerning av stoppord» gratis?
Ja – du kan lese valgfritt 3 av leksjonene i læringsstien R Academy, inkludert «Tokenisering og fjerning av stoppord», gratis i sin helhet her på nettet. Deretter låser CoddyKit PRO opp alle leksjoner, samt interaktiv øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Kurset i R Academy inneholder totalt 4 leksjoner.
Hva lærer jeg i «Tokenisering og fjerning av stoppord»?
Del tekst inn i token og filtrer bort lite informative ord med anti_join(). Du øver på R Academy med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.
Trenger jeg erfaring for å begynne med R Academy?
Ingen tidligere erfaring er nødvendig. R Academy på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 1 av 4.
Hvor lang tid tar leksjonen «Tokenisering og fjerning av stoppord»?
De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.
Kan jeg skrive og kjøre kode i denne R Academy-leksjonen?
Ja. Alle R Academy-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.
Alle leksjonene i dette kurset
- Tokenisering og fjerning av stoppord
- TF-IDF og analyse av termfrekvens
- Sentimentanalyse i R
- Emnemodellering med LDA