TF-IDF og analyse af termfrekvens
Vurder termers betydning på tværs af dokumenter med bind_tf_idf().
TF-IDF og analyse af termfrekvens er en gratis R Academy-lektion på CoddyKit. Dette er lektion 2 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i R Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. R Academy-kurset indeholder 4 lektioner i alt.
Hvad er TF-IDF?
TF-IDF (Term Frequency–Inverse Document Frequency) måler, hvor karakteristisk et ord er for et bestemt dokument i en tekstsamling. En høj TF-IDF-score betyder, at ordet er hyppigt i dokumentet, men sjældent i alle dokumenterne — en god indikator for dokumentets vigtigste emner.
# TF-IDF formula
# TF(w, d) = count of w in document d / total words in d
# IDF(w) = log(N / number of docs containing w)
# TF-IDF(w, d) = TF(w, d) * IDF(w)
# Manual example
N <- 4 # total documents
docs_with_word <- 1 # 'neural' appears in only 1 doc
tf <- 5 / 100 # word appears 5 times in 100-word doc
idf <- log(N / docs_with_word)
tfidf <- tf * idf
cat('TF: ', round(tf, 4), '\n')
cat('IDF: ', round(idf, 4), '\n')
cat('TF-IDF: ', round(tfidf, 4), '\n')Forberedelse af tokenoptællingen
Før du beregner TF-IDF, skal du have en dataramme med kolonnerne: document (dokumentidentifikator), word (token) og n (optælling). Brug unnest_tokens() efterfulgt af count(document, word).
library(tidytext)
library(dplyr)
# Simulate a 4-document corpus on tech topics
docs <- tibble::tibble(
document = c(rep('ML', 3), rep('Stats', 3), rep('DB', 3), rep('Web', 3)),
text = c(
'machine learning neural networks training',
'deep learning models gradient descent',
'reinforcement learning reward policy agent',
'probability distributions hypothesis testing',
'bayesian inference regression analysis variance',
'statistics sampling confidence intervals normal',
'database sql joins indexes queries transactions',
'relational tables primary keys foreign constraints',
'nosql document store mongodb redis cassandra',
'html css javascript frontend react components',
'dom events browser api fetch requests',
'responsive design flexbox grid layout'
)
)
word_counts <- docs |>
unnest_tokens(word, text) |>
count(document, word, sort = TRUE)
cat('Document-word pairs:', nrow(word_counts), '\n')
print(head(word_counts, 8))bind_tf_idf: Beregning af TF-IDF
bind_tf_idf(word, document, n) tager en tidy-dataramme med optællinger og tilføjer tre kolonner: tf (termfrekvens), idf (invers dokumentfrekvens) og tf_idf (produktet af dem). Funktionen beregner IDF ud fra de dokumenter, der findes i datarammen.
library(tidytext)
library(dplyr)
docs <- tibble::tibble(
document = c(rep('ML', 2), rep('Stats', 2), rep('DB', 2)),
text = c(
'machine learning neural gradient',
'deep networks training epochs',
'probability distributions variance covariance',
'bayesian inference prior posterior',
'sql database tables joins indexes',
'queries transactions foreign primary'
)
)
tfidf <- docs |>
unnest_tokens(word, text) |>
count(document, word) |>
bind_tf_idf(word, document, n)
cat('Columns added:', names(tfidf), '\n')
print(head(arrange(tfidf, desc(tf_idf)), 8))arrange(desc(tf_idf)): Vigtigste termer
Sortér efter faldende tf_idf for at se, hvilke ord der bedst karakteriserer hvert dokument. Ord med en IDF på nul (som findes i alle dokumenter) får en TF-IDF på nul uanset deres frekvens — de kan ikke skelne dokumenterne fra hinanden.
library(tidytext)
library(dplyr)
docs <- tibble::tibble(
document = c(rep('Python', 3), rep('R', 3), rep('Julia', 3)),
text = c(
'python pandas numpy scipy programming',
'machine learning scikit tensorflow keras',
'jupyter notebooks scripts debugging modules',
'ggplot2 dplyr tidyverse statistics vectors',
'shiny rmarkdown knitr cran bioconductor',
'linear models factors dataframes packages',
'julia multiple dispatch type system macros',
'package ecosystem flux diffeq parallel',
'scientific computing performance benchmarks'
)
)
top_terms <- docs |>
unnest_tokens(word, text) |>
count(document, word) |>
bind_tf_idf(word, document, n) |>
arrange(desc(tf_idf))
cat('Top distinctive terms per language:\n')
print(head(top_terms[, c('document', 'word', 'tf_idf')], 9))Vigtigste TF-IDF-termer pr. dokument
Brug group_by(document) |> slice_max(tf_idf, n = 5) til at udtrække de N mest karakteristiske termer pr. dokument. Det er en effektiv opsummering af en tekstsamling — hvert dokuments karakteristiske ordforråd bliver tydeligt.
library(tidytext)
library(dplyr)
docs <- tibble::tibble(
document = c(rep('Cooking', 3), rep('Finance', 3), rep('Sports', 3)),
text = c(
'recipe ingredients oven bake flour butter',
'cooking temperature boil simmer saute',
'kitchen knife chopping herbs spices garnish',
'investment portfolio returns dividends stocks bonds',
'market equity risk hedge fund derivatives',
'inflation interest rate treasury balance sheet',
'goal tackle pass dribble goalkeeper penalty',
'tournament league championship trophy season',
'athlete training stamina sprint endurance'
)
)
top5 <- docs |>
unnest_tokens(word, text) |>
count(document, word) |>
bind_tf_idf(word, document, n) |>
group_by(document) |>
slice_max(tf_idf, n = 3) |>
ungroup()
print(top5[, c('document', 'word', 'tf_idf')])Visualisering af TF-IDF pr. dokument
Søjlediagrammer over TF-IDF-scorer opdelt efter dokument afslører hvert dokuments karakteristiske ordforråd med et enkelt blik. Brug facet_wrap(~document, scales = 'free_y'), så hvert panel uafhængigt kan vise sine egne vigtigste termer.
library(tidytext)
library(dplyr)
library(ggplot2)
docs <- tibble::tibble(
document = c(rep('AI', 3), rep('DB', 3), rep('Web', 3)),
text = c(
'neural networks gradient backpropagation',
'deep learning transformer attention bert',
'reinforcement policy reward exploration',
'sql database indexes joins transactions',
'relational schema normalization queries',
'nosql mongodb redis cassandra document',
'html css javascript react dom',
'frontend api fetch async components',
'responsive flexbox grid webpack bundle'
)
)
plot_data <- docs |>
unnest_tokens(word, text) |>
count(document, word) |>
bind_tf_idf(word, document, n) |>
group_by(document) |>
slice_max(tf_idf, n = 4) |>
ungroup()
ggplot(plot_data, aes(reorder(word, tf_idf), tf_idf, fill = document)) +
geom_col(show.legend = FALSE) +
facet_wrap(~document, scales = 'free_y') +
coord_flip() +
labs(x = NULL, y = 'TF-IDF', title = 'Top TF-IDF Terms per Topic') +
theme_minimal()IDF: Ord, der optræder i alle dokumenter
Ord, der optræder i hvert dokument, får IDF = log(N/N) = 0 og dermed TF-IDF = 0. Det nedvægter automatisk almindelige ord i hele tekstsamlingen uden behov for en liste med stopord — selvom fjernelse af stopord stadig er nyttig i meget små tekstsamlinger.
library(tidytext)
library(dplyr)
docs <- tibble::tibble(
document = c('A', 'B', 'C'),
text = c(
'data analysis statistics regression probability',
'data engineering pipelines etl transformation',
'data visualisation ggplot2 charts dashboards'
)
)
tfidf <- docs |>
unnest_tokens(word, text) |>
count(document, word) |>
bind_tf_idf(word, document, n)
# 'data' appears in all 3 docs: tf_idf should be 0
data_rows <- filter(tfidf, word == 'data')
cat('TF-IDF for "data" across documents:\n')
print(data_rows[, c('document', 'word', 'idf', 'tf_idf')])Sammenligning af to dokumenter
TF-IDF gør dokumentsammenligning let: Find termer med høj TF-IDF i ét dokument, men lav eller nul TF-IDF i et andet, for at forstå, hvad der gør hvert dokument unikt. Forbind TF-IDF-tabellerne med et inner join på word, og sammenlign scorerne.
library(tidytext)
library(dplyr)
docs <- tibble::tibble(
document = c(rep('Doc1', 3), rep('Doc2', 3)),
text = c(
'bayesian statistics prior posterior mcmc',
'markov chain monte carlo sampling',
'probability distributions conjugate inference',
'convolutional neural network image classification',
'pooling activation relu softmax batch',
'convolution filter feature map stride padding'
)
)
tfidf <- docs |>
unnest_tokens(word, text) |>
count(document, word) |>
bind_tf_idf(word, document, n)
# Top 3 unique terms per document
tfidf |>
group_by(document) |>
slice_max(tf_idf, n = 3) |>
select(document, word, tf_idf) |>
print()TF-IDF med Jane Austens romaner
Pakken janeaustenr indeholder den fulde tekst af seks Austen-romaner. Det er en klassisk TF-IDF-benchmark: Austen-fans kan identificere hver romans karakteristiske ordforråd — ordet "wentworth" er næsten unikt for Persuasion.
library(tidytext)
library(dplyr)
# Requires janeaustenr package
# library(janeaustenr)
# austen_books() returns: book, text
# Simulated mini-Austen corpus
mini_austen <- tibble::tibble(
book = c(rep('Sense', 3), rep('Pride', 3), rep('Emma', 3)),
text = c(
'elinor marianne dashwood willoughby colonel',
'edward ferrars barton cottage sister sense',
'brandon feelings attachment sensibility heart',
'darcy bennet bingley netherfield wickham',
'jane lizzy lydia longbourn pemberley',
'pride prejudice proposal marriage happiness',
'emma woodhouse knightley harriet weston',
'highbury match social governess niece',
'frank jane fairfax box hill picnic'
)
)
top <- mini_austen |>
unnest_tokens(word, text) |>
count(book, word) |>
bind_tf_idf(word, book, n) |>
group_by(book) |>
slice_max(tf_idf, n = 3) |>
select(book, word, tf_idf)
print(top)TF-IDF til feature engineering
TF-IDF-scorer kan bruges som features i maskinlæringsklassifikatorer. Konvertér TF-IDF-outputtet i tidy-format til en dokument-term-matrix med cast_dtm() eller cast_sparse(), og giv den videre til glmnet, xgboost eller en anden klassifikator.
library(tidytext)
library(dplyr)
docs <- tibble::tibble(
document = c(rep('Positive', 4), rep('Negative', 4)),
text = c(
'excellent product love recommend quality',
'amazing fast delivery five star perfect',
'great value money satisfied happy return',
'wonderful experience purchase outstanding best',
'terrible waste money broken arrived damaged',
'horrible quality slow delivery disappointed awful',
'poor value cheap plastic flimsy broken',
'worst experience refund needed useless junk'
)
)
# TF-IDF as features
tfidf_wide <- docs |>
unnest_tokens(word, text) |>
count(document, word) |>
bind_tf_idf(word, document, n) |>
cast_dtm(document, word, tf_idf)
cat('DTM dimensions:', dim(tfidf_wide), '\n')
cat('(rows=documents, cols=unique words)\n')Begrænsninger og alternativer
TF-IDF har begrænsninger: Metoden behandler ord som uafhængige, ignorerer ordrækkefølge og kontekst og kan domineres af sjældne stavefejl. Moderne alternativer omfatter word embeddings (word2vec, GloVe) og kontekstuelle embeddings (BERT), men TF-IDF er stadig fremragende til dokumentsøgning og som grundlag for klassifikation.
# TF-IDF strengths and weaknesses summary
criteria <- data.frame(
Criterion = c('Speed', 'Interpretability', 'Context', 'Word order',
'Rare words', 'Scalability'),
TF_IDF = c('Fast', 'High', 'None', 'Ignored',
'High IDF (inflated)', 'Excellent'),
BERT = c('Slow', 'Low', 'Rich', 'Captured',
'Handled', 'Moderate')
)
print(criteria, row.names = FALSE)Hurtigt tjek
Et ord optræder i alle dokumenter i din tekstsamling. Hvad bliver ordets TF-IDF-score?
Opsummering: TF-IDF-analyse
Vigtigste pointer:
- TF-IDF = termfrekvens × invers dokumentfrekvens; høj score = karakteristisk ord
- Arbejdsgang:
unnest_tokens()→count(document, word)→bind_tf_idf(word, document, n) bind_tf_idf()tilføjer kolonnernetf,idfogtf_idfarrange(desc(tf_idf))/slice_max(tf_idf, n = 5)viser de vigtigste termer pr. dokument- Ord i alle dokumenter får automatisk IDF = 0 og TF-IDF = 0
cast_dtm(document, word, tf_idf)konverterer til en dokument-term-matrix til maskinlæring- Søjlediagrammer opdelt efter dokument er standardvisualiseringen til TF-IDF-resultater
library(tidytext)
library(dplyr)
# Minimal TF-IDF pipeline
tibble::tibble(
doc = c('A', 'A', 'B', 'B'),
text = c('neural networks deep', 'learning training', 'sql database query', 'joins indexes')
) |>
unnest_tokens(word, text) |>
count(doc, word) |>
bind_tf_idf(word, doc, n) |>
arrange(desc(tf_idf)) |>
print()Lær R med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 43
- Lektioner
- 159
Ofte stillede spørgsmål
Er lektionen “TF-IDF og analyse af termfrekvens” gratis?
Ja — alle 3 lektioner i læringssporet R Academy, inklusive “TF-IDF og analyse af termfrekvens”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. R Academy-kurset indeholder 4 lektioner i alt.
Hvad lærer jeg i “TF-IDF og analyse af termfrekvens”?
Vurder termers betydning på tværs af dokumenter med bind_tf_idf(). Du øver dig i R Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på R Academy?
Der kræves ingen tidligere erfaring. R Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 2 af 4.
Hvor lang tid tager lektionen “TF-IDF og analyse af termfrekvens”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne R Academy-lektion?
Ja. Alle R Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- Tokenisering og fjernelse af stopord
- TF-IDF og analyse af termfrekvens
- Sentimentanalyse i R
- Topic modeling med LDA