0Pricing
R Academy · Lección

Modelado de temas con LDA

Descubra temas latentes en corpus de documentos mediante el paquete topicmodels.

Modelado de temas con LDA es una lección gratuita de R Academy en CoddyKit. Esta es la lección 4 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de R Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de R Academy incluye 4 lecciones en total.

¿Qué es el modelado de temas?

El modelado de temas es una técnica de aprendizaje automático no supervisado que descubre la estructura temática latente de un corpus. La Latent Dirichlet Allocation (LDA) supone que cada documento es una mezcla de K temas y que cada tema es una distribución de probabilidad sobre las palabras.

# LDA key assumptions:
# 1. Each document is a mixture of K topics
# 2. Each topic is a distribution over all vocabulary words
# 3. Words are generated by first picking a topic, then a word from that topic

# Example: K=2 topics in a corpus about tech and cooking
# Topic 1 (Tech):    neural(0.15) python(0.12) algorithm(0.10) ...
# Topic 2 (Cooking): recipe(0.14) flour(0.11) bake(0.10) ...

# A document about 'AI-generated recipes' might be:
# 70% Topic 1 (Tech) + 30% Topic 2 (Cooking)

cat('LDA parameters:\n')
cat('K = number of topics (you choose)\n')
cat('alpha = document-topic sparsity prior\n')
cat('beta  = topic-word sparsity prior\n')

DocumentTermMatrix de tm

LDA requiere una Document-Term Matrix (DTM): las filas son documentos, las columnas son palabras y las celdas contienen recuentos de palabras. La función DocumentTermMatrix() del paquete tm y la función cast_dtm() de tidytext producen este formato.

library(tm)

# Build a corpus from raw text
docs <- c(
  'machine learning neural networks training algorithms',
  'deep learning gradient backpropagation optimizer',
  'python scikit numpy pandas machine learning',
  'database sql tables indexes queries joins',
  'relational schema normalization foreign primary',
  'nosql mongodb document store redis queries'
)

corpus <- Corpus(VectorSource(docs))
corpus <- tm_map(corpus, removePunctuation)
corpus <- tm_map(corpus, removeWords, stopwords('english'))
corpus <- tm_map(corpus, stripWhitespace)

dtm <- DocumentTermMatrix(corpus)
cat('DTM shape:', nrow(dtm), 'docs x', ncol(dtm), 'terms\n')
cat('Sparsity: ', round(tm::sparsity(dtm) * 100, 1), '%\n')

cast_dtm de tidytext

cast_dtm(document, term, value) convierte directamente un tibble ordenado de recuentos de palabras en una DocumentTermMatrix compatible con el paquete topicmodels. Esto permite mantener el flujo de trabajo con el estilo de tidyverse.

library(tidytext)
library(dplyr)

# Tidy corpus
corpus <- tibble::tibble(
  doc_id = c(rep(1, 3), rep(2, 3), rep(3, 3), rep(4, 3)),
  text   = c(
    'neural networks deep learning training',
    'gradient descent backpropagation optimizer',
    'machine learning algorithms classification',
    'database sql tables queries indexes',
    'relational schema normalization joins',
    'foreign primary key constraints transactions',
    'recipe bake flour butter oven',
    'cooking temperature simmer saute ingredients',
    'kitchen knife herbs spices garnish'
  )
)

dtm <- corpus |>
  unnest_tokens(word, text) |>
  anti_join(tidytext::stop_words, by = 'word') |>
  count(doc_id, word) |>
  cast_dtm(doc_id, word, n)

cat('DTM:', nrow(dtm), 'docs x', ncol(dtm), 'terms\n')

LDA(dtm, k = 5): ajustar el modelo

LDA(dtm, k = K, control = list(seed = 42)) ajusta un modelo LDA con K temas mediante muestreo de Gibbs o VEM. Establezca siempre un seed para garantizar la reproducibilidad: LDA es estocástico y los resultados varían entre ejecuciones si no se fija una semilla.

library(tidytext)
library(dplyr)
library(topicmodels)

# Build DTM
corpus <- tibble::tibble(
  doc_id = c(rep(1,3), rep(2,3), rep(3,3), rep(4,3), rep(5,3), rep(6,3)),
  text = c(
    'neural networks deep gradient','backpropagation training optimizer','learning model layers',
    'database sql queries indexes','relational tables joins foreign','schema normalization constraints',
    'recipe flour bake butter','cooking temperature oven simmer','kitchen knife herbs spices'
  )[rep(c(1,2,3,4,5,6), each=1)]
)

dtm <- corpus |>
  unnest_tokens(word, text) |>
  count(doc_id, word) |>
  cast_dtm(doc_id, word, n)

# Fit LDA with k=3 topics
lda_model <- LDA(dtm, k = 3, control = list(seed = 42))
cat('LDA model fitted: k=3 topics\n')
cat('Class:', class(lda_model), '\n')

tidy(lda, matrix = 'beta'): probabilidades de tema por palabra

tidy(lda_model, matrix = 'beta') extrae las probabilidades de tema por palabra (la matriz beta). Cada fila indica la probabilidad de que una palabra específica haya sido generada por un tema específico. Las palabras con alta probabilidad definen de qué trata cada tema.

library(topicmodels)
library(tidytext)
library(dplyr)

# Using the built-in AssociatedPress dataset
data('AssociatedPress', package = 'topicmodels')

lda <- LDA(AssociatedPress[1:50, ], k = 4, control = list(seed = 1234))

# Per-word topic probabilities (beta)
beta_tbl <- tidy(lda, matrix = 'beta')
cat('Beta matrix rows:', nrow(beta_tbl), '\n')
cat('Columns:', names(beta_tbl), '\n')

# Top words per topic
top_terms <- beta_tbl |>
  group_by(topic) |>
  slice_max(beta, n = 5) |>
  ungroup()

cat('\nTop 5 words per topic:\n')
print(top_terms)

Visualizar las palabras de los temas

Represente las palabras principales de cada tema en un gráfico de barras facetado. Ordene las palabras dentro de cada tema según el valor beta utilizando reorder_within() y scale_x_reordered() de tidytext para obtener un orden independiente correcto en cada faceta.

library(topicmodels)
library(tidytext)
library(dplyr)
library(ggplot2)

data('AssociatedPress', package = 'topicmodels')
lda <- LDA(AssociatedPress[1:100, ], k = 4, control = list(seed = 42))

tidy(lda, matrix = 'beta') |>
  group_by(topic) |>
  slice_max(beta, n = 8) |>
  ungroup() |>
  mutate(term = reorder_within(term, beta, topic)) |>
  ggplot(aes(term, beta, fill = factor(topic))) +
    geom_col(show.legend = FALSE) +
    facet_wrap(~topic, scales = 'free') +
    scale_x_reordered() +
    coord_flip() +
    labs(x = NULL, y = 'Beta', title = 'Top Words per LDA Topic') +
    theme_minimal(base_size = 10)

tidy(lda, matrix = 'gamma'): probabilidades de tema por documento

tidy(lda_model, matrix = 'gamma') extrae las probabilidades de tema por documento (la matriz gamma). Cada fila indica la proporción estimada de un documento que corresponde a un tema específico. Los documentos con una gamma alta para el tema 2 tratan sobre el tema 2.

library(topicmodels)
library(tidytext)
library(dplyr)

data('AssociatedPress', package = 'topicmodels')
lda <- LDA(AssociatedPress[1:30, ], k = 3, control = list(seed = 99))

# Per-document topic proportions (gamma)
gamma_tbl <- tidy(lda, matrix = 'gamma')
cat('Gamma matrix rows:', nrow(gamma_tbl), '\n')

# Dominant topic per document
dominant_topic <- gamma_tbl |>
  group_by(document) |>
  slice_max(gamma, n = 1) |>
  ungroup()

cat('\nDominant topic per document (first 8):\n')
print(head(dominant_topic, 8))

Elegir K: número de temas

LDA requiere especificar K de antemano. Enfoques habituales: (1) perplejidad: cuanto menor, mejor, aunque disminuye monótonamente al aumentar K; (2) puntuación de coherencia (paquete ldatuning); (3) conocimiento del dominio; (4) probar K = 5, 10, 20 e inspeccionar manualmente las listas de palabras.

library(topicmodels)
library(tidytext)

data('AssociatedPress', package = 'topicmodels')

# Evaluate perplexity for K = 2, 3, 4, 5
k_values <- 2:5
perplexities <- vapply(k_values, function(k) {
  model <- LDA(AssociatedPress[1:50, ], k = k,
               control = list(seed = 42))
  perplexity(model)
}, numeric(1))

results <- data.frame(k = k_values, perplexity = round(perplexities, 1))
cat('Perplexity by K:\n')
print(results)
cat('\nNote: lower perplexity = better fit to training data\n')

Etiquetado de temas

LDA produce temas anónimos (1, 2, 3…). El analista debe etiquetar cada tema inspeccionando sus palabras principales. Cree una tabla de búsqueda que asocie los números de tema con nombres descriptivos y únala a los resultados.

library(topicmodels)
library(tidytext)
library(dplyr)

data('AssociatedPress', package = 'topicmodels')
lda <- LDA(AssociatedPress[1:100, ], k = 4, control = list(seed = 7))

# Top 5 words per topic for manual labelling
tidy(lda, matrix = 'beta') |>
  group_by(topic) |>
  slice_max(beta, n = 5) |>
  summarise(top_words = paste(term, collapse = ', ')) |>
  print()

# After inspecting top words, assign human-readable labels
topic_labels <- tibble::tibble(
  topic = 1:4,
  label = c('Politics', 'Economy', 'Sports', 'Science')  # your interpretation
)

cat('\nTopic labels assigned (example):\n')
print(topic_labels)

LDA en un corpus personalizado

A continuación se muestra un flujo de trabajo completo de LDA, de principio a fin, aplicado a un corpus personalizado: tokenizar, crear la DTM, ajustar LDA, extraer la matriz beta y mostrar las palabras principales de cada tema.

library(tidytext)
library(dplyr)
library(topicmodels)

# 9 documents across 3 latent topics
docs <- tibble::tibble(
  id   = 1:9,
  text = c(
    'machine learning neural deep training',
    'algorithm gradient backpropagation network',
    'python tensorflow keras model layers',
    'database sql relational tables queries',
    'joins indexes schema foreign primary',
    'transactions normalization constraints',
    'recipe ingredients bake flour butter',
    'cooking temperature simmer oven saute',
    'kitchen knife herbs spices garnish'
  )
)

dtm <- docs |>
  unnest_tokens(word, text) |>
  count(id, word) |>
  cast_dtm(id, word, n)

lda <- LDA(dtm, k = 3, control = list(seed = 123))

tidy(lda, 'beta') |>
  group_by(topic) |>
  slice_max(beta, n = 4) |>
  summarise(words = paste(term, collapse = ', ')) |>
  print()

Limitaciones de LDA

LDA supone un modelo de bolsa de palabras (el orden de las palabras no importa), que los temas son estáticos en todo el corpus y que K debe elegirse de antemano. Para temas dinámicos o jerárquicos, considere STM (Structural Topic Model) o CTM (Correlated Topic Model), disponibles en el paquete stm.

# LDA assumptions and limitations
limitations <- data.frame(
  Assumption = c(
    'Bag of words', 'Fixed K', 'Topic independence',
    'Static topics', 'No metadata'
  ),
  Alternative = c(
    'word2vec / BERT',
    'ldatuning for K selection',
    'CTM (Correlated Topic Model)',
    'DTM (Dynamic Topic Model)',
    'STM (Structural Topic Model)'
  )
)

print(limitations, row.names = FALSE)

Comprobación rápida

En LDA, ¿qué representa la matriz beta?

Resumen: modelado de temas con LDA

Ideas clave:

  • LDA descubre K temas latentes como distribuciones de palabras a partir de una matriz documento-término
  • Cree la DTM con cast_dtm(document, word, n) (tidytext) o DocumentTermMatrix() (tm)
  • LDA(dtm, k = K, control = list(seed = 42)) ajusta el modelo
  • tidy(lda, 'beta') = probabilidades de tema por palabra (lo que define cada tema)
  • tidy(lda, 'gamma') = proporciones de tema por documento (de qué trata cada documento)
  • Use la perplejidad o las puntuaciones de coherencia para orientar la elección de K
  • Inspeccione siempre manualmente las palabras principales para etiquetar los temas
library(topicmodels)
library(tidytext)
library(dplyr)

data('AssociatedPress', package = 'topicmodels')
lda <- LDA(AssociatedPress[1:20, ], k = 2, control = list(seed = 1))

tidy(lda, 'beta') |>
  group_by(topic) |>
  slice_max(beta, n = 3) |>
  summarise(top_words = paste(term, collapse = ', ')) |>
  print()

Preguntas frecuentes

¿La lección «Modelado de temas con LDA» es gratis?

Sí — el texto completo de «Modelado de temas con LDA» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de R Academy, actualiza a CoddyKit PRO. El curso de R Academy incluye 4 lecciones en total.

¿Qué aprenderé en «Modelado de temas con LDA»?

Descubra temas latentes en corpus de documentos mediante el paquete topicmodels. Practicas R Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.

¿Necesito experiencia previa para empezar R Academy?

No se requiere experiencia previa. R Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 4 de 4.

¿Cuánto tiempo toma la lección «Modelado de temas con LDA»?

La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.

¿Puedo escribir y ejecutar código en esta lección de R Academy?

Sí. Cada lección de R Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.

Todas las lecciones de este curso

  1. Tokenización y eliminación de palabras vacías
  2. TF-IDF y análisis de frecuencia de términos
  3. Análisis de sentimientos en R
  4. Modelado de temas con LDA
← Volver a R Academy