Extracción de tablas y enlaces
Analice tablas HTML en data frames y recopile todos los hipervínculos de una página.
Extracción de tablas y enlaces es una lección gratuita de R Academy en CoddyKit. Esta es la lección 3 de 4. Puedes leer la lección completa abajo gratuitamente — luego la practicas en el navegador con un editor de código integrado y un tutor de IA 24/7. Forma parte de la ruta de aprendizaje de R Academy, y tu progreso se sincroniza en la web y la app de CoddyKit. El curso de R Academy incluye 4 lecciones en total.
Tablas HTML en páginas web
Las tablas HTML (<table>) son los objetivos más prácticos para el scraping porque ya tienen estructura. La función html_table() de rvest las convierte directamente en data frames de R y gestiona los encabezados automáticamente.
library(rvest)
html <- read_html('
<table>
<thead><tr><th>Country</th><th>GDP</th><th>Pop</th></tr></thead>
<tbody>
<tr><td>USA</td><td>25T</td><td>330M</td></tr>
<tr><td>China</td><td>18T</td><td>1400M</td></tr>
</tbody>
</table>
')
# html_table converts to data frame
tbl <- html_table(html_element(html, 'table'))
class(tbl) # 'data.frame'
names(tbl) # c('Country', 'GDP', 'Pop')
nrow(tbl) # 2
print(tbl)html_table() en una página completa
Cuando una página contiene varias tablas, use html_elements() (en plural) para obtenerlas todas y, después, html_table() sobre el nodeset resultante para devolver una lista de data frames. Seleccione la que necesite mediante su índice.
library(rvest)
html <- read_html('
<table id="t1"><tr><th>A</th></tr><tr><td>1</td></tr></table>
<table id="t2"><tr><th>X</th><th>Y</th></tr>
<tr><td>10</td><td>20</td></tr></table>
')
# Get ALL tables as a list of data frames
tables <- html_table(html_elements(html, 'table'))
length(tables) # 2
# First table
tables[[1]]
# Second table
tables[[2]]
# Select a specific table by its id
table2 <- html_table(html_element(html, '#t2'))
print(table2)Limpiar datos de tablas
Las tablas extraídas de sitios web suelen tener encabezados desordenados, celdas combinadas o espacios en blanco adicionales. Use janitor::clean_names() para los encabezados y las operaciones habituales de dplyr/stringr para limpiar los valores de las celdas.
library(rvest)
html <- read_html('
<table>
<tr><th>Product Name</th><th>Price (USD)</th><th>In Stock?</th></tr>
<tr><td> Widget A </td><td>$12.50</td><td>Yes</td></tr>
<tr><td>Gadget B</td><td>$7.99</td><td>No</td></tr>
</table>
')
df <- html_table(html_element(html, 'table'))
# Clean column names
names(df) <- c('product', 'price', 'in_stock')
# Strip whitespace and dollar signs
df$product <- trimws(df$product)
df$price <- as.numeric(gsub('[$]', '', df$price))
df$in_stock <- df$in_stock == 'Yes'
print(df)Extraer todos los enlaces de una página
Los enlaces son etiquetas anchor (<a>) con atributos href. Use html_elements(page, 'a') para obtener todos los anchors y, después, html_attr('href') para las URL y html_text2() para el texto de los enlaces.
library(rvest)
html <- read_html('
<div>
<a href="/about">About Us</a>
<a href="/products">Products</a>
<a href="https://partner.com" rel="external">Partner</a>
<a>No href link</a>
</div>
')
# Get all anchor elements
anchors <- html_elements(html, 'a')
# Extract text and href
link_text <- html_text2(anchors)
link_href <- html_attr(anchors, 'href')
data.frame(text = link_text, href = link_href)
# Note: last row has NA hrefFiltrar enlaces relevantes
Las páginas reales mezclan enlaces de navegación, del pie de página y anclas internas con los enlaces que realmente necesita. Filtre eliminando los valores NA, las anclas (#) y los enlaces javascript:, y aplique una búsqueda por patrones para conservar solo las URL relevantes.
library(rvest)
html <- read_html('
<div>
<a href="/article/1">Article One</a>
<a href="/article/2">Article Two</a>
<a href="#top">Back to top</a>
<a href="javascript:void(0)">JS link</a>
<a href="/article/3">Article Three</a>
</div>
')
anchors <- html_elements(html, 'a')
hrefs <- html_attr(anchors, 'href')
texts <- html_text2(anchors)
# Keep only article links
article_idx <- grepl('^/article/', hrefs) & !is.na(hrefs)
article_links <- data.frame(
text = texts[article_idx],
href = hrefs[article_idx]
)
print(article_links)De URL relativas a URL absolutas
Los valores href extraídos suelen ser rutas relativas como /page. Conviértalos en URL absolutas anteponiendo la URL base. La función xml2::url_absolute() lo hace correctamente.
library(rvest)
base_url <- 'https://books.toscrape.com'
html <- read_html('
<ul>
<li><a href="/catalogue/book1">Book One</a></li>
<li><a href="/catalogue/book2">Book Two</a></li>
<li><a href="https://external.com/book">External</a></li>
</ul>
')
hrefs <- html_attr(html_elements(html, 'a'), 'href')
# xml2::url_absolute resolves relative + keeps absolute
abs_urls <- xml2::url_absolute(hrefs, base = base_url)
abs_urls
# 'https://books.toscrape.com/catalogue/book1'
# 'https://books.toscrape.com/catalogue/book2'
# 'https://external.com/book' <- kept as-isExtracción dirigida de enlaces
En lugar de extraer todos los enlaces y filtrarlos, use selectores CSS específicos para seleccionar únicamente los enlaces que necesita. Combine el contexto del elemento con selectores de atributos para obtener mayor precisión.
library(rvest)
html <- read_html('
<nav class="breadcrumb">
<a href="/">Home</a> > <a href="/books">Books</a>
</nav>
<ul class="products">
<li><a href="/books/1" class="prod-link">Clean Code</a></li>
<li><a href="/books/2" class="prod-link">Refactoring</a></li>
</ul>
<footer>
<a href="/privacy">Privacy</a>
</footer>
')
# Target ONLY product links (not nav or footer)
prod_links <- html_elements(html, 'ul.products a.prod-link')
data.frame(
title = html_text2(prod_links),
url = html_attr(prod_links, 'href')
)Combinar datos de tablas y enlaces
A menudo, las celdas de una tabla contienen enlaces. Combine html_table() para obtener los valores de texto con html_attr() aplicado de forma dirigida a los enlaces integrados, y cree así un data frame más completo.
library(rvest)
html <- read_html('
<table class="results">
<tr><th>Book</th><th>Author</th></tr>
<tr>
<td><a href="/b/1">Clean Code</a></td>
<td>Robert Martin</td>
</tr>
<tr>
<td><a href="/b/2">Refactoring</a></td>
<td>Martin Fowler</td>
</tr>
</table>
')
# Get text from table
df <- html_table(html_element(html, 'table'))
# Get links embedded in first column
links <- html_attr(html_elements(html, 'table td a'), 'href')
df$url <- links
print(df)Parámetro fill de html_table()
En ocasiones, las tablas HTML tienen celdas ausentes o filas con una estructura irregular. El parámetro fill=TRUE de html_table() rellena los valores ausentes con NA en lugar de generar un error.
library(rvest)
html <- read_html('
<table>
<tr><th>Name</th><th>Score</th><th>Grade</th></tr>
<tr><td>Alice</td><td>95</td><td>A</td></tr>
<tr><td>Bob</td><td>80</td></tr>
</table>
')
# Without fill=TRUE this may error on uneven rows
df <- html_table(html_element(html, 'table'), fill = TRUE)
print(df)
# Name Score Grade
# Alice 95 A
# Bob 80 <NA>
# fill=TRUE is safe even when rows are uniform
is.na(df[2, 'Grade']) # TRUEExtraer fuentes de imágenes
Las imágenes usan atributos src (y, en ocasiones, data-src para la carga diferida). El mismo método con html_attr() extrae las URL de las imágenes para descargarlas o catalogarlas.
library(rvest)
html <- read_html('
<div class="gallery">
<img src="/img/photo1.jpg" alt="Sunset">
<img src="/img/photo2.jpg" alt="Mountains">
<img data-src="/img/lazy.jpg" class="lazy" alt="Lake">
</div>
')
# Regular images
images <- html_elements(html, 'img')
srcs <- html_attr(images, 'src')
alts <- html_attr(images, 'alt')
data.frame(alt = alts, src = srcs)
# For lazy-loaded images check data-src
lazy_src <- html_attr(html_element(html, '.lazy'), 'data-src')
lazy_src # '/img/lazy.jpg'Guardar datos extraídos
Después de extraer tablas y enlaces en un data frame, guarde los resultados con write.csv() o readr::write_csv(). Incluya siempre una marca de tiempo o la URL de origen para mantener la procedencia de los datos.
library(rvest)
html <- read_html('
<table>
<tr><th>Product</th><th>Price</th></tr>
<tr><td>Widget</td><td>9.99</td></tr>
<tr><td>Gadget</td><td>14.50</td></tr>
</table>
')
df <- html_table(html_element(html, 'table'))
# Add metadata
df$scraped_at <- Sys.time()
df$source_url <- 'https://example.com/products'
# Save to CSV
# write.csv(df, 'products.csv', row.names = FALSE)
print(df)
cat('Data ready for analysis or storage')Comprobación rápida
Compruebe su comprensión de la extracción de tablas HTML y enlaces con rvest.
Repaso: tablas y enlaces
Conceptos clave: html_table() convierte automáticamente las tablas HTML en data frames; use fill=TRUE para tablas irregulares. Para los enlaces, obtenga todos los anchors con html_elements('a'), el texto con html_text2() y las URL con html_attr('href'). Convierta las URL relativas en absolutas con xml2::url_absolute(). Filtre los enlaces no deseados mediante patrones. Combine el texto de las tablas con las URL de los enlaces integrados para obtener conjuntos de datos más completos.
library(rvest)
# Table scraping pattern:
# tables <- html_table(html_elements(page, 'table'))
# df <- tables[[1]]
# Link scraping pattern:
# links <- html_elements(page, 'a[href]')
# data.frame(
# text = html_text2(links),
# url = xml2::url_absolute(
# html_attr(links, 'href'),
# base = base_url
# )
# )
# Combine: scrape table text AND embedded link URLs
cat('Tables + links = most of what the web offers')Preguntas frecuentes
¿La lección «Extracción de tablas y enlaces» es gratis?
Sí — el texto completo de «Extracción de tablas y enlaces» es gratis para leer aquí en la web. Para practicarla de forma interactiva (editor de código integrado y tutor de IA 24/7) y desbloquear el resto del curso de R Academy, actualiza a CoddyKit PRO. El curso de R Academy incluye 4 lecciones en total.
¿Qué aprenderé en «Extracción de tablas y enlaces»?
Analice tablas HTML en data frames y recopile todos los hipervínculos de una página. Practicas R Academy con código real que ejecutas directamente en el navegador, y un tutor de IA 24/7 responde tus preguntas mientras trabajas en la lección.
¿Necesito experiencia previa para empezar R Academy?
No se requiere experiencia previa. R Academy en CoddyKit está estructurado para principiantes hasta estudiantes avanzados, así que puedes empezar aquí o desde el inicio y avanzar a tu ritmo. Esta es la lección 3 de 4.
¿Cuánto tiempo toma la lección «Extracción de tablas y enlaces»?
La mayoría de las lecciones de CoddyKit toman alrededor de 5–10 minutos. Cada una es compacta e interactiva, así que avanzas constantemente y retomas exactamente por donde dejaste en la web y la app.
¿Puedo escribir y ejecutar código en esta lección de R Academy?
Sí. Cada lección de R Academy incluye un editor de código integrado, así que escribes y ejecutas código real directamente en tu navegador y obtienes retroalimentación instantánea de IA — sin configuración local necesaria.
Todas las lecciones de este curso
- Estructura HTML y selectores CSS
- Fundamentos de html_element() y html_text()
- Extracción de tablas y enlaces
- Gestión de paginación y varias páginas