Extraindo tabelas e links
Analise tabelas HTML em quadros de dados e colete todos os hiperlinks de uma página.
Extraindo tabelas e links é uma aula grátis de R Academy no CoddyKit. Esta é a aula 3 de 4. Você pode ler a aula completa abaixo gratuitamente — depois pratica ao vivo no navegador com um editor de código integrado e um tutor de IA 24/7. Faz parte do caminho de aprendizado de R Academy, e seu progresso é sincronizado entre a web e o app CoddyKit. O curso de R Academy inclui 4 aulas no total.
Tabelas HTML em páginas da web
As tabelas HTML (<table>) são os alvos mais convenientes para raspagem porque já têm estrutura. A função html_table() do rvest as converte diretamente em quadros de dados do R, tratando os cabeçalhos automaticamente.
library(rvest)
html <- read_html('
<table>
<thead><tr><th>Country</th><th>GDP</th><th>Pop</th></tr></thead>
<tbody>
<tr><td>USA</td><td>25T</td><td>330M</td></tr>
<tr><td>China</td><td>18T</td><td>1400M</td></tr>
</tbody>
</table>
')
# html_table converts to data frame
tbl <- html_table(html_element(html, 'table'))
class(tbl) # 'data.frame'
names(tbl) # c('Country', 'GDP', 'Pop')
nrow(tbl) # 2
print(tbl)html_table() em uma página inteira
Quando uma página tem várias tabelas, use html_elements() (plural) para obter todas elas e depois aplique html_table() ao conjunto de nós resultante para retornar uma lista de quadros de dados. Selecione a tabela necessária pelo índice.
library(rvest)
html <- read_html('
<table id="t1"><tr><th>A</th></tr><tr><td>1</td></tr></table>
<table id="t2"><tr><th>X</th><th>Y</th></tr>
<tr><td>10</td><td>20</td></tr></table>
')
# Get ALL tables as a list of data frames
tables <- html_table(html_elements(html, 'table'))
length(tables) # 2
# First table
tables[[1]]
# Second table
tables[[2]]
# Select a specific table by its id
table2 <- html_table(html_element(html, '#t2'))
print(table2)Limpando dados de tabelas
As tabelas extraídas de sites frequentemente têm cabeçalhos desorganizados, células mescladas ou espaços em branco extras. Use janitor::clean_names() nos cabeçalhos e operações padrão do dplyr/stringr para limpar os valores das células.
library(rvest)
html <- read_html('
<table>
<tr><th>Product Name</th><th>Price (USD)</th><th>In Stock?</th></tr>
<tr><td> Widget A </td><td>$12.50</td><td>Yes</td></tr>
<tr><td>Gadget B</td><td>$7.99</td><td>No</td></tr>
</table>
')
df <- html_table(html_element(html, 'table'))
# Clean column names
names(df) <- c('product', 'price', 'in_stock')
# Strip whitespace and dollar signs
df$product <- trimws(df$product)
df$price <- as.numeric(gsub('[$]', '', df$price))
df$in_stock <- df$in_stock == 'Yes'
print(df)Extraindo todos os links de uma página
Os links são tags âncora (<a>) com atributos href. Use html_elements(page, 'a') para obter todas as âncoras, depois html_attr('href') para as URLs e html_text2() para o texto dos links.
library(rvest)
html <- read_html('
<div>
<a href="/about">About Us</a>
<a href="/products">Products</a>
<a href="https://partner.com" rel="external">Partner</a>
<a>No href link</a>
</div>
')
# Get all anchor elements
anchors <- html_elements(html, 'a')
# Extract text and href
link_text <- html_text2(anchors)
link_href <- html_attr(anchors, 'href')
data.frame(text = link_text, href = link_href)
# Note: last row has NA hrefFiltrando links relevantes
Páginas reais têm links de navegação, links de rodapé e âncoras internas misturados aos links que você realmente deseja. Filtre removendo valores NA, âncoras (#) e links javascript:, e aplicando correspondência de padrões para manter apenas as URLs relevantes.
library(rvest)
html <- read_html('
<div>
<a href="/article/1">Article One</a>
<a href="/article/2">Article Two</a>
<a href="#top">Back to top</a>
<a href="javascript:void(0)">JS link</a>
<a href="/article/3">Article Three</a>
</div>
')
anchors <- html_elements(html, 'a')
hrefs <- html_attr(anchors, 'href')
texts <- html_text2(anchors)
# Keep only article links
article_idx <- grepl('^/article/', hrefs) & !is.na(hrefs)
article_links <- data.frame(
text = texts[article_idx],
href = hrefs[article_idx]
)
print(article_links)De URLs relativas para absolutas
Os valores href extraídos geralmente são caminhos relativos, como /page. Converta-os em URLs absolutas acrescentando a URL base. A função xml2::url_absolute() faz isso corretamente.
library(rvest)
base_url <- 'https://books.toscrape.com'
html <- read_html('
<ul>
<li><a href="/catalogue/book1">Book One</a></li>
<li><a href="/catalogue/book2">Book Two</a></li>
<li><a href="https://external.com/book">External</a></li>
</ul>
')
hrefs <- html_attr(html_elements(html, 'a'), 'href')
# xml2::url_absolute resolves relative + keeps absolute
abs_urls <- xml2::url_absolute(hrefs, base = base_url)
abs_urls
# 'https://books.toscrape.com/catalogue/book1'
# 'https://books.toscrape.com/catalogue/book2'
# 'https://external.com/book' <- kept as-isExtração direcionada de links
Em vez de extrair todos os links e filtrá-los, use seletores CSS específicos para direcionar a busca somente aos links necessários. Combine o contexto do elemento com seletores de atributos para obter precisão.
library(rvest)
html <- read_html('
<nav class="breadcrumb">
<a href="/">Home</a> > <a href="/books">Books</a>
</nav>
<ul class="products">
<li><a href="/books/1" class="prod-link">Clean Code</a></li>
<li><a href="/books/2" class="prod-link">Refactoring</a></li>
</ul>
<footer>
<a href="/privacy">Privacy</a>
</footer>
')
# Target ONLY product links (not nav or footer)
prod_links <- html_elements(html, 'ul.products a.prod-link')
data.frame(
title = html_text2(prod_links),
url = html_attr(prod_links, 'href')
)Mesclando dados de tabelas e links
Frequentemente, as células de uma tabela contêm links. Combine html_table() para obter os valores textuais com html_attr() direcionado para obter os links incorporados e criar um quadro de dados mais completo.
library(rvest)
html <- read_html('
<table class="results">
<tr><th>Book</th><th>Author</th></tr>
<tr>
<td><a href="/b/1">Clean Code</a></td>
<td>Robert Martin</td>
</tr>
<tr>
<td><a href="/b/2">Refactoring</a></td>
<td>Martin Fowler</td>
</tr>
</table>
')
# Get text from table
df <- html_table(html_element(html, 'table'))
# Get links embedded in first column
links <- html_attr(html_elements(html, 'table td a'), 'href')
df$url <- links
print(df)Parâmetro fill de html_table()
Às vezes, as tabelas HTML têm células ausentes ou linhas estruturadas de forma irregular. O parâmetro fill=TRUE em html_table() preenche os valores ausentes com NA em vez de gerar um erro.
library(rvest)
html <- read_html('
<table>
<tr><th>Name</th><th>Score</th><th>Grade</th></tr>
<tr><td>Alice</td><td>95</td><td>A</td></tr>
<tr><td>Bob</td><td>80</td></tr>
</table>
')
# Without fill=TRUE this may error on uneven rows
df <- html_table(html_element(html, 'table'), fill = TRUE)
print(df)
# Name Score Grade
# Alice 95 A
# Bob 80 <NA>
# fill=TRUE is safe even when rows are uniform
is.na(df[2, 'Grade']) # TRUEExtraindo fontes de imagens
As imagens usam atributos src (e, às vezes, data-src para carregamento tardio). A mesma abordagem com html_attr() extrai as URLs das imagens para download ou catalogação.
library(rvest)
html <- read_html('
<div class="gallery">
<img src="/img/photo1.jpg" alt="Sunset">
<img src="/img/photo2.jpg" alt="Mountains">
<img data-src="/img/lazy.jpg" class="lazy" alt="Lake">
</div>
')
# Regular images
images <- html_elements(html, 'img')
srcs <- html_attr(images, 'src')
alts <- html_attr(images, 'alt')
data.frame(alt = alts, src = srcs)
# For lazy-loaded images check data-src
lazy_src <- html_attr(html_element(html, '.lazy'), 'data-src')
lazy_src # '/img/lazy.jpg'Salvando dados extraídos
Depois de extrair tabelas e links para um quadro de dados, salve os resultados com write.csv() ou readr::write_csv(). Sempre inclua uma marca temporal ou a URL de origem para garantir a proveniência dos dados.
library(rvest)
html <- read_html('
<table>
<tr><th>Product</th><th>Price</th></tr>
<tr><td>Widget</td><td>9.99</td></tr>
<tr><td>Gadget</td><td>14.50</td></tr>
</table>
')
df <- html_table(html_element(html, 'table'))
# Add metadata
df$scraped_at <- Sys.time()
df$source_url <- 'https://example.com/products'
# Save to CSV
# write.csv(df, 'products.csv', row.names = FALSE)
print(df)
cat('Data ready for analysis or storage')Verificação rápida
Teste sua compreensão sobre a raspagem de tabelas HTML e links com rvest.
Recapitulação: tabelas e links
Principais conclusões: html_table() converte tabelas HTML em quadros de dados automaticamente; use fill=TRUE para tabelas irregulares. Para links, obtenha todas as âncoras com html_elements('a'), o texto com html_text2() e as URLs com html_attr('href'). Converta URLs relativas em absolutas com xml2::url_absolute(). Filtre links indesejados por padrão. Mescle o texto das tabelas com as URLs dos links incorporados para obter conjuntos de dados mais completos.
library(rvest)
# Table scraping pattern:
# tables <- html_table(html_elements(page, 'table'))
# df <- tables[[1]]
# Link scraping pattern:
# links <- html_elements(page, 'a[href]')
# data.frame(
# text = html_text2(links),
# url = xml2::url_absolute(
# html_attr(links, 'href'),
# base = base_url
# )
# )
# Combine: scrape table text AND embedded link URLs
cat('Tables + links = most of what the web offers')Perguntas Frequentes
A aula “Extraindo tabelas e links” é grátis?
Sim — o texto completo de “Extraindo tabelas e links” é grátis para ler aqui na web. Para praticá-la interativamente (um editor de código integrado e um tutor de IA 24/7) e desbloquear o restante do curso de R Academy, atualize para CoddyKit PRO. O curso de R Academy inclui 4 aulas no total.
O que vou aprender em “Extraindo tabelas e links”?
Analise tabelas HTML em quadros de dados e colete todos os hiperlinks de uma página. Você pratica R Academy com código prático que executa diretamente no navegador, e um tutor de IA 24/7 responde suas dúvidas enquanto trabalha na aula.
Preciso ter experiência prévia para começar R Academy?
Nenhuma experiência prévia é necessária. R Academy no CoddyKit é estruturado para alunos iniciantes até avançados, então você pode começar aqui ou desde o início e aprender no seu ritmo. Esta é a aula 3 de 4.
Quanto tempo leva a aula “Extraindo tabelas e links”?
A maioria das aulas CoddyKit leva cerca de 5–10 minutos. Cada uma é compacta e interativa, então você faz progresso constante e retoma exatamente de onde parou entre web e app.
Posso escrever e executar código nesta aula de R Academy?
Sim. Cada aula de R Academy inclui um editor de código integrado, então você escreve e executa código real direto no navegador e recebe feedback de IA instantaneamente — nenhuma configuração local necessária.
Todas as aulas deste curso
- Estrutura HTML e seletores CSS
- Fundamentos de html_element() e html_text()
- Extraindo tabelas e links
- Lidando com paginação e várias páginas