R Academy · Leçon

Extraire des tableaux et des liens

Analysez les tableaux HTML en data frames et collectez tous les hyperliens d’une page.

Leçon 3 sur 413 étapes

Extraire des tableaux et des liens est une leçon R Academy gratuite sur CoddyKit. Ceci est la leçon 3 sur 4. Tu peux lire la leçon complète ci-dessous gratuitement — puis la pratiquer en direct dans le navigateur avec un éditeur de code intégré et un tuteur IA 24/7. Elle fait partie du parcours d'apprentissage R Academy, et ta progression se synchronise sur le web et l'application CoddyKit. Le cours R Academy comprend 4 leçons au total.

Tableaux HTML dans les pages Web

Les tableaux HTML (<table>) sont les cibles les plus pratiques pour le moissonnage, car ils sont déjà structurés. La fonction html_table() de rvest les convertit directement en tableaux de données R, en traitant automatiquement les en-têtes.

library(rvest)
html <- read_html('
  <table>
    <thead><tr><th>Country</th><th>GDP</th><th>Pop</th></tr></thead>
    <tbody>
      <tr><td>USA</td><td>25T</td><td>330M</td></tr>
      <tr><td>China</td><td>18T</td><td>1400M</td></tr>
    </tbody>
  </table>
')
# html_table converts to data frame
tbl <- html_table(html_element(html, 'table'))
class(tbl)      # 'data.frame'
names(tbl)      # c('Country', 'GDP', 'Pop')
nrow(tbl)       # 2
print(tbl)

html_table() sur une page complète

Lorsqu’une page contient plusieurs tableaux, utilisez html_elements() (la forme plurielle) pour les récupérer tous, puis appliquez html_table() à l’ensemble de nœuds obtenu afin de renvoyer une liste de tableaux de données. Sélectionnez celui dont vous avez besoin à l’aide de son indice.

library(rvest)
html <- read_html('
  <table id="t1"><tr><th>A</th></tr><tr><td>1</td></tr></table>
  <table id="t2"><tr><th>X</th><th>Y</th></tr>
    <tr><td>10</td><td>20</td></tr></table>
')
# Get ALL tables as a list of data frames
tables <- html_table(html_elements(html, 'table'))
length(tables)  # 2

# First table
tables[[1]]

# Second table
tables[[2]]

# Select a specific table by its id
table2 <- html_table(html_element(html, '#t2'))
print(table2)

Nettoyer les données des tableaux

Les tableaux extraits des sites Web comportent souvent des en-têtes désordonnés, des cellules fusionnées ou des espaces superflus. Utilisez janitor::clean_names() pour les en-têtes, ainsi que les opérations usuelles de dplyr et stringr pour nettoyer les valeurs des cellules.

library(rvest)
html <- read_html('
  <table>
    <tr><th>Product Name</th><th>Price (USD)</th><th>In Stock?</th></tr>
    <tr><td>  Widget A  </td><td>$12.50</td><td>Yes</td></tr>
    <tr><td>Gadget B</td><td>$7.99</td><td>No</td></tr>
  </table>
')
df <- html_table(html_element(html, 'table'))

# Clean column names
names(df) <- c('product', 'price', 'in_stock')

# Strip whitespace and dollar signs
df$product  <- trimws(df$product)
df$price    <- as.numeric(gsub('[$]', '', df$price))
df$in_stock <- df$in_stock == 'Yes'
print(df)

Extraire tous les liens d’une page

Les liens sont des balises d’ancrage (<a>) dotées d’attributs href. Utilisez html_elements(page, 'a') pour récupérer toutes les ancres, puis html_attr('href') pour les URL et html_text2() pour le texte des liens.

library(rvest)
html <- read_html('
  <div>
    <a href="/about">About Us</a>
    <a href="/products">Products</a>
    <a href="https://partner.com" rel="external">Partner</a>
    <a>No href link</a>
  </div>
')
# Get all anchor elements
anchors <- html_elements(html, 'a')

# Extract text and href
link_text <- html_text2(anchors)
link_href <- html_attr(anchors, 'href')

data.frame(text = link_text, href = link_href)
# Note: last row has NA href

Filtrer les liens pertinents

Sur les pages réelles, les liens de navigation, de pied de page et les ancres internes sont mélangés aux liens qui vous intéressent réellement. Filtrez-les en supprimant les NA, les ancres (#) et les liens javascript:, puis appliquez une recherche par motif pour ne conserver que les URL pertinentes.

library(rvest)
html <- read_html('
  <div>
    <a href="/article/1">Article One</a>
    <a href="/article/2">Article Two</a>
    <a href="#top">Back to top</a>
    <a href="javascript:void(0)">JS link</a>
    <a href="/article/3">Article Three</a>
  </div>
')
anchors <- html_elements(html, 'a')
hrefs <- html_attr(anchors, 'href')
texts <- html_text2(anchors)

# Keep only article links
article_idx <- grepl('^/article/', hrefs) & !is.na(hrefs)
article_links <- data.frame(
  text = texts[article_idx],
  href = hrefs[article_idx]
)
print(article_links)

Des URL relatives aux URL absolues

Les valeurs href extraites sont souvent des chemins relatifs comme /page. Convertissez-les en URL absolues en ajoutant l’URL de base devant. La fonction xml2::url_absolute() s’en charge correctement.

library(rvest)
base_url <- 'https://books.toscrape.com'

html <- read_html('
  <ul>
    <li><a href="/catalogue/book1">Book One</a></li>
    <li><a href="/catalogue/book2">Book Two</a></li>
    <li><a href="https://external.com/book">External</a></li>
  </ul>
')
hrefs <- html_attr(html_elements(html, 'a'), 'href')

# xml2::url_absolute resolves relative + keeps absolute
abs_urls <- xml2::url_absolute(hrefs, base = base_url)
abs_urls
# 'https://books.toscrape.com/catalogue/book1'
# 'https://books.toscrape.com/catalogue/book2'
# 'https://external.com/book'  <- kept as-is

Extraction ciblée de liens

Au lieu d’extraire tous les liens puis de les filtrer, utilisez des sélecteurs CSS précis pour cibler uniquement ceux dont vous avez besoin. Combinez le contexte de l’élément et les sélecteurs d’attributs pour gagner en précision.

library(rvest)
html <- read_html('
  <nav class="breadcrumb">
    <a href="/">Home</a> > <a href="/books">Books</a>
  </nav>
  <ul class="products">
    <li><a href="/books/1" class="prod-link">Clean Code</a></li>
    <li><a href="/books/2" class="prod-link">Refactoring</a></li>
  </ul>
  <footer>
    <a href="/privacy">Privacy</a>
  </footer>
')
# Target ONLY product links (not nav or footer)
prod_links <- html_elements(html, 'ul.products a.prod-link')
data.frame(
  title = html_text2(prod_links),
  url   = html_attr(prod_links, 'href')
)

Fusionner les données des tableaux et des liens

Il arrive souvent que les cellules d’un tableau contiennent des liens. Combinez html_table() pour les valeurs textuelles avec html_attr() ciblé pour les liens intégrés afin de créer un tableau de données plus riche.

library(rvest)
html <- read_html('
  <table class="results">
    <tr><th>Book</th><th>Author</th></tr>
    <tr>
      <td><a href="/b/1">Clean Code</a></td>
      <td>Robert Martin</td>
    </tr>
    <tr>
      <td><a href="/b/2">Refactoring</a></td>
      <td>Martin Fowler</td>
    </tr>
  </table>
')
# Get text from table
df <- html_table(html_element(html, 'table'))

# Get links embedded in first column
links <- html_attr(html_elements(html, 'table td a'), 'href')
df$url <- links
print(df)

Paramètre fill de html_table()

Les tableaux HTML comportent parfois des cellules absentes ou des lignes dont la structure est irrégulière. Le paramètre fill=TRUE de html_table() remplit les valeurs manquantes avec NA au lieu de générer une erreur.

library(rvest)
html <- read_html('
  <table>
    <tr><th>Name</th><th>Score</th><th>Grade</th></tr>
    <tr><td>Alice</td><td>95</td><td>A</td></tr>
    <tr><td>Bob</td><td>80</td></tr>
  </table>
')
# Without fill=TRUE this may error on uneven rows
df <- html_table(html_element(html, 'table'), fill = TRUE)
print(df)
# Name  Score Grade
# Alice    95     A
# Bob      80  <NA>

# fill=TRUE is safe even when rows are uniform
is.na(df[2, 'Grade'])  # TRUE

Extraire les sources des images

Les images utilisent des attributs src (et parfois data-src pour le chargement différé). La même approche avec html_attr() permet d’extraire les URL des images afin de les télécharger ou de les cataloguer.

library(rvest)
html <- read_html('
  <div class="gallery">
    <img src="/img/photo1.jpg" alt="Sunset">
    <img src="/img/photo2.jpg" alt="Mountains">
    <img data-src="/img/lazy.jpg" class="lazy" alt="Lake">
  </div>
')
# Regular images
images <- html_elements(html, 'img')
srcs  <- html_attr(images, 'src')
alts  <- html_attr(images, 'alt')

data.frame(alt = alts, src = srcs)
# For lazy-loaded images check data-src
lazy_src <- html_attr(html_element(html, '.lazy'), 'data-src')
lazy_src  # '/img/lazy.jpg'

Enregistrer les données extraites

Après avoir extrait les tableaux et les liens dans un tableau de données, enregistrez les résultats avec write.csv() ou readr::write_csv(). Incluez toujours un horodatage ou l’URL source pour assurer la traçabilité des données.

library(rvest)
html <- read_html('
  <table>
    <tr><th>Product</th><th>Price</th></tr>
    <tr><td>Widget</td><td>9.99</td></tr>
    <tr><td>Gadget</td><td>14.50</td></tr>
  </table>
')
df <- html_table(html_element(html, 'table'))

# Add metadata
df$scraped_at <- Sys.time()
df$source_url <- 'https://example.com/products'

# Save to CSV
# write.csv(df, 'products.csv', row.names = FALSE)
print(df)
cat('Data ready for analysis or storage')

Vérification rapide

Vérifiez votre compréhension de l’extraction de tableaux HTML et de liens avec rvest.

Récapitulatif : tableaux et liens

À retenir : html_table() convertit automatiquement les tableaux HTML en tableaux de données ; utilisez fill=TRUE pour les tableaux irréguliers. Pour les liens, récupérez toutes les ancres avec html_elements('a'), le texte avec html_text2() et les URL avec html_attr('href'). Convertissez les URL relatives en URL absolues avec xml2::url_absolute(). Filtrez les liens indésirables par motif. Fusionnez le texte des tableaux et les URL des liens intégrés pour obtenir des jeux de données plus riches.

library(rvest)
# Table scraping pattern:
# tables <- html_table(html_elements(page, 'table'))
# df <- tables[[1]]

# Link scraping pattern:
# links <- html_elements(page, 'a[href]')
# data.frame(
#   text = html_text2(links),
#   url  = xml2::url_absolute(
#            html_attr(links, 'href'),
#            base = base_url
#          )
# )

# Combine: scrape table text AND embedded link URLs
cat('Tables + links = most of what the web offers')
Gratuit pour commencer

Apprends R avec un tuteur IA — gratuit

Écris et exécute du vrai code dans ton navigateur, obtiens de l'aide instantanée d'un tuteur IA disponible 24h/24, et reprends là où tu t'es arrêté sur le web ou dans l'app.

Cours
43
Leçons
159

Questions Fréquemment Posées

La leçon « Extraire des tableaux et des liens » est-elle gratuite ?

Oui — le texte complet de « Extraire des tableaux et des liens » est gratuit à lire ici sur le web. Pour la pratiquer de manière interactive (un éditeur de code intégré et un tuteur IA 24/7) et déverrouiller le reste du cours R Academy, passe à CoddyKit PRO. Le cours R Academy comprend 4 leçons au total.

Qu'est-ce que j'apprendrai dans « Extraire des tableaux et des liens » ?

Analysez les tableaux HTML en data frames et collectez tous les hyperliens d’une page. Tu pratiques R Academy avec du code pratique que tu exécutes directement dans le navigateur, et un tuteur IA 24/7 répond à tes questions au fur et à mesure que tu avances dans la leçon.

Dois-je avoir de l'expérience pour commencer R Academy ?

Aucune expérience préalable n'est requise. R Academy sur CoddyKit est structuré pour les débutants jusqu'aux apprenants avancés, donc tu peux commencer ici ou depuis le début et avancer à ton rythme. Ceci est la leçon 3 sur 4.

Combien de temps prend la leçon « Extraire des tableaux et des liens » ?

La plupart des leçons CoddyKit prennent environ 5–10 minutes. Chacune est courte et interactive, tu progresses régulièrement et tu repiques exactement où tu t'es arrêté sur le web et l'app.

Peux-tu écrire et exécuter du code dans cette leçon R Academy ?

Oui. Chaque leçon R Academy inclut un éditeur de code intégré, tu écris et exécutes du vrai code directement dans ton navigateur et tu reçois des retours IA instantanés — aucune configuration locale requise.

Toutes les leçons de ce cours

  1. Structure HTML et sélecteurs CSS
  2. Bases de html_element() et html_text()
  3. Extraire des tableaux et des liens
  4. Gérer la pagination et plusieurs pages
← Retour à R Academy