R Academy · Lektion

Hantera paginering och flera sidor

Iterera över paginerade resultat och kombinera scrapad data till en enda datamängd.

Lektion 4 av 413 steg

Hantera paginering och flera sidor är en gratis lektion i R Academy på CoddyKit. Detta är lektion 4 av 4. Du kan läsa vilka 3 lektioner som helst i den här lärvägen kostnadsfritt i sin helhet – därefter låser CoddyKit PRO upp alla lektioner, plus praktisk övning med en inbyggd kodredigerare och en AI-lärare dygnet runt. Den ingår i lärvägen för R Academy, och Era framsteg synkroniseras mellan webben och CoddyKit-appen. Kursen i R Academy innehåller totalt 4 lektioner.

Förstå paginering

Många webbplatser delar upp innehållet på flera sidor. URL-baserad paginering lägger till ett sidnummer i URL:en (till exempel ?page=2 eller /page/2/). Identifiera mönstret för att kunna konstruera URL:er programmatiskt.

library(rvest)

# Common URL pagination patterns:
# Pattern 1: query parameter
# https://site.com/products?page=1
# https://site.com/products?page=2

# Pattern 2: path segment
# https://site.com/products/page/1/
# https://site.com/products/page/2/

# Build URLs for pages 1 to 5
base_url <- 'https://books.toscrape.com/catalogue/page-'
page_urls <- paste0(base_url, 1:5, '.html')
page_urls
# [1] 'https://books.toscrape.com/catalogue/page-1.html'
# [2] 'https://books.toscrape.com/catalogue/page-2.html' ...

Skapa URL-mönster med sprintf

sprintf() och paste0() bygger båda URL-strängar, men sprintf() ger större kontroll över utfyllnad med nollor och formatering. Använd den funktion som bäst motsvarar webbplatsens URL-struktur.

# Various URL building approaches

# paste0 for simple concatenation
pages <- 1:5
urls_v1 <- paste0('https://site.com/list?p=', pages)
urls_v1[1]  # 'https://site.com/list?p=1'

# sprintf for formatted strings
urls_v2 <- sprintf('https://site.com/page/%02d/', pages)
urls_v2[1]  # 'https://site.com/page/01/'

# With multiple parameters
urls_v3 <- sprintf('https://site.com/items?page=%d&size=20', pages)
urls_v3[3]  # 'https://site.com/items?page=3&size=20'

# glue package alternative
# glue('https://site.com/page/{pages}')

Skrapa flera sidor med map()

purrr::map() tillämpar en skrapningsfunktion på en vektor med URL:er och returnerar en lista med resultat. Kombinera med dplyr::bind_rows() för att slå ihop resultaten till en data frame.

library(rvest)
library(purrr)

# Define a function to scrape one page
scrape_page <- function(url) {
  # In real code: page <- read_html(url)
  # Here we simulate with local HTML
  page <- read_html(sprintf(
    '<ul><li class="item">Item %d-A</li><li class="item">Item %d-B</li></ul>',
    url, url
  ))
  data.frame(
    title = html_text2(html_elements(page, '.item')),
    page  = url
  )
}

# Apply over pages 1 and 2 (simulated with numbers)
results <- map(1:2, scrape_page)
do.call(rbind, results)

Hänsynsfull skrapning: Sys.sleep()

Att skicka snabba upprepade förfrågningar till en server är ohövligt och kan utlösa hastighetsbegränsningar eller IP-blockeringar. Lägg till Sys.sleep() mellan förfrågningarna för att visa hänsyn till servern. En fördröjning på 1–2 sekunder är vanligtvis tillräcklig.

library(rvest)

# Polite scraping with delays between requests
scrape_with_delay <- function(urls, delay = 1.5) {
  results <- vector('list', length(urls))
  for (i in seq_along(urls)) {
    cat(sprintf('Scraping page %d of %d\n', i, length(urls)))
    # results[[i]] <- read_html(urls[[i]])
    Sys.sleep(delay)  # Wait before next request
  }
  results
}

# Also: randomize delay to appear more human-like
random_delay <- function(min = 1, max = 3) {
  Sys.sleep(runif(1, min = min, max = max))
}
random_delay()
cat('Always be polite to servers you scrape')

Ange en User Agent

Identifiera Er skrapare på ett hänsynsfullt sätt genom att ange en beskrivande User-Agent-header. Servrar använder denna för att identifiera bottar. En bra User-Agent innehåller Ert namn och Era kontaktuppgifter så att webbplatsägare kan nå Er.

library(rvest)

# Default user agent reveals R/rvest
# Better: set a descriptive, honest UA
ua <- paste0(
  'MyResearchBot/1.0 ',
  '(Academic research; ',
  'contact: researcher@university.edu)'
)

# With httr/httr2 for UA control:
# library(httr2)
# response <- request(url) |>
#   req_headers('User-Agent' = ua) |>
#   req_perform()
# html <- read_html(resp_body_string(response))

# Or use polite package for full compliance:
# library(polite)
# session <- bow('https://example.com', user_agent = ua)
cat('Honest UA: better for everyone')

Respektera robots.txt

robots.txt anger vilka sökvägar som inte får genomsökas. Paketet robotstxt låter Er kontrollera programmatiskt om en URL är tillåten innan Ni skrapar den.

library(rvest)
# library(robotstxt)  # uncomment to use

# Check if scraping is allowed:
# rtxt <- robotstxt(domain = 'books.toscrape.com')
# rtxt$check(paths = '/catalogue/', bot = '*')
# TRUE means allowed

# Robots.txt typically looks like:
# User-agent: *
# Disallow: /admin/
# Disallow: /private/
# Allow: /catalogue/
# Crawl-delay: 2

# The polite package combines UA + robots.txt + delays:
# library(polite)
# session <- bow('https://books.toscrape.com')
# page <- scrape(session)
cat('Always check robots.txt before large-scale scraping')

Följ pagineringslänkar

I stället för att gissa URL:er kan Ni följa den faktiska länken ”Next” på varje sida. html_attr(html_element(page, 'a.next'), 'href') hittar länken till nästa sida dynamiskt — även när pagineringen inte följer ett sekventiellt mönster.

library(rvest)

# Pattern: follow 'next' links dynamically
scrape_all_pages <- function(start_url, max_pages = 10) {
  all_data <- list()
  url <- start_url
  i <- 1
  while (!is.null(url) && i <= max_pages) {
    # page <- read_html(url)
    # data <- extract_data(page)
    # all_data[[i]] <- data
    # next_link <- html_attr(html_element(page, 'li.next a'), 'href')
    # url <- if (!is.na(next_link)) xml2::url_absolute(next_link, url)
    #        else NULL
    cat(sprintf('Would scrape page %d: %s\n', i, url))
    url <- NULL  # Stop in this demo
    i <- i + 1
  }
  do.call(rbind, all_data)
}
scrape_all_pages('https://books.toscrape.com')

session_follow_link() med rvest

rvests session() skapar en tillståndsbevarande webbläsarsession som behåller cookies och historik. session_follow_link() navigerar till en länk — vilket är användbart för webbplatser som kräver inloggning eller bevarar tillstånd mellan sidor.

library(rvest)
# Stateful session with rvest
# s <- session('https://example.com/login')
# s <- session_submit(s,
#   html_form(read_html(s))[[1]],
#   list(username='me', password='pw')
# )
# After login, navigate:
# page2 <- session_follow_link(s, 'Products')
# page3 <- session_back(page2)   # go back
# session_history(page2)         # show history

# For simple cases, follow href directly:
# href <- html_attr(html_element(page, 'a.next'), 'href')
# next_page <- session_jump_to(s, href)
cat('session() maintains cookies across requests')

Identifiera den sista sidan

Ta reda på när Ni ska sluta: kontrollera om knappen ”Next” finns, om antalet objekt på den aktuella sidan är mindre än förväntat eller om sidnumret överskrider ett känt totalantal. Hantera specialfall på ett robust sätt.

library(rvest)
# Strategy 1: Check if 'Next' link exists
has_next <- function(page) {
  next_link <- html_element(page, 'li.next a')
  !is.na(html_attr(next_link, 'href'))
}

# Strategy 2: Compare item count to expected page size
page_size <- 20
check_done <- function(items_on_page) {
  items_on_page < page_size
}

# Strategy 3: Read total from pagination text
# e.g., 'Page 1 of 50' -> extract 50
extract_total_pages <- function(page) {
  text <- html_text2(html_element(page, '.current'))
  as.integer(gsub('.*of (\\d+).*', '\\1', text))
}
cat('Always plan your stopping condition')

Hantera fel vid skrapning

Nätverksfel, tidsgränser och 404-fel kommer att inträffa. Omge förfrågningarna med tryCatch() för att hantera fel på ett robust sätt och logga vilka sidor som misslyckades, så att Ni kan försöka igen senare.

library(rvest)

safe_scrape <- function(url) {
  tryCatch({
    # page <- read_html(url)
    # data <- extract_data(page)
    # return(data)
    cat(sprintf('Scraping: %s\n', url))
    data.frame(url = url, status = 'ok')
  }, error = function(e) {
    cat(sprintf('FAILED: %s -> %s\n', url, e$message))
    data.frame(url = url, status = 'error')
  })
}

urls <- c('https://example.com/page/1',
          'https://example.com/page/2')
results <- lapply(urls, safe_scrape)
do.call(rbind, results)

Cachelagra skrapade sidor

Spara nedladdad HTML på disk innan Ni tolkar den. Om tolkningen misslyckas behöver Ni då inte ladda ner sidan igen. Vid nya läsningar hämtas sidan från disken i stället för nätverket — hänsynsfullt och snabbt under utvecklingen.

library(rvest)

scrape_cached <- function(url, cache_dir = 'cache') {
  dir.create(cache_dir, showWarnings = FALSE)
  # Create a filename from URL hash
  fname <- file.path(cache_dir,
    paste0(digest::digest(url), '.html'))
  if (file.exists(fname)) {
    cat('Loading from cache\n')
    return(read_html(fname))
  }
  cat('Downloading...\n')
  # page <- read_html(url)
  # xml2::write_html(page, fname)
  # return(page)
  cat('Cached to:', fname, '\n')
}

# Without digest: use URLencode or gsub
url <- 'https://example.com/page/1'
fname <- gsub('[^a-z0-9]', '_', tolower(url))
cat(fname)

Snabbkontroll

Testa Er förståelse av hänsynsfull och robust skrapning över flera sidor.

Repetition: Paginering och hänsynsfull skrapning

Viktiga punkter: Bygg sid-URL:er med paste0() eller sprintf(). Använd purrr::map() för att tillämpa skrapning på många URL:er. Lägg alltid till Sys.sleep() mellan förfrågningarna. Kontrollera robots.txt med paketet robotstxt. Följ länkar till ”Next” dynamiskt med html_attr() eller session_follow_link(). Identifiera den sista sidan genom att kontrollera om en Next-länk saknas. Omge förfrågningarna med tryCatch() för bättre feltålighet. Cachelagra HTML på disk under utvecklingen.

# Multi-page scraping template:
# urls <- paste0(base, 1:n_pages)
# results <- purrr::map(urls, function(url) {
#   Sys.sleep(runif(1, 1, 2))  # polite delay
#   page <- read_html(url)
#   extract_data(page)          # your parser
# })
# df <- dplyr::bind_rows(results)

# Key principles:
# 1. Respect robots.txt
# 2. Add delays (Sys.sleep)
# 3. Set honest User-Agent
# 4. Cache HTML during development
# 5. Handle errors with tryCatch
cat('Polite scraping = sustainable scraping')
Gratis att börja

Lär dig R med en AI-lärare – gratis

Skriv och kör riktig kod i webbläsaren, få omedelbar hjälp av en AI-lärare dygnet runt och fortsätt där du slutade – på webben eller i appen.

Kurser
43
Lektioner
159

Vanliga frågor

Är lektionen ”Hantera paginering och flera sidor” gratis?

Ja – du kan läsa vilka 3 lektioner som helst i lärvägen R Academy, inklusive ”Hantera paginering och flera sidor”, kostnadsfritt i sin helhet här på webben. Därefter låser CoddyKit PRO upp alla lektioner, plus interaktiv övning med en inbyggd kodredigerare och en AI-lärare dygnet runt. Kursen i R Academy innehåller totalt 4 lektioner.

Vad lär jag mig i ”Hantera paginering och flera sidor”?

Iterera över paginerade resultat och kombinera scrapad data till en enda datamängd. Ni övar på R Academy med praktisk kod som körs direkt i webbläsaren, medan en AI-handledare som är tillgänglig dygnet runt svarar på Era frågor under lektionen.

Behöver jag någon erfarenhet för att börja lära mig R Academy?

Du behöver inga förkunskaper. Utbildningen i R Academy på CoddyKit är upplagd för allt från nybörjare till avancerade elever, så att du kan börja här eller från början och gå fram i din egen takt. Detta är lektion 4 av 4.

Hur lång tid tar lektionen ”Hantera paginering och flera sidor”?

De flesta CoddyKit-lektioner tar cirka 5–10 minuter. Varje lektion är kort och interaktiv, så att du gör stadiga framsteg och kan fortsätta precis där du slutade – på webben eller i appen.

Kan jag skriva och köra kod i den här R Academy-lektionen?

Ja. Varje R Academy-lektion innehåller en inbyggd kodredigerare, så att du kan skriva och köra riktig kod direkt i webbläsaren och få omedelbar AI-feedback – utan lokal installation.

Alla lektioner i den här kursen

  1. HTML-struktur och CSS-selektorer
  2. Grunderna i html_element() och html_text()
  3. Scrapa tabeller och länkar
  4. Hantera paginering och flera sidor
← Tillbaka till R Academy