Mengendalikan Penomboran dan Berbilang Halaman
Lakukan gelung pada hasil bernombor dan gabungkan data yang dikikis menjadi satu set data.
Mengendalikan Penomboran dan Berbilang Halaman ialah pelajaran R Academy percuma di CoddyKit. Ini ialah pelajaran 4 daripada 4. Sebanyak 3 pelajaran dalam laluan pembelajaran ini boleh dibaca sepenuhnya secara percuma — selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan praktikal dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Pelajaran ini merupakan sebahagian daripada laluan pembelajaran R Academy, dan kemajuan anda disegerakkan merentas web serta aplikasi CoddyKit. Kursus R Academy merangkumi sejumlah 4 pelajaran.
Memahami Penomboran Halaman
Banyak laman web membahagikan kandungan kepada beberapa halaman. Penomboran halaman berasaskan URL menambahkan nombor halaman pada URL (contohnya, ?page=2 atau /page/2/). Kenal pasti coraknya untuk membina URL secara terprogram.
library(rvest)
# Common URL pagination patterns:
# Pattern 1: query parameter
# https://site.com/products?page=1
# https://site.com/products?page=2
# Pattern 2: path segment
# https://site.com/products/page/1/
# https://site.com/products/page/2/
# Build URLs for pages 1 to 5
base_url <- 'https://books.toscrape.com/catalogue/page-'
page_urls <- paste0(base_url, 1:5, '.html')
page_urls
# [1] 'https://books.toscrape.com/catalogue/page-1.html'
# [2] 'https://books.toscrape.com/catalogue/page-2.html' ...Membina Corak URL dengan sprintf
sprintf() dan paste0() kedua-duanya membina rentetan URL, tetapi sprintf() memberikan lebih kawalan terhadap pelapisan sifar dan pemformatan. Gunakan mana-mana yang sepadan dengan struktur URL laman tersebut.
# Various URL building approaches
# paste0 for simple concatenation
pages <- 1:5
urls_v1 <- paste0('https://site.com/list?p=', pages)
urls_v1[1] # 'https://site.com/list?p=1'
# sprintf for formatted strings
urls_v2 <- sprintf('https://site.com/page/%02d/', pages)
urls_v2[1] # 'https://site.com/page/01/'
# With multiple parameters
urls_v3 <- sprintf('https://site.com/items?page=%d&size=20', pages)
urls_v3[3] # 'https://site.com/items?page=3&size=20'
# glue package alternative
# glue('https://site.com/page/{pages}')Mengkikis Beberapa Halaman dengan map()
purrr::map() menggunakan fungsi pengikisan pada vektor URL dan mengembalikan senarai hasil. Gabungkannya dengan dplyr::bind_rows() untuk menggabungkan hasil menjadi satu bingkai data.
library(rvest)
library(purrr)
# Define a function to scrape one page
scrape_page <- function(url) {
# In real code: page <- read_html(url)
# Here we simulate with local HTML
page <- read_html(sprintf(
'<ul><li class="item">Item %d-A</li><li class="item">Item %d-B</li></ul>',
url, url
))
data.frame(
title = html_text2(html_elements(page, '.item')),
page = url
)
}
# Apply over pages 1 and 2 (simulated with numbers)
results <- map(1:2, scrape_page)
do.call(rbind, results)Pengikisan Berhemah: Sys.sleep()
Menghantar permintaan pantas kepada pelayan adalah tidak berhemah dan boleh mencetuskan pengehadan kadar atau sekatan IP. Tambahkan Sys.sleep() antara permintaan untuk menghormati pelayan. Kelewatan selama 1-2 saat biasanya mencukupi.
library(rvest)
# Polite scraping with delays between requests
scrape_with_delay <- function(urls, delay = 1.5) {
results <- vector('list', length(urls))
for (i in seq_along(urls)) {
cat(sprintf('Scraping page %d of %d\n', i, length(urls)))
# results[[i]] <- read_html(urls[[i]])
Sys.sleep(delay) # Wait before next request
}
results
}
# Also: randomize delay to appear more human-like
random_delay <- function(min = 1, max = 3) {
Sys.sleep(runif(1, min = min, max = max))
}
random_delay()
cat('Always be polite to servers you scrape')Menetapkan Ejen Pengguna
Kenal pasti pengikis anda dengan sopan dengan menetapkan pengepala Ejen Pengguna yang jelas. Pelayan menggunakan maklumat ini untuk mengenal pasti bot. Ejen Pengguna yang baik menyertakan nama dan maklumat hubungan anda supaya pemilik laman boleh menghubungi anda.
library(rvest)
# Default user agent reveals R/rvest
# Better: set a descriptive, honest UA
ua <- paste0(
'MyResearchBot/1.0 ',
'(Academic research; ',
'contact: researcher@university.edu)'
)
# With httr/httr2 for UA control:
# library(httr2)
# response <- request(url) |>
# req_headers('User-Agent' = ua) |>
# req_perform()
# html <- read_html(resp_body_string(response))
# Or use polite package for full compliance:
# library(polite)
# session <- bow('https://example.com', user_agent = ua)
cat('Honest UA: better for everyone')Menghormati robots.txt
robots.txt memberitahu perayap laluan yang dilarang diakses. Pakej robotstxt membolehkan anda menyemak secara terprogram sama ada sesuatu URL dibenarkan sebelum mengikisnya.
library(rvest)
# library(robotstxt) # uncomment to use
# Check if scraping is allowed:
# rtxt <- robotstxt(domain = 'books.toscrape.com')
# rtxt$check(paths = '/catalogue/', bot = '*')
# TRUE means allowed
# Robots.txt typically looks like:
# User-agent: *
# Disallow: /admin/
# Disallow: /private/
# Allow: /catalogue/
# Crawl-delay: 2
# The polite package combines UA + robots.txt + delays:
# library(polite)
# session <- bow('https://books.toscrape.com')
# page <- scrape(session)
cat('Always check robots.txt before large-scale scraping')Mengikuti Pautan Penomboran Halaman
Daripada meneka URL, ikuti pautan 'Seterusnya' sebenar pada setiap halaman. html_attr(html_element(page, 'a.next'), 'href') mencari pautan halaman seterusnya secara dinamik — dan mengendalikan corak penomboran halaman yang tidak berjujukan.
library(rvest)
# Pattern: follow 'next' links dynamically
scrape_all_pages <- function(start_url, max_pages = 10) {
all_data <- list()
url <- start_url
i <- 1
while (!is.null(url) && i <= max_pages) {
# page <- read_html(url)
# data <- extract_data(page)
# all_data[[i]] <- data
# next_link <- html_attr(html_element(page, 'li.next a'), 'href')
# url <- if (!is.na(next_link)) xml2::url_absolute(next_link, url)
# else NULL
cat(sprintf('Would scrape page %d: %s\n', i, url))
url <- NULL # Stop in this demo
i <- i + 1
}
do.call(rbind, all_data)
}
scrape_all_pages('https://books.toscrape.com')session_follow_link() dengan rvest
session() rvest mencipta sesi penyemakan imbas berkeadaan yang mengekalkan kuki dan sejarah. session_follow_link() menavigasi ke sesuatu pautan — berguna untuk laman yang memerlukan log masuk atau mengekalkan keadaan merentas halaman.
library(rvest)
# Stateful session with rvest
# s <- session('https://example.com/login')
# s <- session_submit(s,
# html_form(read_html(s))[[1]],
# list(username='me', password='pw')
# )
# After login, navigate:
# page2 <- session_follow_link(s, 'Products')
# page3 <- session_back(page2) # go back
# session_history(page2) # show history
# For simple cases, follow href directly:
# href <- html_attr(html_element(page, 'a.next'), 'href')
# next_page <- session_jump_to(s, href)
cat('session() maintains cookies across requests')Mengesan Halaman Terakhir
Ketahui masa untuk berhenti: semak sama ada butang 'Seterusnya' wujud, sama ada bilangan item pada halaman semasa kurang daripada yang dijangka atau sama ada nombor halaman melebihi jumlah yang diketahui. Kendalikan kes pinggiran dengan baik.
library(rvest)
# Strategy 1: Check if 'Next' link exists
has_next <- function(page) {
next_link <- html_element(page, 'li.next a')
!is.na(html_attr(next_link, 'href'))
}
# Strategy 2: Compare item count to expected page size
page_size <- 20
check_done <- function(items_on_page) {
items_on_page < page_size
}
# Strategy 3: Read total from pagination text
# e.g., 'Page 1 of 50' -> extract 50
extract_total_pages <- function(page) {
text <- html_text2(html_element(page, '.current'))
as.integer(gsub('.*of (\\d+).*', '\\1', text))
}
cat('Always plan your stopping condition')Mengendalikan Ralat Pengikisan
Ralat rangkaian, tamat masa dan ralat 404 akan berlaku. Bungkus permintaan dalam tryCatch() untuk mengendalikan kegagalan dengan baik dan catat halaman yang gagal supaya anda boleh mencubanya semula kemudian.
library(rvest)
safe_scrape <- function(url) {
tryCatch({
# page <- read_html(url)
# data <- extract_data(page)
# return(data)
cat(sprintf('Scraping: %s\n', url))
data.frame(url = url, status = 'ok')
}, error = function(e) {
cat(sprintf('FAILED: %s -> %s\n', url, e$message))
data.frame(url = url, status = 'error')
})
}
urls <- c('https://example.com/page/1',
'https://example.com/page/2')
results <- lapply(urls, safe_scrape)
do.call(rbind, results)Menyimpan Cache Halaman yang Dikikis
Simpan HTML yang dimuat turun ke cakera sebelum menghuraikannya. Dengan cara ini, jika penghuraian gagal, anda tidak perlu memuat turun semula. Bacaan semula datang daripada cakera, bukannya rangkaian — lebih berhemah dan pantas semasa pembangunan.
library(rvest)
scrape_cached <- function(url, cache_dir = 'cache') {
dir.create(cache_dir, showWarnings = FALSE)
# Create a filename from URL hash
fname <- file.path(cache_dir,
paste0(digest::digest(url), '.html'))
if (file.exists(fname)) {
cat('Loading from cache\n')
return(read_html(fname))
}
cat('Downloading...\n')
# page <- read_html(url)
# xml2::write_html(page, fname)
# return(page)
cat('Cached to:', fname, '\n')
}
# Without digest: use URLencode or gsub
url <- 'https://example.com/page/1'
fname <- gsub('[^a-z0-9]', '_', tolower(url))
cat(fname)Ujian Ringkas
Uji pemahaman anda tentang pengikisan berbilang halaman yang berhemah dan kukuh.
Ikhtisar: Penomboran Halaman dan Pengikisan Berhemah
Perkara penting: Bina URL halaman dengan paste0() atau sprintf(). Gunakan purrr::map() untuk menggunakan pengikisan pada banyak URL. Sentiasa tambahkan Sys.sleep() antara permintaan. Semak robots.txt dengan pakej robotstxt. Ikuti pautan 'Seterusnya' secara dinamik dengan html_attr() atau session_follow_link(). Kesan halaman terakhir dengan menyemak pautan Seterusnya yang tiada. Bungkus permintaan dalam tryCatch() untuk daya tahan terhadap ralat. Simpan HTML dalam cache ke cakera semasa pembangunan.
# Multi-page scraping template:
# urls <- paste0(base, 1:n_pages)
# results <- purrr::map(urls, function(url) {
# Sys.sleep(runif(1, 1, 2)) # polite delay
# page <- read_html(url)
# extract_data(page) # your parser
# })
# df <- dplyr::bind_rows(results)
# Key principles:
# 1. Respect robots.txt
# 2. Add delays (Sys.sleep)
# 3. Set honest User-Agent
# 4. Cache HTML during development
# 5. Handle errors with tryCatch
cat('Polite scraping = sustainable scraping')Pelajari R dengan tutor kecerdasan buatan — percuma
Tulis dan jalankan kod sebenar dalam pelayar anda, dapatkan bantuan segera daripada tutor kecerdasan buatan yang tersedia 24/7, dan sambung semula dari tempat anda berhenti di web atau dalam aplikasi.
- Kursus
- 43
- Pelajaran
- 159
Soalan Lazim
Adakah pelajaran “Mengendalikan Penomboran dan Berbilang Halaman” percuma?
Ya — sebanyak 3 pelajaran dalam laluan pembelajaran R Academy, termasuk “Mengendalikan Penomboran dan Berbilang Halaman”, boleh dibaca sepenuhnya secara percuma di web ini. Selepas itu, CoddyKit PRO membuka akses kepada semua pelajaran, serta latihan interaktif dengan penyunting kod terbina dalam dan tutor kecerdasan buatan yang tersedia 24/7. Kursus R Academy merangkumi sejumlah 4 pelajaran.
Apakah yang akan saya pelajari dalam “Mengendalikan Penomboran dan Berbilang Halaman”?
Lakukan gelung pada hasil bernombor dan gabungkan data yang dikikis menjadi satu set data. Anda berlatih R Academy menggunakan kod praktikal yang dijalankan terus dalam pelayar, manakala tutor kecerdasan buatan 24/7 menjawab soalan anda semasa anda mengikuti pelajaran.
Adakah saya memerlukan pengalaman untuk memulakan R Academy?
Tiada pengalaman terdahulu diperlukan. Pembelajaran R Academy di CoddyKit disusun untuk pelajar daripada peringkat pemula hingga lanjutan, jadi anda boleh bermula di sini atau dari awal dan belajar mengikut kadar anda sendiri. Ini ialah pelajaran 4 daripada 4.
Berapa lamakah pelajaran “Mengendalikan Penomboran dan Berbilang Halaman” diambil?
Kebanyakan pelajaran CoddyKit mengambil masa kira-kira 5–10 minit. Setiap pelajaran ringkas dan interaktif, jadi anda boleh membuat kemajuan secara berterusan dan menyambung tepat dari tempat anda berhenti di web atau aplikasi.
Bolehkah saya menulis dan menjalankan kod dalam pelajaran R Academy ini?
Ya. Setiap pelajaran R Academy menyertakan penyunting kod terbina dalam, jadi anda boleh menulis dan menjalankan kod sebenar terus dalam pelayar serta menerima maklum balas kecerdasan buatan serta-merta — tanpa memerlukan persediaan setempat.
Semua pelajaran dalam kursus ini
- Struktur HTML dan Pemilih CSS
- Asas html_element() dan html_text()
- Mengkikis Jadual dan Pautan
- Mengendalikan Penomboran dan Berbilang Halaman