0Pricing
Python Academy · 课时

处理 JavaScript 与反爬措施

使用 Playwright/Selenium 处理由 JS 渲染的内容和速率限制。

处理 JavaScript 与反爬措施 是 CoddyKit 上的免费 Python Academy 课时。 这是第 4 节课,共 4 节。 你可以在下方免费阅读本课时的完整内容 — 然后在浏览器中使用内置代码编辑器和全天候 AI 导师进行实践。 这是 Python Academy 学习路径的一部分,你的进度在网页和 CoddyKit 应用中同步。 Python Academy 课程共包含 4 节课。

JavaScript 为什么重要

现代网站会在页面加载后使用 JavaScript 渲染内容。像 requests+BS4 这样的静态 HTML 抓取工具只能看到页面骨架,看不到渲染后的 DOM。

# Static scraper sees:
# <div id="app"></div>

# Rendered page has:
# <div id="app">
#   <h1>Product List</h1>
#   <ul>... dynamically loaded items ...</ul>
# </div>

用于 Python 的 Playwright

Playwright 可以通过编程方式控制真实浏览器(Chromium、Firefox、WebKit)。它会等待 JavaScript 执行完毕后再提取内容。

# pip install playwright
# playwright install
import asyncio
from playwright.async_api import async_playwright

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()
        await page.goto("https://example.com")
        title = await page.inner_text("h1")
        print(title)
        await browser.close()

asyncio.run(main())

等待元素

使用 page.wait_for_selector(),等待元素出现在 DOM 中后再提取数据。

from playwright.async_api import async_playwright
import asyncio

async def scrape():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()
        await page.goto("https://spa-example.com")
        await page.wait_for_selector(".product-list")
        items = await page.query_selector_all(".product-item")
        texts = [await i.inner_text() for i in items]

Selenium

Selenium 是较早的浏览器自动化库。由于异步支持更好、速度更快,新项目通常更推荐 Playwright。

# pip install selenium
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

driver = webdriver.Chrome()
driver.get("https://example.com")
elem = WebDriverWait(driver, 10).until(
    EC.presence_of_element_located((By.CSS_SELECTOR, "h1"))
)
print(elem.text)
driver.quit()

无头模式

在无头模式下运行浏览器(不显示窗口),用于服务器端抓取。

from playwright.async_api import async_playwright
import asyncio

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch(headless=True)  # no window
        page = await browser.new_page()
        await page.goto("https://example.com")
        html = await page.content()
        await browser.close()

拦截网络请求

Playwright 可以拦截并模拟网络请求,这对于屏蔽广告和跟踪器,或直接捕获 API 响应很有用。

from playwright.async_api import async_playwright
import asyncio

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()

        await page.route("**/*.{png,jpg,css}", lambda route: route.abort())
        await page.goto("https://example.com")   # loads 3x faster

速率限制和延迟

模拟人类行为:在请求之间添加随机延迟并限制请求速率,避免触发反机器人系统。

import time, random

def polite_scrape(urls):
    for url in urls:
        fetch(url)
        time.sleep(random.uniform(1, 3))  # 1-3 s random delay

用户代理轮换

轮换 User-Agent 字符串,避免因使用默认抓取工具 UA 而被阻止。

import requests, random

USER_AGENTS = [
    "Mozilla/5.0 (Windows NT 10.0; Win64; x64) ...",
    "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) ...",
]

def fetch(url):
    return requests.get(url, headers={"User-Agent": random.choice(USER_AGENTS)})

Cookie 和会话

维护会话 Cookie,以便在多个请求之间保持登录状态。requests Session 和 Playwright 都会自动处理 Cookie。

import requests

with requests.Session() as s:
    s.post("https://example.com/login", data={"user":"me","pass":"pw"})
    # session cookie kept automatically:
    dashboard = s.get("https://example.com/dashboard")

CAPTCHA 和法律注意事项

CAPTCHA 是反机器人措施。以编程方式解决 CAPTCHA 在技术上是可行的(2captcha、anti-captcha),但会带来道德和法律方面的疑虑。抓取之前,请务必查看网站的 robots.txt 和服务条款。

# Before scraping:
# 1. Check robots.txt: https://example.com/robots.txt
# 2. Review the Terms of Service for "scraping" or "automated access" clauses
# 3. Only scrape public data
# 4. Honour Crawl-delay directives
# 5. Cache responses to avoid repeated hits

Playwright 截图和 PDF

Playwright 可以对页面截图,或将页面打印为 PDF,适用于视觉测试和归档。

from playwright.async_api import async_playwright
import asyncio

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()
        await page.goto("https://example.com")
        await page.screenshot(path="page.png", full_page=True)
        await page.pdf(path="page.pdf")
        await browser.close()

快速检查

为什么 requests + BeautifulSoup 在许多现代网站上会失效?

回顾

对于由 JavaScript 渲染的页面,请使用 Playwright 或 Selenium。在服务器上使用无头模式运行。添加延迟并轮换 User-Agent,以避免被阻止。拦截网络请求来屏蔽跟踪器。始终遵守 robots.txt 和服务条款。

常见问题解答

「处理 JavaScript 与反爬措施」课时是免费的吗?

是的 — 「处理 JavaScript 与反爬措施」的完整文本可在网页上免费阅读。要进行交互式练习(内置代码编辑器和全天候 AI 导师)并解锁 Python Academy 课程的其余内容,请升级到 CoddyKit PRO。 Python Academy 课程共包含 4 节课。

「处理 JavaScript 与反爬措施」这节课中我会学到什么?

使用 Playwright/Selenium 处理由 JS 渲染的内容和速率限制。 你通过在浏览器中直接运行的动手代码来练习 Python Academy,全天候 AI 导师会在你学习这节课的过程中回答你的问题。

学习 Python Academy 需要有经验吗?

无需任何先前经验。CoddyKit 上的 Python Academy 课程适合初学者到高级学习者,你可以从这里开始或从头开始,按照自己的节奏学习。 这是第 4 节课,共 4 节。

「处理 JavaScript 与反爬措施」课时需要多长时间?

大多数 CoddyKit 课程大约需要 5–10 分钟。每节课都很精短且互动,所以你能稳步进步,并在网页和应用中从离开的地方继续。

我能在这节 Python Academy 课中编写并运行代码吗?

能。每节 Python Academy 课都包含内置代码编辑器,你可以在浏览器中直接编写并运行真实代码,并获得即时 AI 反馈 — 无需本地设置。

此课程中的所有课时

  1. 使用 requests 和 httpx 发起 HTTP 请求
  2. 使用 BeautifulSoup 解析 HTML
  3. 构建 Scrapy 爬虫
  4. 处理 JavaScript 与反爬措施
← 返回 Python Academy