0Pricing
Python Academy · レッスン

JavaScript とスクレイピング対策への対応

JS で生成されるコンテンツには Playwright/Selenium を使い、レート制限にも対応します。

「JavaScript とスクレイピング対策への対応」はCoddyKit上の無料Python Academyレッスンです。 これはレッスン4/4です。 下記で完全なレッスンを無料で読むことができます。その後、ブラウザ内の組み込みコードエディタと24時間対応のAIチューターでハンズオン演習できます。 これはPython Academy学習パスの一部であり、ウェブとCoddyKitアプリ全体で進捗が同期されます。 Python Academyコースには全4レッスンが含まれています。

JavaScriptが重要な理由

現在のWebサイトでは、ページの読み込み後にJavaScriptでコンテンツを描画します。requests+BS4のような静的HTMLスクレイパーから見えるのは、描画後のDOMではなく骨組みだけです。

# Static scraper sees:
# <div id="app"></div>

# Rendered page has:
# <div id="app">
#   <h1>Product List</h1>
#   <ul>... dynamically loaded items ...</ul>
# </div>

Python向けPlaywright

Playwrightは、Chromium、Firefox、WebKitなどの実際のブラウザーをプログラムから操作します。コンテンツを抽出する前にJavaScriptの実行を待機します。

# pip install playwright
# playwright install
import asyncio
from playwright.async_api import async_playwright

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()
        await page.goto("https://example.com")
        title = await page.inner_text("h1")
        print(title)
        await browser.close()

asyncio.run(main())

要素の待機

データを抽出する前にDOMへ要素が現れるまで待機するには、page.wait_for_selector() を使います。

from playwright.async_api import async_playwright
import asyncio

async def scrape():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()
        await page.goto("https://spa-example.com")
        await page.wait_for_selector(".product-list")
        items = await page.query_selector_all(".product-item")
        texts = [await i.inner_text() for i in items]

Selenium

Seleniumは以前から使われているブラウザー自動化ライブラリです。非同期処理のサポートと速度に優れているため、新しいプロジェクトではPlaywrightが推奨されます。

# pip install selenium
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

driver = webdriver.Chrome()
driver.get("https://example.com")
elem = WebDriverWait(driver, 10).until(
    EC.presence_of_element_located((By.CSS_SELECTOR, "h1"))
)
print(elem.text)
driver.quit()

ヘッドレスモード

サーバー側のスクレイピングでは、ブラウザーをヘッドレスモード(画面にウィンドウを表示しないモード)で実行します。

from playwright.async_api import async_playwright
import asyncio

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch(headless=True)  # no window
        page = await browser.new_page()
        await page.goto("https://example.com")
        html = await page.content()
        await browser.close()

ネットワークリクエストの横取り

Playwrightではネットワークリクエストを横取りしてモックできます。広告やトラッカーのブロック、APIレスポンスの直接取得などに便利です。

from playwright.async_api import async_playwright
import asyncio

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()

        await page.route("**/*.{png,jpg,css}", lambda route: route.abort())
        await page.goto("https://example.com")   # loads 3x faster

レート制限と遅延

リクエストの間にランダムな遅延を追加し、リクエストの頻度を制限して、人間の操作を模倣します。これにより、アンチボットシステムの作動を避けやすくなります。

import time, random

def polite_scrape(urls):
    for url in urls:
        fetch(url)
        time.sleep(random.uniform(1, 3))  # 1-3 s random delay

User-Agentのローテーション

User-Agent文字列をローテーションし、スクレイパーのデフォルトUAを理由にブロックされるのを避けます。

import requests, random

USER_AGENTS = [
    "Mozilla/5.0 (Windows NT 10.0; Win64; x64) ...",
    "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) ...",
]

def fetch(url):
    return requests.get(url, headers={"User-Agent": random.choice(USER_AGENTS)})

Cookieとセッション

セッションCookieを維持して、複数のリクエスト間でログイン状態を保ちます。requests SessionとPlaywrightは、どちらもCookieを自動的に処理します。

import requests

with requests.Session() as s:
    s.post("https://example.com/login", data={"user":"me","pass":"pw"})
    # session cookie kept automatically:
    dashboard = s.get("https://example.com/dashboard")

CAPTCHAと法的な考慮事項

CAPTCHAはアンチボット対策です。プログラムで解決することは技術的には可能ですが(2captcha、anti-captcha)、倫理的・法的な問題があります。スクレイピングの前に、必ずサイトのrobots.txtと利用規約を確認してください。

# Before scraping:
# 1. Check robots.txt: https://example.com/robots.txt
# 2. Review the Terms of Service for "scraping" or "automated access" clauses
# 3. Only scrape public data
# 4. Honour Crawl-delay directives
# 5. Cache responses to avoid repeated hits

PlaywrightによるスクリーンショットとPDF

Playwrightではページのスクリーンショットを撮影したり、PDFに出力したりできます。ビジュアルテストやアーカイブに便利です。

from playwright.async_api import async_playwright
import asyncio

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()
        await page.goto("https://example.com")
        await page.screenshot(path="page.png", full_page=True)
        await page.pdf(path="page.pdf")
        await browser.close()

確認問題

多くの最新Webサイトでrequests + BeautifulSoupが機能しないのはなぜですか。

復習

JavaScriptで描画されるページにはPlaywrightまたはSeleniumを使います。サーバーではヘッドレスモードで実行します。ブロックを避けるために遅延を追加し、User-Agentをローテーションします。ネットワークリクエストを横取りしてトラッカーをブロックします。必ずrobots.txtと利用規約を尊重してください。

よくある質問

「JavaScript とスクレイピング対策への対応」レッスンは無料ですか?

はい。「JavaScript とスクレイピング対策への対応」の完全なテキストはこのウェブで無料で読めます。インタラクティブに演習し(組み込みコードエディタと24時間対応のAIチューター)、Python Academyコースの残りをアンロックするには、CoddyKit PROにアップグレードしてください。 Python Academyコースには全4レッスンが含まれています。

「JavaScript とスクレイピング対策への対応」で何を学びますか?

JS で生成されるコンテンツには Playwright/Selenium を使い、レート制限にも対応します。 ブラウザで直接実行するハンズオンコードでPython Academyを演習し、24時間対応のAIチューターがレッスンを進める中での質問に答えます。

Python Academyを始めるのに経験は必要ですか?

事前経験は必要ありません。CoddyKitのPython Academyは初級者から上級者向けに構成されているため、ここから始めるか最初から始めて、自分のペースで進むことができます。 これはレッスン4/4です。

「JavaScript とスクレイピング対策への対応」レッスンにはどのくらい時間がかかりますか?

ほとんどのCoddyKitレッスンは約5~10分かかります。各レッスンはコンパクトでインタラクティブなので、着実に進歩し、ウェブとアプリ全体で正確に前回の場所から再開できます。

このPython Academyレッスンでコードを書いて実行できますか?

はい。すべてのPython Academyレッスンに組み込みコードエディタが含まれているため、ブラウザでリアルコードを書いて実行し、即座のAIフィードバックを取得できます。ローカル設定は不要です。

このコースのすべてのレッスン

  1. requests と httpx による HTTP リクエスト
  2. BeautifulSoup による HTML の解析
  3. Scrapy スパイダーの作成
  4. JavaScript とスクレイピング対策への対応
← Python Academyに戻る