0Pricing
Python Academy · บทเรียน

การจัดการ JavaScript และมาตรการป้องกันการดึงข้อมูล

ใช้ Playwright/Selenium สำหรับเนื้อหาที่แสดงผลด้วย JS และการจำกัดอัตรา

การจัดการ JavaScript และมาตรการป้องกันการดึงข้อมูล เป็นบทเรียน Python Academy ฟรีบน CoddyKit นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Python Academy และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Python Academy มีบทเรียนทั้งหมด 4 บทเรียน

เหตุใด JavaScript จึงสำคัญ

เว็บไซต์สมัยใหม่แสดงผลเนื้อหาด้วย JavaScript หลังจากโหลดหน้าเว็บแล้ว ตัวแยกวิเคราะห์ HTML แบบคงที่อย่าง requests+BS4 จะเห็นเพียงโครงร่าง ไม่ใช่ DOM ที่แสดงผลแล้ว

# Static scraper sees:
# <div id="app"></div>

# Rendered page has:
# <div id="app">
#   <h1>Product List</h1>
#   <ul>... dynamically loaded items ...</ul>
# </div>

Playwright สำหรับ Python

Playwright ควบคุมเบราว์เซอร์จริง (Chromium, Firefox และ WebKit) ผ่านโปรแกรม โดยจะรอให้ JavaScript ทำงานเสร็จก่อนดึงเนื้อหา

# pip install playwright
# playwright install
import asyncio
from playwright.async_api import async_playwright

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()
        await page.goto("https://example.com")
        title = await page.inner_text("h1")
        print(title)
        await browser.close()

asyncio.run(main())

การรอองค์ประกอบ

ใช้ page.wait_for_selector() เพื่อรอจนกว่าองค์ประกอบจะปรากฏใน DOM ก่อนดึงข้อมูล

from playwright.async_api import async_playwright
import asyncio

async def scrape():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()
        await page.goto("https://spa-example.com")
        await page.wait_for_selector(".product-list")
        items = await page.query_selector_all(".product-item")
        texts = [await i.inner_text() for i in items]

Selenium

Selenium เป็นไลบรารีควบคุมเบราว์เซอร์รุ่นเก่า สำหรับโครงการใหม่มักเลือกใช้ Playwright มากกว่า เนื่องจากรองรับการทำงานแบบอะซิงโครนัสและมีความเร็วที่ดีกว่า

# pip install selenium
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

driver = webdriver.Chrome()
driver.get("https://example.com")
elem = WebDriverWait(driver, 10).until(
    EC.presence_of_element_located((By.CSS_SELECTOR, "h1"))
)
print(elem.text)
driver.quit()

โหมดไร้ส่วนติดต่อผู้ใช้

เรียกใช้เบราว์เซอร์ในโหมดไร้ส่วนติดต่อผู้ใช้ (ไม่มีหน้าต่างที่มองเห็นได้) สำหรับการดึงข้อมูลจากเว็บบนเซิร์ฟเวอร์

from playwright.async_api import async_playwright
import asyncio

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch(headless=True)  # no window
        page = await browser.new_page()
        await page.goto("https://example.com")
        html = await page.content()
        await browser.close()

การดักจับคำขอเครือข่าย

Playwright สามารถดักจับและจำลองคำขอเครือข่ายได้ ซึ่งมีประโยชน์สำหรับบล็อกโฆษณาและตัวติดตาม หรือดักรับการตอบกลับจาก API โดยตรง

from playwright.async_api import async_playwright
import asyncio

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()

        await page.route("**/*.{png,jpg,css}", lambda route: route.abort())
        await page.goto("https://example.com")   # loads 3x faster

การจำกัดอัตราและระยะหน่วง

เลียนแบบพฤติกรรมของมนุษย์: เพิ่มระยะหน่วงแบบสุ่มระหว่างคำขอและจำกัดอัตราการเรียกใช้ เพื่อหลีกเลี่ยงการเรียกใช้ระบบต่อต้านบอต

import time, random

def polite_scrape(urls):
    for url in urls:
        fetch(url)
        time.sleep(random.uniform(1, 3))  # 1-3 s random delay

การสลับ User-Agent

สลับสตริง User-Agent เพื่อหลีกเลี่ยงการถูกบล็อกเนื่องจากใช้ UA เริ่มต้นของตัวดึงข้อมูล

import requests, random

USER_AGENTS = [
    "Mozilla/5.0 (Windows NT 10.0; Win64; x64) ...",
    "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) ...",
]

def fetch(url):
    return requests.get(url, headers={"User-Agent": random.choice(USER_AGENTS)})

คุกกี้และเซสชัน

รักษาคุกกี้ของเซสชันไว้เพื่อให้ยังคงเข้าสู่ระบบระหว่างคำขอต่าง ๆ ทั้ง requests Session และ Playwright จัดการคุกกี้โดยอัตโนมัติ

import requests

with requests.Session() as s:
    s.post("https://example.com/login", data={"user":"me","pass":"pw"})
    # session cookie kept automatically:
    dashboard = s.get("https://example.com/dashboard")

CAPTCHA และข้อพิจารณาทางกฎหมาย

CAPTCHA เป็นมาตรการต่อต้านบอต การแก้ CAPTCHA ด้วยโปรแกรมสามารถทำได้ในทางเทคนิค (เช่น 2captcha และ anti-captcha) แต่ก่อให้เกิดข้อกังวลด้านจริยธรรมและกฎหมาย โปรดตรวจสอบ robots.txt และข้อกำหนดการให้บริการของเว็บไซต์ก่อนดึงข้อมูลเสมอ

# Before scraping:
# 1. Check robots.txt: https://example.com/robots.txt
# 2. Review the Terms of Service for "scraping" or "automated access" clauses
# 3. Only scrape public data
# 4. Honour Crawl-delay directives
# 5. Cache responses to avoid repeated hits

ภาพหน้าจอและ PDF ด้วย Playwright

Playwright สามารถจับภาพหน้าจอหรือพิมพ์หน้าเว็บเป็น PDF ได้ ซึ่งมีประโยชน์สำหรับการทดสอบด้วยภาพและการเก็บถาวร

from playwright.async_api import async_playwright
import asyncio

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()
        await page.goto("https://example.com")
        await page.screenshot(path="page.png", full_page=True)
        await page.pdf(path="page.pdf")
        await browser.close()

ตรวจสอบความเข้าใจ

เหตุใด requests และ BeautifulSoup จึงทำงานไม่ได้กับเว็บไซต์สมัยใหม่จำนวนมาก

สรุปทบทวน

ใช้ Playwright หรือ Selenium สำหรับหน้าเว็บที่แสดงผลด้วย JavaScript เรียกใช้ในโหมดไร้ส่วนติดต่อผู้ใช้สำหรับเซิร์ฟเวอร์ เพิ่มระยะหน่วงและสลับ User-Agent เพื่อหลีกเลี่ยงการถูกบล็อก ดักจับคำขอเครือข่ายเพื่อบล็อกตัวติดตาม และเคารพ robots.txt กับข้อกำหนดการให้บริการเสมอ

คำถามที่พบบ่อย

บทเรียน “การจัดการ JavaScript และมาตรการป้องกันการดึงข้อมูล” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “การจัดการ JavaScript และมาตรการป้องกันการดึงข้อมูล” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Python Academy ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Python Academy มีบทเรียนทั้งหมด 4 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “การจัดการ JavaScript และมาตรการป้องกันการดึงข้อมูล”

ใช้ Playwright/Selenium สำหรับเนื้อหาที่แสดงผลด้วย JS และการจำกัดอัตรา คุณปฏิบัติ Python Academy ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Python Academy หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน Python Academy บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 4 จากทั้งหมด 4 บทเรียน

บทเรียน “การจัดการ JavaScript และมาตรการป้องกันการดึงข้อมูล” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน Python Academy นี้ได้ไหม

ได้ บทเรียน Python Academy ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. คำขอ HTTP ด้วย requests และ httpx
  2. การแยกวิเคราะห์ HTML ด้วย BeautifulSoup
  3. การสร้างสไปเดอร์ Scrapy
  4. การจัดการ JavaScript และมาตรการป้องกันการดึงข้อมูล
← กลับไปที่ Python Academy