0Pricing
Python Academy · Lekcja

Obsługa JavaScriptu i zabezpieczeń przed scrapingiem

Proszę używać Playwright/Selenium do treści renderowanych przez JS oraz ograniczania częstotliwości żądań.

Obsługa JavaScriptu i zabezpieczeń przed scrapingiem to bezpłatna lekcja Python Academy na CoddyKit. To lekcja 4 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Python Academy, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Python Academy zawiera 4 lekcji w sumie.

Dlaczego JavaScript ma znaczenie

Nowoczesne witryny renderują treść za pomocą JavaScriptu po załadowaniu strony. Scrapery statycznego HTML, takie jak requests+BS4, widzą szkielet, a nie wyrenderowany DOM.

# Static scraper sees:
# <div id="app"></div>

# Rendered page has:
# <div id="app">
#   <h1>Product List</h1>
#   <ul>... dynamically loaded items ...</ul>
# </div>

Playwright dla Pythona

Playwright programowo steruje prawdziwą przeglądarką (Chromium, Firefox, WebKit). Przed wydobyciem treści czeka na wykonanie kodu JavaScript.

# pip install playwright
# playwright install
import asyncio
from playwright.async_api import async_playwright

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()
        await page.goto("https://example.com")
        title = await page.inner_text("h1")
        print(title)
        await browser.close()

asyncio.run(main())

Oczekiwanie na elementy

page.wait_for_selector() należy używać do oczekiwania na pojawienie się elementu w DOM przed wydobyciem danych.

from playwright.async_api import async_playwright
import asyncio

async def scrape():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()
        await page.goto("https://spa-example.com")
        await page.wait_for_selector(".product-list")
        items = await page.query_selector_all(".product-item")
        texts = [await i.inner_text() for i in items]

Selenium

Selenium to starsza biblioteka do automatyzacji przeglądarek. W nowych projektach preferowany jest Playwright ze względu na lepszą obsługę asynchroniczności i większą szybkość.

# pip install selenium
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

driver = webdriver.Chrome()
driver.get("https://example.com")
elem = WebDriverWait(driver, 10).until(
    EC.presence_of_element_located((By.CSS_SELECTOR, "h1"))
)
print(elem.text)
driver.quit()

Tryb headless

Przeglądarki należy uruchamiać w trybie headless, czyli bez widocznego okna, na potrzeby scrapingu po stronie serwera.

from playwright.async_api import async_playwright
import asyncio

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch(headless=True)  # no window
        page = await browser.new_page()
        await page.goto("https://example.com")
        html = await page.content()
        await browser.close()

Przechwytywanie żądań sieciowych

Playwright może przechwytywać i mockować żądania sieciowe, co jest przydatne do blokowania reklam i modułów śledzących lub bezpośredniego przechwytywania odpowiedzi interfejsu API.

from playwright.async_api import async_playwright
import asyncio

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()

        await page.route("**/*.{png,jpg,css}", lambda route: route.abort())
        await page.goto("https://example.com")   # loads 3x faster

Ograniczanie częstotliwości i opóźnienia

Należy naśladować zachowanie człowieka: dodawać losowe opóźnienia między żądaniami i ograniczać ich częstotliwość, aby uniknąć uruchomienia systemów antybotowych.

import time, random

def polite_scrape(urls):
    for url in urls:
        fetch(url)
        time.sleep(random.uniform(1, 3))  # 1-3 s random delay

Rotacja User-Agentów

Należy rotować ciągi User-Agent, aby uniknąć blokady na podstawie domyślnego identyfikatora UA scrapera.

import requests, random

USER_AGENTS = [
    "Mozilla/5.0 (Windows NT 10.0; Win64; x64) ...",
    "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) ...",
]

def fetch(url):
    return requests.get(url, headers={"User-Agent": random.choice(USER_AGENTS)})

Pliki cookie i sesje

Należy zachowywać pliki cookie sesji, aby pozostać zalogowanym między żądaniami. Zarówno requests Session, jak i Playwright automatycznie obsługują pliki cookie.

import requests

with requests.Session() as s:
    s.post("https://example.com/login", data={"user":"me","pass":"pw"})
    # session cookie kept automatically:
    dashboard = s.get("https://example.com/dashboard")

CAPTCHA i kwestie prawne

CAPTCHA to zabezpieczenia przeciw botom. Programowe rozwiązywanie takich zabezpieczeń jest technicznie możliwe (2captcha, anti-captcha), ale budzi wątpliwości etyczne i prawne. Przed rozpoczęciem scrapingu należy zawsze zapoznać się z plikiem robots.txt witryny i jej regulaminem.

# Before scraping:
# 1. Check robots.txt: https://example.com/robots.txt
# 2. Review the Terms of Service for "scraping" or "automated access" clauses
# 3. Only scrape public data
# 4. Honour Crawl-delay directives
# 5. Cache responses to avoid repeated hits

Zrzuty ekranu i PDF w Playwright

Playwright może wykonywać zrzuty ekranu lub drukować strony do PDF — jest to przydatne w testach wizualnych i archiwizacji.

from playwright.async_api import async_playwright
import asyncio

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()
        await page.goto("https://example.com")
        await page.screenshot(path="page.png", full_page=True)
        await page.pdf(path="page.pdf")
        await browser.close()

Szybkie sprawdzenie

Dlaczego requests + BeautifulSoup nie działają w przypadku wielu nowoczesnych witryn?

Podsumowanie

Do stron renderowanych przez JavaScript należy używać Playwright lub Selenium. Na serwerach należy uruchamiać je w trybie headless. Aby uniknąć blokad, należy dodawać opóźnienia i rotować identyfikatory User-Agent. Żądania sieciowe można przechwytywać w celu blokowania modułów śledzących. Należy zawsze przestrzegać robots.txt i regulaminu usługi.

Często zadawane pytania

Czy lekcja „Obsługa JavaScriptu i zabezpieczeń przed scrapingiem” jest bezpłatna?

Tak — pełny tekst „Obsługa JavaScriptu i zabezpieczeń przed scrapingiem” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Python Academy, przejdź na CoddyKit PRO. Kurs Python Academy zawiera 4 lekcji w sumie.

Co nauczysz się w „Obsługa JavaScriptu i zabezpieczeń przed scrapingiem”?

Proszę używać Playwright/Selenium do treści renderowanych przez JS oraz ograniczania częstotliwości żądań. Ćwiczysz Python Academy z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.

Czy potrzebuję doświadczenia, aby zacząć Python Academy?

Nie wymagamy żadnego doświadczenia. Python Academy w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 4.

Ile czasu zajmuje lekcja „Obsługa JavaScriptu i zabezpieczeń przed scrapingiem”?

Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.

Czy mogę pisać i uruchamiać kod w tej lekcji Python Academy?

Tak. Każda lekcja Python Academy zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.

Wszystkie lekcje w tym kursie

  1. Żądania HTTP za pomocą requests i httpx
  2. Parsowanie HTML za pomocą BeautifulSoup
  3. Budowanie spidera Scrapy
  4. Obsługa JavaScriptu i zabezpieczeń przed scrapingiem
← Powrót do Python Academy