0Pricing
Python Academy · Урок

Обработка JavaScript и мер против парсинга

Используйте Playwright/Selenium для содержимого, отрисованного JS, и ограничения частоты запросов.

«Обработка JavaScript и мер против парсинга» — бесплатный урок Python Academy на CoddyKit. Это урок 4 из 4. Ты можешь прочитать весь урок бесплатно ниже — а потом практиковать его прямо в браузере с встроенным редактором кода и ИИ-репетитором 24/7. Это часть пути обучения Python Academy, и твой прогресс синхронизируется между веб-версией и приложением CoddyKit. Курс Python Academy содержит 4 уроков всего.

Почему важен JavaScript

Современные сайты формируют содержимое с помощью JavaScript после загрузки страницы. Парсеры статического HTML, такие как requests и BS4, видят каркас страницы, а не сформированный DOM.

# Static scraper sees:
# <div id="app"></div>

# Rendered page has:
# <div id="app">
#   <h1>Product List</h1>
#   <ul>... dynamically loaded items ...</ul>
# </div>

Playwright для Python

Playwright программно управляет настоящим браузером (Chromium, Firefox, WebKit). Он ожидает выполнения JavaScript, прежде чем извлекать содержимое.

# pip install playwright
# playwright install
import asyncio
from playwright.async_api import async_playwright

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()
        await page.goto("https://example.com")
        title = await page.inner_text("h1")
        print(title)
        await browser.close()

asyncio.run(main())

Ожидание элементов

Используйте page.wait_for_selector(), чтобы дождаться появления элемента в DOM перед извлечением данных.

from playwright.async_api import async_playwright
import asyncio

async def scrape():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()
        await page.goto("https://spa-example.com")
        await page.wait_for_selector(".product-list")
        items = await page.query_selector_all(".product-item")
        texts = [await i.inner_text() for i in items]

Selenium

Selenium — более старая библиотека для автоматизации браузера. Для новых проектов предпочтителен Playwright благодаря лучшей поддержке асинхронности и большей скорости.

# pip install selenium
from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC

driver = webdriver.Chrome()
driver.get("https://example.com")
elem = WebDriverWait(driver, 10).until(
    EC.presence_of_element_located((By.CSS_SELECTOR, "h1"))
)
print(elem.text)
driver.quit()

Безголовый режим

Запускайте браузеры в безголовом режиме, то есть без видимого окна, для парсинга на сервере.

from playwright.async_api import async_playwright
import asyncio

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch(headless=True)  # no window
        page = await browser.new_page()
        await page.goto("https://example.com")
        html = await page.content()
        await browser.close()

Перехват сетевых запросов

Playwright может перехватывать и имитировать сетевые запросы, что удобно для блокировки рекламы и трекеров или прямого получения ответов API.

from playwright.async_api import async_playwright
import asyncio

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()

        await page.route("**/*.{png,jpg,css}", lambda route: route.abort())
        await page.goto("https://example.com")   # loads 3x faster

Ограничение частоты и задержки

Имитируйте поведение человека: добавляйте случайные задержки между запросами и ограничивайте их частоту, чтобы не запускать системы защиты от ботов.

import time, random

def polite_scrape(urls):
    for url in urls:
        fetch(url)
        time.sleep(random.uniform(1, 3))  # 1-3 s random delay

Смена User-Agent

Меняйте строки User-Agent, чтобы избежать блокировки из-за стандартного UA парсера.

import requests, random

USER_AGENTS = [
    "Mozilla/5.0 (Windows NT 10.0; Win64; x64) ...",
    "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) ...",
]

def fetch(url):
    return requests.get(url, headers={"User-Agent": random.choice(USER_AGENTS)})

Файлы cookie и сессии

Сохраняйте файлы cookie сессии, чтобы оставаться авторизованными в нескольких запросах. И requests Session, и Playwright обрабатывают файлы cookie автоматически.

import requests

with requests.Session() as s:
    s.post("https://example.com/login", data={"user":"me","pass":"pw"})
    # session cookie kept automatically:
    dashboard = s.get("https://example.com/dashboard")

CAPTCHA и юридические аспекты

CAPTCHA — это меры защиты от ботов. Их программное решение технически возможно (2captcha, anti-captcha), но связано с этическими и юридическими рисками. Перед парсингом всегда изучайте файл robots.txt и условия использования сайта.

# Before scraping:
# 1. Check robots.txt: https://example.com/robots.txt
# 2. Review the Terms of Service for "scraping" or "automated access" clauses
# 3. Only scrape public data
# 4. Honour Crawl-delay directives
# 5. Cache responses to avoid repeated hits

Снимки экрана и PDF в Playwright

Playwright может делать снимки экрана или печатать страницы в PDF — это полезно для визуального тестирования и архивирования.

from playwright.async_api import async_playwright
import asyncio

async def main():
    async with async_playwright() as p:
        browser = await p.chromium.launch()
        page = await browser.new_page()
        await page.goto("https://example.com")
        await page.screenshot(path="page.png", full_page=True)
        await page.pdf(path="page.pdf")
        await browser.close()

Быстрая проверка

Почему requests и BeautifulSoup не работают со многими современными сайтами?

Итоги

Используйте Playwright или Selenium для страниц, содержимое которых формируется с помощью JavaScript. Запускайте их в безголовом режиме на серверах. Добавляйте задержки и меняйте User-Agent, чтобы избежать блокировок. Перехватывайте сетевые запросы для блокировки трекеров. Всегда соблюдайте правила robots.txt и условия использования сайта.

Часто задаваемые вопросы

Урок «Обработка JavaScript и мер против парсинга» бесплатный?

Да — полный текст урока «Обработка JavaScript и мер против парсинга» бесплатно доступен здесь в веб-версии. Чтобы практиковать его интерактивно (встроенный редактор кода и ИИ-репетитор 24/7) и разблокировать остальной курс Python Academy, подпишись на CoddyKit PRO. Курс Python Academy содержит 4 уроков всего.

Чему я научусь в уроке «Обработка JavaScript и мер против парсинга»?

Используйте Playwright/Selenium для содержимого, отрисованного JS, и ограничения частоты запросов. Ты практикуешь Python Academy с помощью реального кода, который запускаешь прямо в браузере, и ИИ-репетитор 24/7 отвечает на твои вопросы во время урока.

Нужен ли мне опыт, чтобы начать Python Academy?

Предыдущий опыт не требуется. Python Academy на CoddyKit структурирован для всех уровней — от новичков до продвинутых, поэтому ты можешь начать отсюда или с самого начала и учиться в своем темпе. Это урок 4 из 4.

Сколько времени занимает урок «Обработка JavaScript и мер против парсинга»?

Большинство уроков CoddyKit занимают около 5–10 минут. Каждый из них компактный и интерактивный, поэтому ты постоянно делаешь прогресс и продолжаешь с того же места в веб-версии и приложении.

Можно ли писать и запускать код в этом уроке Python Academy?

Да. Каждый урок Python Academy включает встроенный редактор кода, поэтому ты пишешь и запускаешь реальный код прямо в браузере и получаешь моментальную обратную связь от AI — локальная установка не требуется.

Все уроки этого курса

  1. HTTP-запросы с requests и httpx
  2. Разбор HTML с помощью BeautifulSoup
  3. Создание паука Scrapy
  4. Обработка JavaScript и мер против парсинга
← Назад к Python Academy