Robots.txt i etyka scrapingu
Poznaj prawne i etyczne podstawy web scrapingu: robots.txt, regulamin usług, ograniczanie częstotliwości żądań i odpowiedzialne zachowanie.
Robots.txt i etyka scrapingu to bezpłatna lekcja Web Scraping & Bots na CoddyKit. To lekcja 4 z 4. Możesz przeczytać całą lekcję poniżej za darmo — a potem ćwiczyć ją interaktywnie w przeglądarce z wbudowanym edytorem kodu i tutorem AI dostępnym 24/7. To część ścieżki edukacyjnej Web Scraping & Bots, a Twój postęp synchronizuje się między webem a aplikacją CoddyKit. Kurs Web Scraping & Bots zawiera 4 lekcji w sumie.
Części tej lekcji nie zostały jeszcze przetłumaczone i są wyświetlane po angielsku.
Scraping Responsibly
Scraping touches other people’s servers and data. Before your first scraper, learn the rules and ethics that keep you safe and respectful.
What Is robots.txt?
robots.txt lives at a site’s root and tells automated clients which paths they may or may not access.
# https://example.com/robots.txt
User-agent: *
Disallow: /admin/
Allow: /public/Reading the Directives
Read the directives: User-agent targets a crawler, Disallow blocks paths, Allow adds exceptions, Crawl-delay sets a wait.
Checking robots.txt in Python
Python’s built-in urllib.robotparser reads and evaluates robots.txt for you — just ask it whether you can fetch a URL.
from urllib.robotparser import RobotFileParser
rp = RobotFileParser()
rp.set_url('https://example.com/robots.txt')
rp.read()
print(rp.can_fetch('*', 'https://example.com/public/page'))robots.txt Is Not Law
Remember: robots.txt is a request, not a lock. Ignoring it isn’t a crime by itself, but it can breach terms of service. Respect it anyway.
Terms of Service
A site’s Terms of Service may flat-out forbid automated access. Breaking them can mean account bans or legal trouble — always check first.
Personal & Copyrighted Data
Tread carefully with personal data (privacy laws like GDPR) and copyrighted content. Collecting or republishing them can carry real consequences.
Rate Limiting
Rapid-fire requests can overload a server — and get you blocked. Add a delay between requests to stay polite.
import time
for url in urls:
fetch(url)
time.sleep(2) # be politeIdentify Yourself
Set an honest User-Agent header, ideally with contact info, so site owners can reach you instead of just blocking you.
headers = {
'User-Agent': 'MyResearchBot/1.0 (contact@example.com)'
}Prefer Official APIs
If a site offers an API, use it. APIs are stable, sanctioned, and far gentler than scraping raw HTML.
Cache to Reduce Load
Cache responses locally so you don’t re-fetch the same page over and over while developing.
import os
if not os.path.exists('page.html'):
save(fetch(url), 'page.html')
html = open('page.html').read()Quick Check
What is the correct way to think about robots.txt?
Recap
You’ve got scraping ethics: respecting robots.txt, terms, privacy and copyright, rate limiting, honest User-Agents, and preferring APIs and caching.
Często zadawane pytania
Czy lekcja „Robots.txt i etyka scrapingu” jest bezpłatna?
Tak — pełny tekst „Robots.txt i etyka scrapingu” jest dostępny za darmo tutaj w sieci. Aby ćwiczyć ją interaktywnie (wbudowany edytor kodu i tutor AI dostępny 24/7) i odblokować resztę kursu Web Scraping & Bots, przejdź na CoddyKit PRO. Kurs Web Scraping & Bots zawiera 4 lekcji w sumie.
Co nauczysz się w „Robots.txt i etyka scrapingu”?
Poznaj prawne i etyczne podstawy web scrapingu: robots.txt, regulamin usług, ograniczanie częstotliwości żądań i odpowiedzialne zachowanie. Ćwiczysz Web Scraping & Bots z praktycznym kodem, który uruchamiasz bezpośrednio w przeglądarce, a tutor AI dostępny 24/7 odpowiada na Twoje pytania podczas pracy nad lekcją.
Czy potrzebuję doświadczenia, aby zacząć Web Scraping & Bots?
Nie wymagamy żadnego doświadczenia. Web Scraping & Bots w CoddyKit jest strukturyzowany dla początkujących i zaawansowanych użytkowników, więc możesz zacząć tutaj lub od początku i uczyć się w swoim tempie. To lekcja 4 z 4.
Ile czasu zajmuje lekcja „Robots.txt i etyka scrapingu”?
Większość lekcji CoddyKit trwa około 5–10 minut. Każda lekcja to mały, interaktywny krok, dzięki czemu robisz systematyczne postępy i zawsze wracasz dokładnie do tego samego miejsca — na webie i w aplikacji.
Czy mogę pisać i uruchamiać kod w tej lekcji Web Scraping & Bots?
Tak. Każda lekcja Web Scraping & Bots zawiera wbudowany edytor kodu, więc piszesz i uruchamiasz prawdziwy kod bezpośrednio w przeglądarce i od razu otrzymujesz sprzężenie zwrotne od AI — bez konfiguracji na komputerze.
Wszystkie lekcje w tym kursie
- Czym jest web scraping?
- Żądania i odpowiedzi HTTP
- Inspekcja stron internetowych
- Robots.txt i etyka scrapingu