Webscraping og botudvikling · Lektion

Købaseret opgavefordeling

Lær, hvordan message queues som Redis og Celery afkobler URL-discovery fra hentning, så scraping kan skaleres på tværs af mange workers.

Lektion 4 af 413 trin

Købaseret opgavefordeling er en gratis Webscraping og botudvikling-lektion på CoddyKit. Dette er lektion 4 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Webscraping og botudvikling, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Webscraping og botudvikling-kurset indeholder 4 lektioner i alt.

Flaskehalsen ved skalering

En scraper, der kører i én proces, er begrænset af én maskines CPU og netværk. Hvis du vil skalere, fordeler du arbejdet på mange arbejdere, der kører parallelt, muligvis på forskellige servere.

En opgavekø er det bindemiddel, der fordeler arbejdet sikkert.

Producenter og forbrugere

Kø-mønstret har to roller:

  • Producenter finder URL'er og lægger opgaver i køen.
  • Forbrugere (arbejdere) henter opgaver og henter siderne.

Ved at afkoble dem kan hver side skaleres uafhængigt.

En Redis-understøttet kø

Redis-lister giver en enkel og hurtig kø. Producenter bruger LPUSH til URL'er; arbejdere bruger BRPOP til at hente dem og blokerer, indtil der er arbejde tilgængeligt.

import redis
r = redis.Redis()

# producer
r.lpush('urls', 'https://site.com/page1')

# worker
_, url = r.brpop('urls')
print('processing', url)

Hvorfor ikke dele en Python-liste

En liste i hukommelsen fungerer kun inden for én proces. En Redis-kø deles på tværs af processer og maskiner, bevares hvis en arbejder går ned, og håndterer samtidighed atomisk.

Introduktion til Celery

Celery er en komplet opgaveramme, der bygger på en broker som Redis. Du definerer opgaver som funktioner og kalder dem asynkront; arbejderne henter dem automatisk.

from celery import Celery
app = Celery('scraper', broker='redis://localhost:6379/0')

@app.task
def scrape(url):
    return fetch_and_parse(url)

Afsendelse af opgaver

Et kald til .delay() lægger opgaven i kø og returnerer med det samme. Arbejdere, der kører celery worker, forbruger og udfører dem parallelt.

for url in discovered_urls:
    scrape.delay(url)

Nye forsøg og fejl

Celery kan automatisk prøve mislykkede opgaver igen med gradvist længere ventetid, så en midlertidig netværksfejl ikke medfører, at en URL går tabt.

@app.task(bind=True, max_retries=3, default_retry_delay=10)
def scrape(self, url):
    try:
        return fetch_and_parse(url)
    except ConnectionError as e:
        raise self.retry(exc=e)

Fjernelse af dublerede URL'er

Ved distribueret crawling kan den samme URL blive fundet to gange. Brug et Redis-sæt som et filter over 'sete' URL'er, så hver side hentes én gang.

if r.sadd('seen', url):
    scrape.delay(url)  # sadd returns 1 only if newly added

Tilbagestrømning og samtidighed

Indstil arbejdernes samtidighed, så den passer til hensynet til målwebstedet og din båndbredde. For mange arbejdere overbelaster webstedet; for få får køen til at vokse. Overvåg køens længde for at finde balancen.

# start 4 worker processes
// celery -A scraper worker --concurrency=4

Resultater og lagring

Arbejdere bør skrive fortolkede data til et fælles lager, f.eks. en database eller objektlagring, i stedet for at returnere dem gennem køen. Køen indeholder opgaver; datalageret indeholder resultater.

Prioritetskøer

Alle URL'er er ikke lige vigtige. Send presserende opgaver, f.eks. et kategoriindeks, der åbner adgang til mange underordnede sider, til en kø med høj prioritet, så arbejderne håndterer dem før sider med lav værdi.

scrape.apply_async(args=[url], priority=9)  # higher runs sooner

Hurtigt tjek

Test din forståelse af købaseret fordeling.

Opsummering

Du har lært at skalere scraping med opgavekøer: producent-/forbrugermønstret, Redis-understøttede køer, Celery-opgaver med .delay(), automatiske nye forsøg, fjernelse af dublerede URL'er med Redis-sæt, justering af samtidighed og skrivning af resultater til fælles lagring.

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
12
Lektioner
48

Ofte stillede spørgsmål

Er lektionen “Købaseret opgavefordeling” gratis?

Ja — alle 3 lektioner i læringssporet Webscraping og botudvikling, inklusive “Købaseret opgavefordeling”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Webscraping og botudvikling-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Købaseret opgavefordeling”?

Lær, hvordan message queues som Redis og Celery afkobler URL-discovery fra hentning, så scraping kan skaleres på tværs af mange workers. Du øver dig i Webscraping og botudvikling med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Webscraping og botudvikling?

Der kræves ingen tidligere erfaring. Webscraping og botudvikling på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 4 af 4.

Hvor lang tid tager lektionen “Købaseret opgavefordeling”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Webscraping og botudvikling-lektion?

Ja. Alle Webscraping og botudvikling-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Distribueret scraping med Scrapy
  2. Cloud Functions til scraping
  3. Overvågning og logning
  4. Købaseret opgavefordeling
← Tilbage til Webscraping og botudvikling