Webscraping og botudvikling · Lektion

Dataudtræk fra JavaScript

Lær at hente data, der genereres eller indlæses af JavaScript, herunder indhold fra AJAX-kald og single-page-applikationer.

Lektion 3 af 411 trin

Dataudtræk fra JavaScript er en gratis Webscraping og botudvikling-lektion på CoddyKit. Dette er lektion 3 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Webscraping og botudvikling, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Webscraping og botudvikling-kurset indeholder 4 lektioner i alt.

Forklaring af dynamisk webindhold

Mange moderne websteder indlæser ikke alt deres indhold på én gang. I stedet bruger de JavaScript til at hente data og opdatere siden efter den første indlæsning. Det kaldes dynamisk indhold.

Traditionelle scrapingværktøjer som Requests og BeautifulSoup ser kun den oprindelige HTML. De går glip af alt det, som JavaScript indlæser senere.

JavaScripts rolle ved indlæsning

JavaScript kan indlæse nye data på flere måder:

  • AJAX-kald: Asynchronous JavaScript and XML. Browseren anmoder om data fra en server i baggrunden uden at genindlæse hele siden.
  • DOM-manipulation: JavaScript tilføjer, fjerner eller ændrer elementer direkte i sidens struktur (Document Object Model).
  • Single-Page Applications (SPA'er): Hele websteder, der er bygget til dynamisk at indlæse indhold og navigere uden fuldstændige sideopdateringer.

Denne dynamiske indlæsning gør scraping mere komplekst.

Når Requests og BS4 ikke rækker

Når du bruger Pythons requests-bibliotek, får du den rå HTML, som serveren sender i første omgang. Hvis et websted derefter bruger JavaScript til at indlæse flere data, findes disse data ikke i den HTML, du modtog.

BeautifulSoup kan kun fortolke den HTML, den får. Den kan ikke udføre JavaScript for at hente yderligere indhold eller vente på, at det vises.

Selenium til dynamisk indhold

Det er her, Selenium bliver afgørende. Selenium styrer en rigtig webbrowser (for eksempel Chrome eller Firefox) programmatisk.

Når Selenium åbner en side, udfører browseren al JavaScript, herunder AJAX-kald og DOM-manipulationer. Det betyder, at Selenium ser den fuldt gengivne side, ligesom en menneskelig bruger ville gøre.

Vent på, at elementer vises

Da indhold indlæses dynamisk, er det måske ikke tilgængeligt med det samme, når Selenium indlæser en side første gang. Du skal bede Selenium om at vente, indtil et bestemt element eller en bestemt betingelse er opfyldt, før du forsøger at udtrække data.

Hvis du ikke venter, forsøger dit script måske at finde et element, før JavaScript har gengivet det, hvilket kan føre til fejl eller manglende data.

Brug eksplicitte ventetider

Seleniums WebDriverWait kombineret med ExpectedConditions (EC) giver dig mulighed for at angive eksplicitte ventetider. Det får Selenium til at vente i højst et bestemt tidsrum, indtil en bestemt betingelse er sand.

Almindelige betingelser omfatter at vente på, at et element bliver synligt, klikbart eller findes i DOM'en.

Prøv at køre dette eksempel:

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
import time

def main():
    driver = webdriver.Chrome()
    driver.get("https://www.selenium.dev/selenium/web/dynamic.html")

    # Click a button that will make an element appear after a delay
    driver.find_element(By.ID, "adder").click()

    # Wait up to 10 seconds for the new element to appear
    try:
        new_element = WebDriverWait(driver, 10).until(
            EC.presence_of_element_located((By.ID, "box0"))
        )
        print("New element found:", new_element.text)
    except Exception as e:
        print("Element not found within time limit:", e)

    driver.quit()

if __name__ == "__main__":
    main()

Udtræk gengivne data

Når du har ventet på, at dynamisk indhold vises, er dataudtrækningen næsten den samme som ved statisk indhold med Selenium.

Du kan bruge metoder som find_element(By.ID, "id_name"), find_element(By.CLASS_NAME, "class_name") eller find_element(By.CSS_SELECTOR, "css_selector") til at finde elementerne. Derefter kan du hente deres tekstindhold eller attributter.

Kode: Hent dynamisk tekst

Dette eksempel viser, hvordan du venter på et element og derefter udtrækker dets tekst. Forestil dig en side, hvor meddelelsen "Loading..." ændres til faktiske data efter nogle få sekunder.

Prøv at køre dette eksempel:

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
import time

def main():
    driver = webdriver.Chrome()
    # Using a simple test page that changes content
    driver.get("https://www.selenium.dev/selenium/web/dynamic.html")

    # Click button to reveal content
    driver.find_element(By.ID, "reveal").click()

    # Wait for the content to be visible
    try:
        # The 'revealed' div becomes visible
        revealed_div = WebDriverWait(driver, 10).until(
            EC.visibility_of_element_located((By.ID, "revealed"))
        )
        print("Revealed content:", revealed_div.text)
    except Exception as e:
        print("Revealed content not found:", e)

    driver.quit()

if __name__ == "__main__":
    main()

Scraping af single-page-apps

Single-Page Applications (SPA'er) er websteder, der indlæser én HTML-side og derefter opdaterer indholdet dynamisk, efterhånden som brugeren interagerer med siden. Navigation i en SPA indebærer ofte ikke fuldstændige sidegenindlæsninger.

Selenium håndterer også SPA'er godt, fordi det fungerer som en komplet browser. Du interagerer med elementer (for eksempel ved at klikke på navigationslinks), og Selenium udfører JavaScript og opdaterer DOM'en. Derefter bruger du de samme teknikker til ventetid og dataudtræk.

Hurtig kontrol af ventetid

Når du scraper dynamisk indhold, der vises efter den første sideindlæsning, hvilken Selenium-teknik er så afgørende for at sikre, at indholdet er tilgængeligt, før du forsøger at udtrække det?

Opsummering: Udtrækning af dynamiske data

Godt arbejde! Du har lært, hvordan du håndterer dynamisk webindhold:

  • Mange websteder bruger JavaScript til AJAX-kald, DOM-manipulation og SPA'er.
  • Traditionelle værktøjer som Requests og BeautifulSoup kan ikke udføre JavaScript.
  • Selenium kan gengive JavaScript ved at styre en komplet browser.
  • Eksplicitte ventetider er afgørende for at sikre, at dynamisk indlæst indhold er til stede, før det udtrækkes.

Denne færdighed giver dig adgang til et stort antal moderne websteder i dine scrapingprojekter!

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
12
Lektioner
48

Ofte stillede spørgsmål

Er lektionen “Dataudtræk fra JavaScript” gratis?

Ja — alle 3 lektioner i læringssporet Webscraping og botudvikling, inklusive “Dataudtræk fra JavaScript”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Webscraping og botudvikling-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Dataudtræk fra JavaScript”?

Lær at hente data, der genereres eller indlæses af JavaScript, herunder indhold fra AJAX-kald og single-page-applikationer. Du øver dig i Webscraping og botudvikling med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Webscraping og botudvikling?

Der kræves ingen tidligere erfaring. Webscraping og botudvikling på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 3 af 4.

Hvor lang tid tager lektionen “Dataudtræk fra JavaScript”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Webscraping og botudvikling-lektion?

Ja. Alle Webscraping og botudvikling-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Introduktion til Selenium
  2. Automatisering af browserinteraktioner
  3. Dataudtræk fra JavaScript
  4. Vent strategier til dynamiske sider
← Tilbage til Webscraping og botudvikling