Lær AI med Python · leksjon

Web scraping med BeautifulSoup

Forstå hvordan De trekker ut data fra nettsteder med Python

Leksjon 5 av 511 trinn

Web scraping med BeautifulSoup er en gratis leksjon i Lær AI med Python på CoddyKit. Dette er leksjon 5 av 5. Du kan lese valgfritt 3 leksjoner fra denne læringsstien gratis i sin helhet – deretter låser CoddyKit PRO opp alle leksjoner, samt praktisk øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Den er en del av læringsløpet i Lær AI med Python, og fremdriften din synkroniseres mellom nettet og CoddyKit-appen. Kurset i Lær AI med Python inneholder totalt 5 leksjoner.

Introduksjon til web scraping

Web scraping er prosessen med å hente ut data fra nettsteder. Python-biblioteket BeautifulSoup gjør det enkelt å tolke og navigere i HTML- eller XML-dokumenter.

I denne leksjonen lærer du å bruke BeautifulSoup til web scraping.

Web scraping med BeautifulSoup — illustrasjon 1

Installere BeautifulSoup

Installer BeautifulSoup og det nødvendige biblioteket requests ved å bruke følgende kommandoer:

pip install beautifulsoup4
pip install requests

Når bibliotekene er installert, kan du importere dem i Python-skriptene dine:

# Importing BeautifulSoup
from bs4 import BeautifulSoup
import requests

print("BeautifulSoup imported successfully")

Hente en nettside

De kan hente en nettside ved hjelp av biblioteket requests:

# Fetching a web page
response = requests.get("https://example.com")
print(response.text)  # Outputs the HTML content

Tolke HTML med BeautifulSoup

BeautifulSoup tilbyr metoder for å tolke og navigere i HTML-dokumenter:

# Parsing HTML
html_content = "<html><body><h1>Hello, World!</h1></body></html>"
soup = BeautifulSoup(html_content, "html.parser")
print(soup.h1.text)  # Outputs: Hello, World!

Finne elementer

BeautifulSoup tilbyr metoder som find() og find_all() for å finne elementer:

# Finding elements
soup = BeautifulSoup("<html><body><p class='content'>Hello!</p><p>World!</p></body></html>", "html.parser")
element = soup.find("p", class_="content")
print(element.text)  # Outputs: Hello!

Hente ut lenker

Du kan hente ut alle lenker (<a>-tagger) fra en nettside:

# Extracting links
html = "<html><body><a href='https://example.com'>Example</a></body></html>"
soup = BeautifulSoup(html, "html.parser")
links = soup.find_all("a")
for link in links:
    print(link['href'])  # Outputs: https://example.com

Hente ut tabeller

BeautifulSoup gjør det enkelt å hente ut data fra HTML-tabeller:

# Extracting table data
html = "<table><tr><td>Row 1</td></tr><tr><td>Row 2</td></tr></table>"
soup = BeautifulSoup(html, "html.parser")
rows = soup.find_all("tr")
for row in rows:
    print(row.text)  # Outputs: Row 1, Row 2

Håndtere manglende elementer

BeautifulSoup tilbyr metoder for å håndtere manglende elementer på en trygg måte:

# Handling missing elements
soup = BeautifulSoup("<html><body></body></html>", "html.parser")
element = soup.find("p")
print(element)  # Outputs: None

Vanlige feil med BeautifulSoup

Her er noen feil du bør unngå:

  • Ikke å bruke en egnet HTML-parser (for eksempel html.parser eller lxml).
  • Henting av innhold fra blokkerte eller beskyttede nettsteder uten riktige headere.
  • For hyppig scraping, noe som kan føre til at IP-adressen din blir utestengt.

Hva lærte vi?

I denne leksjonen lærte du:

  • Hvordan du installerer og importerer BeautifulSoup og requests.
  • Hvordan du henter, analyserer og navigerer i HTML-innhold.
  • Hvordan du henter ut bestemte elementer, for eksempel lenker og tabeller.
  • Hvordan du håndterer manglende elementer på en trygg måte.

Godt jobbet! La oss gå videre til neste tema.

Web scraping med BeautifulSoup — illustrasjon 11
Gratis å komme i gang

Lær deg Python med en AI-veileder – gratis

Skriv og kjør ekte kode i nettleseren, få umiddelbar hjelp fra en AI-veileder som er tilgjengelig døgnet rundt, og fortsett der du slapp – på nettet eller i appen.

Kurs
53
Leksjoner
225

Ofte stilte spørsmål

Er leksjonen «Web scraping med BeautifulSoup» gratis?

Ja – du kan lese valgfritt 3 av leksjonene i læringsstien Lær AI med Python, inkludert «Web scraping med BeautifulSoup», gratis i sin helhet her på nettet. Deretter låser CoddyKit PRO opp alle leksjoner, samt interaktiv øving med en innebygd kodeeditor og en AI-veileder som er tilgjengelig døgnet rundt. Kurset i Lær AI med Python inneholder totalt 5 leksjoner.

Hva lærer jeg i «Web scraping med BeautifulSoup»?

Forstå hvordan De trekker ut data fra nettsteder med Python Du øver på Lær AI med Python med praktisk kode som du kjører direkte i nettleseren, mens en AI-veileder som er tilgjengelig døgnet rundt, svarer på spørsmålene dine mens du jobber deg gjennom leksjonen.

Trenger jeg erfaring for å begynne med Lær AI med Python?

Ingen tidligere erfaring er nødvendig. Lær AI med Python på CoddyKit er lagt opp for både nybegynnere og viderekomne, så De kan begynne her eller helt fra start og lære i Deres eget tempo. Dette er leksjon 5 av 5.

Hvor lang tid tar leksjonen «Web scraping med BeautifulSoup»?

De fleste CoddyKit-leksjoner tar omtrent 5–10 minutter. Hver leksjon er kort og interaktiv, slik at De gjør jevne fremskritt og kan fortsette akkurat der De slapp – både på nettet og i appen.

Kan jeg skrive og kjøre kode i denne Lær AI med Python-leksjonen?

Ja. Alle Lær AI med Python-leksjoner har en innebygd kodeeditor, slik at De kan skrive og kjøre ekte kode direkte i nettleseren og få umiddelbar tilbakemelding fra AI – uten lokal konfigurering.

Alle leksjonene i dette kurset

  1. Dataanalyse med Pandas
  2. Datavisualisering med Matplotlib
  3. NumPy for numeriske beregninger
  4. Håndtere API-er med requests
  5. Web scraping med BeautifulSoup
← Tilbake til Lær AI med Python