Learn AI with Python · Pelajaran

Pengikisan Web dengan BeautifulSoup

Pahami cara mengekstrak data dari situs web menggunakan Python

Pelajaran 5 dari 511 langkah

Pengikisan Web dengan BeautifulSoup adalah pelajaran Learn AI with Python gratis di CoddyKit. Ini adalah pelajaran 5 dari 5. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Learn AI with Python, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Learn AI with Python mencakup 5 pelajaran total.

Pengantar Pengambilan Data dari Web

Pengambilan data dari web adalah proses mengekstrak data dari situs web. Pustaka Python BeautifulSoup memudahkan penguraian dan penelusuran dokumen HTML atau XML.

Dalam pelajaran ini, Anda akan mempelajari cara menggunakan BeautifulSoup untuk mengambil data dari web.

Pengikisan Web dengan BeautifulSoup — ilustrasi 1

Memasang BeautifulSoup

Untuk memasang BeautifulSoup dan pustaka requests yang diperlukan, gunakan perintah berikut:

pip install beautifulsoup4
pip install requests

Setelah terpasang, Anda dapat mengimpornya dalam skrip Python Anda:

# Importing BeautifulSoup
from bs4 import BeautifulSoup
import requests

print("BeautifulSoup imported successfully")

Mengambil Halaman Web

Anda dapat mengambil halaman web menggunakan pustaka requests:

# Fetching a web page
response = requests.get("https://example.com")
print(response.text)  # Outputs the HTML content

Mengurai HTML dengan BeautifulSoup

BeautifulSoup menyediakan metode untuk mengurai dan menelusuri dokumen HTML:

# Parsing HTML
html_content = "<html><body><h1>Hello, World!</h1></body></html>"
soup = BeautifulSoup(html_content, "html.parser")
print(soup.h1.text)  # Outputs: Hello, World!

Menemukan Elemen

BeautifulSoup menyediakan metode seperti find() dan find_all() untuk menemukan elemen:

# Finding elements
soup = BeautifulSoup("<html><body><p class='content'>Hello!</p><p>World!</p></body></html>", "html.parser")
element = soup.find("p", class_="content")
print(element.text)  # Outputs: Hello!

Mengekstrak Tautan

Anda dapat mengekstrak semua tautan (tag <a>) dari sebuah halaman web:

# Extracting links
html = "<html><body><a href='https://example.com'>Example</a></body></html>"
soup = BeautifulSoup(html, "html.parser")
links = soup.find_all("a")
for link in links:
    print(link['href'])  # Outputs: https://example.com

Mengekstrak Tabel

BeautifulSoup memudahkan Anda mengekstrak data dari tabel HTML:

# Extracting table data
html = "<table><tr><td>Row 1</td></tr><tr><td>Row 2</td></tr></table>"
soup = BeautifulSoup(html, "html.parser")
rows = soup.find_all("tr")
for row in rows:
    print(row.text)  # Outputs: Row 1, Row 2

Menangani Elemen yang Hilang

BeautifulSoup menyediakan metode untuk menangani elemen yang hilang dengan aman:

# Handling missing elements
soup = BeautifulSoup("<html><body></body></html>", "html.parser")
element = soup.find("p")
print(element)  # Outputs: None

Kesalahan Umum dengan BeautifulSoup

Berikut beberapa kesalahan yang perlu dihindari:

  • Tidak menggunakan pengurai HTML yang tepat (misalnya, html.parser atau lxml).
  • Mengambil konten dari situs web yang diblokir atau dilindungi tanpa header yang sesuai.
  • Melakukan pengambilan data terlalu sering, yang dapat menyebabkan IP Anda diblokir.

Apa yang Telah Anda Pelajari

Dalam pelajaran ini, Anda mempelajari:

  • Cara memasang dan mengimpor BeautifulSoup dan requests.
  • Cara mengambil, mengurai, dan menelusuri konten HTML.
  • Cara mengekstrak elemen tertentu seperti tautan dan tabel.
  • Cara menangani elemen yang tidak ada dengan aman.

Kerja bagus! Mari lanjut ke topik berikutnya.

Pengikisan Web dengan BeautifulSoup — ilustrasi 11
Gratis untuk memulai

Belajar Python dengan tutor AI — gratis

Tulis dan jalankan kode asli di browser kamu, dapatkan bantuan instan dari tutor AI 24/7, dan lanjutkan di mana kamu tinggalkan di web atau aplikasi.

Kursus
53
Pelajaran
225

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Pengikisan Web dengan BeautifulSoup” gratis?

Ya — teks lengkap “Pengikisan Web dengan BeautifulSoup” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Learn AI with Python, upgrade ke CoddyKit PRO. Kursus Learn AI with Python mencakup 5 pelajaran total.

Apa yang akan aku pelajari di “Pengikisan Web dengan BeautifulSoup”?

Pahami cara mengekstrak data dari situs web menggunakan Python Kamu berlatih Learn AI with Python dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai Learn AI with Python?

Tidak diperlukan pengalaman sebelumnya. Learn AI with Python di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 5 dari 5.

Berapa lama pelajaran “Pengikisan Web dengan BeautifulSoup” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran Learn AI with Python ini?

Ya. Setiap pelajaran Learn AI with Python menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Analisis Data dengan Pandas
  2. Visualisasi Data dengan Matplotlib
  3. NumPy untuk Perhitungan Numerik
  4. Menangani API dengan requests
  5. Pengikisan Web dengan BeautifulSoup
← Kembali ke Learn AI with Python