0Pricing
Python Academy · Pelajaran

Pengikisan Web dengan BeautifulSoup

Pahami cara mengekstrak data dari situs web menggunakan Python.

Pengikisan Web dengan BeautifulSoup adalah pelajaran Python Academy gratis di CoddyKit. Ini adalah pelajaran 5 dari 5. Kamu bisa membaca pelajaran lengkapnya di bawah secara gratis — lalu praktikkan langsung di browser dengan editor kode bawaan dan tutor AI 24/7. Ini adalah bagian dari jalur belajar Python Academy, dan progresmu tersinkronisasi di web dan aplikasi CoddyKit. Kursus Python Academy mencakup 5 pelajaran total.

Pengantar Pengambilan Data dari Web

Pengantar Pengambilan Data dari Web

Pengambilan data dari web adalah proses mengekstrak data dari situs web. Pustaka Python BeautifulSoup memudahkan penguraian dan navigasi dokumen HTML atau XML.

Dalam pelajaran ini, Anda akan mempelajari cara menggunakan BeautifulSoup untuk mengambil data dari web.

Pengikisan Web dengan BeautifulSoup — ilustrasi 1

Menginstal BeautifulSoup

Menginstal BeautifulSoup

Untuk menginstal BeautifulSoup dan pustaka requests yang diperlukan, gunakan perintah berikut:

pip install beautifulsoup4
pip install requests

Setelah terinstal, Anda dapat mengimpornya dalam skrip Python Anda:

# Importing BeautifulSoup
from bs4 import BeautifulSoup
import requests

print("BeautifulSoup imported successfully")

Mengambil Halaman Web

Mengambil Halaman Web

Anda dapat mengambil halaman web menggunakan pustaka requests:

# Fetching a web page
response = requests.get("https://example.com")
print(response.text)  # Outputs the HTML content

Mengurai HTML dengan BeautifulSoup

Mengurai HTML dengan BeautifulSoup

BeautifulSoup menyediakan metode untuk mengurai dan menavigasi dokumen HTML:

# Parsing HTML
html_content = "<html><body><h1>Hello, World!</h1></body></html>"
soup = BeautifulSoup(html_content, "html.parser")
print(soup.h1.text)  # Outputs: Hello, World!

Menemukan Elemen

Menemukan Elemen

BeautifulSoup menyediakan metode seperti find() dan find_all() untuk menemukan elemen:

# Finding elements
soup = BeautifulSoup("<html><body><p class='content'>Hello!</p><p>World!</p></body></html>", "html.parser")
element = soup.find("p", class_="content")
print(element.text)  # Outputs: Hello!

Mengekstrak Tautan

Mengekstrak Tautan

Anda dapat mengekstrak semua tautan (elemen <a>) dari halaman web:

# Extracting links
html = "<html><body><a href='https://example.com'>Example</a></body></html>"
soup = BeautifulSoup(html, "html.parser")
links = soup.find_all("a")
for link in links:
    print(link['href'])  # Outputs: https://example.com

Mengekstrak Tabel

Mengekstrak Tabel

BeautifulSoup memudahkan Anda mengekstrak data dari tabel HTML:

# Extracting table data
html = "<table><tr><td>Row 1</td></tr><tr><td>Row 2</td></tr></table>"
soup = BeautifulSoup(html, "html.parser")
rows = soup.find_all("tr")
for row in rows:
    print(row.text)  # Outputs: Row 1, Row 2

Menangani Elemen yang Tidak Ditemukan

Menangani Elemen yang Tidak Ditemukan

BeautifulSoup menyediakan metode untuk menangani elemen yang tidak ditemukan dengan aman:

# Handling missing elements
soup = BeautifulSoup("<html><body></body></html>", "html.parser")
element = soup.find("p")
print(element)  # Outputs: None

Kesalahan Umum dalam BeautifulSoup

Kesalahan Umum dalam BeautifulSoup

Berikut beberapa kesalahan yang perlu dihindari:

  • Tidak menggunakan pengurai HTML yang sesuai (misalnya, html.parser atau lxml).
  • Mengambil konten dari situs web yang diblokir atau dilindungi tanpa header yang sesuai.
  • Melakukan pengambilan data terlalu sering, yang dapat menyebabkan IP Anda diblokir.

Apa yang Telah Kita Pelajari?

Apa yang Telah Kita Pelajari?

Dalam pelajaran ini, Anda telah mempelajari:

  • Cara menginstal dan mengimpor BeautifulSoup dan requests.
  • Cara mengambil, mengurai, dan menavigasi konten HTML.
  • Cara mengekstrak elemen tertentu seperti tautan dan tabel.
  • Cara menangani elemen yang tidak ditemukan dengan aman.

Bagus sekali! Mari lanjut ke topik berikutnya.

Pengikisan Web dengan BeautifulSoup — ilustrasi 11

Pertanyaan yang Sering Diajukan

Apakah pelajaran “Pengikisan Web dengan BeautifulSoup” gratis?

Ya — teks lengkap “Pengikisan Web dengan BeautifulSoup” gratis dibaca di sini di web. Untuk praktiknya secara interaktif (editor kode bawaan dan tutor AI 24/7) dan buka sisa kursus Python Academy, upgrade ke CoddyKit PRO. Kursus Python Academy mencakup 5 pelajaran total.

Apa yang akan aku pelajari di “Pengikisan Web dengan BeautifulSoup”?

Pahami cara mengekstrak data dari situs web menggunakan Python. Kamu berlatih Python Academy dengan kode praktik yang langsung kamu jalankan di browser, dan tutor AI 24/7 menjawab pertanyaanmu saat kamu mengerjakan pelajaran ini.

Apakah aku perlu pengalaman untuk memulai Python Academy?

Tidak diperlukan pengalaman sebelumnya. Python Academy di CoddyKit dirancang untuk pemula hingga pelajar tingkat lanjut, jadi kamu bisa memulai di sini atau dari awal dan belajar sesuai kecepatan kamu sendiri. Ini adalah pelajaran 5 dari 5.

Berapa lama pelajaran “Pengikisan Web dengan BeautifulSoup” memakan waktu?

Sebagian besar pelajaran CoddyKit memakan waktu sekitar 5–10 menit. Setiap pelajaran ringkas dan interaktif, jadi kamu membuat kemajuan stabil dan melanjutkan dari tempat kamu tinggalkan di web dan aplikasi.

Bisakah aku menulis dan menjalankan kode dalam pelajaran Python Academy ini?

Ya. Setiap pelajaran Python Academy menyertakan editor kode bawaan, jadi kamu menulis dan menjalankan kode nyata langsung di browser dan mendapatkan umpan balik AI instan — tidak diperlukan penyiapan lokal.

Semua pelajaran dalam kursus ini

  1. Analisis Data dengan Pandas
  2. Visualisasi Data dengan Matplotlib
  3. NumPy untuk Perhitungan Numerik
  4. Menangani API dengan requests
  5. Pengikisan Web dengan BeautifulSoup
← Kembali ke Python Academy