0Pricing
Learn AI with Python · บทเรียน

การดึงข้อมูลจากเว็บด้วย BeautifulSoup

ทำความเข้าใจวิธีสกัดข้อมูลจากเว็บไซต์ด้วย Python

การดึงข้อมูลจากเว็บด้วย BeautifulSoup เป็นบทเรียน Learn AI with Python ฟรีบน CoddyKit นี่คือบทเรียนที่ 5 จากทั้งหมด 5 บทเรียน คุณสามารถอ่านบทเรียนทั้งหมดด้านล่างฟรี — จากนั้นลองปฏิบัติด้วยตัวคุณเองในเบราว์เซอร์พร้อมตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7 บทเรียนนี้เป็นส่วนหนึ่งของเส้นทางการเรียน Learn AI with Python และความก้าวหน้าของคุณจะซิงค์ข้ามเว็บและแอป CoddyKit คอร์ส Learn AI with Python มีบทเรียนทั้งหมด 5 บทเรียน

บทนำสู่การดึงข้อมูลจากเว็บไซต์

บทนำสู่การดึงข้อมูลจากเว็บไซต์

การดึงข้อมูลจากเว็บไซต์คือกระบวนการแยกข้อมูลออกจากเว็บไซต์ ไลบรารี BeautifulSoup ของ Python ช่วยให้การแยกวิเคราะห์และนำทางในเอกสาร HTML หรือ XML เป็นเรื่องง่าย

ในบทเรียนนี้ คุณจะได้เรียนรู้วิธีใช้ BeautifulSoup สำหรับการดึงข้อมูลจากเว็บไซต์

การดึงข้อมูลจากเว็บด้วย BeautifulSoup — ภาพประกอบ 1

การติดตั้ง BeautifulSoup

การติดตั้ง BeautifulSoup

หากต้องการติดตั้ง BeautifulSoup และไลบรารี requests ที่จำเป็น ให้ใช้คำสั่งต่อไปนี้:

pip install beautifulsoup4
pip install requests

เมื่อติดตั้งแล้ว คุณสามารถนำเข้าไลบรารีเหล่านี้ในสคริปต์ Python ได้:

# Importing BeautifulSoup
from bs4 import BeautifulSoup
import requests

print("BeautifulSoup imported successfully")

การดึงหน้าเว็บ

การดึงหน้าเว็บ

คุณสามารถดึงหน้าเว็บได้โดยใช้ไลบรารี requests:

# Fetching a web page
response = requests.get("https://example.com")
print(response.text)  # Outputs the HTML content

การแยกวิเคราะห์ HTML ด้วย BeautifulSoup

การแยกวิเคราะห์ HTML ด้วย BeautifulSoup

BeautifulSoup มีเมธอดสำหรับแยกวิเคราะห์และนำทางในเอกสาร HTML:

# Parsing HTML
html_content = "<html><body><h1>Hello, World!</h1></body></html>"
soup = BeautifulSoup(html_content, "html.parser")
print(soup.h1.text)  # Outputs: Hello, World!

การค้นหาองค์ประกอบ

การค้นหาองค์ประกอบ

BeautifulSoup มีเมธอดอย่าง find() และ find_all() สำหรับค้นหาองค์ประกอบ:

# Finding elements
soup = BeautifulSoup("<html><body><p class='content'>Hello!</p><p>World!</p></body></html>", "html.parser")
element = soup.find("p", class_="content")
print(element.text)  # Outputs: Hello!

การดึงลิงก์

การดึงลิงก์

คุณสามารถดึงลิงก์ทั้งหมด (แท็ก <a>) จากหน้าเว็บได้:

# Extracting links
html = "<html><body><a href='https://example.com'>Example</a></body></html>"
soup = BeautifulSoup(html, "html.parser")
links = soup.find_all("a")
for link in links:
    print(link['href'])  # Outputs: https://example.com

การดึงตาราง

การดึงตาราง

BeautifulSoup ช่วยให้การดึงข้อมูลจากตาราง HTML เป็นเรื่องง่าย:

# Extracting table data
html = "<table><tr><td>Row 1</td></tr><tr><td>Row 2</td></tr></table>"
soup = BeautifulSoup(html, "html.parser")
rows = soup.find_all("tr")
for row in rows:
    print(row.text)  # Outputs: Row 1, Row 2

การจัดการองค์ประกอบที่หายไป

การจัดการองค์ประกอบที่หายไป

BeautifulSoup มีเมธอดสำหรับจัดการองค์ประกอบที่หายไปอย่างปลอดภัย:

# Handling missing elements
soup = BeautifulSoup("<html><body></body></html>", "html.parser")
element = soup.find("p")
print(element)  # Outputs: None

ข้อผิดพลาดที่พบบ่อยในการใช้ BeautifulSoup

ข้อผิดพลาดที่พบบ่อยในการใช้ BeautifulSoup

ต่อไปนี้คือข้อผิดพลาดที่ควรหลีกเลี่ยง:

  • ไม่ใช้ตัวแยกวิเคราะห์ HTML ที่เหมาะสม (เช่น html.parser หรือ lxml)
  • ดึงเนื้อหาจากเว็บไซต์ที่ถูกบล็อกหรือมีการป้องกันโดยไม่มีส่วนหัวที่เหมาะสม
  • ขูดข้อมูลบ่อยเกินไป ซึ่งอาจทำให้ IP ของคุณถูกแบน

เราเรียนรู้อะไรบ้าง

เราเรียนรู้อะไรบ้าง

ในบทเรียนนี้ คุณได้เรียนรู้:

  • วิธีติดตั้งและนำเข้า BeautifulSoup และไลบรารีสำหรับส่งคำขอ
  • วิธีดึง แยกวิเคราะห์ และนำทางในเนื้อหา HTML
  • วิธีแยกองค์ประกอบเฉพาะ เช่น ลิงก์และตาราง
  • วิธีจัดการองค์ประกอบที่หายไปอย่างปลอดภัย

ทำได้ดีมาก! ไปต่อที่หัวข้อถัดไปกัน

การดึงข้อมูลจากเว็บด้วย BeautifulSoup — ภาพประกอบ 11

คำถามที่พบบ่อย

บทเรียน “การดึงข้อมูลจากเว็บด้วย BeautifulSoup” ฟรีหรือไม่

ใช่ — ข้อความเต็มของ “การดึงข้อมูลจากเว็บด้วย BeautifulSoup” ฟรีให้อ่านที่นี่บนเว็บ เพื่อปฏิบัติแบบโต้ตอบ (ตัวแก้ไขโค้ดในตัวและติวเตอร์ AI ตลอด 24/7) และปลดล็อคส่วนที่เหลือของคอร์ส Learn AI with Python ให้อัปเกรดเป็น CoddyKit PRO คอร์ส Learn AI with Python มีบทเรียนทั้งหมด 5 บทเรียน

คุณจะเรียนรู้อะไรในบทเรียน “การดึงข้อมูลจากเว็บด้วย BeautifulSoup”

ทำความเข้าใจวิธีสกัดข้อมูลจากเว็บไซต์ด้วย Python คุณปฏิบัติ Learn AI with Python ด้วยโค้ดที่ใช้งานได้จริงที่คุณเรียกใช้โดยตรงในเบราว์เซอร์ และติวเตอร์ AI ตลอด 24/7 ตอบคำถามของคุณขณะที่คุณไปผ่านบทเรียน

คุณต้องมีประสบการณ์ก่อนที่จะเริ่มเรียน Learn AI with Python หรือไม่

ไม่จำเป็นต้องมีประสบการณ์มาก่อน Learn AI with Python บน CoddyKit ออกแบบมาสำหรับผู้เริ่มต้นไปจนถึงผู้เรียนขั้นสูง คุณสามารถเริ่มต้นที่นี่หรือเริ่มจากตัวแรกและเรียนด้วยความเร็วของคุณเอง นี่คือบทเรียนที่ 5 จากทั้งหมด 5 บทเรียน

บทเรียน “การดึงข้อมูลจากเว็บด้วย BeautifulSoup” ใช้เวลานานแค่ไหน

บทเรียน CoddyKit ส่วนใหญ่ใช้เวลาประมาณ 5–10 นาที แต่ละบทเรียนจึงสั้นและเป็นแบบโต้ตอบ คุณสามารถก้าวหน้าอย่างต่อเนื่องและกลับมาเรียนต่อจากตรงที่เพิ่งหยุดบนเว็บและแอปได้เลย

ฉันเขียนและรันโค้ดในบทเรียน Learn AI with Python นี้ได้ไหม

ได้ บทเรียน Learn AI with Python ทุกบทมีตัวแก้ไขโค้ดในตัว คุณจึงเขียนและรันโค้ดจริงได้เลยในเบราว์เซอร์ และได้รับข้อเสนอแนะจาก AI ในทันที — ไม่ต้องติดตั้งในเครื่องของคุณ

บทเรียนทั้งหมดในหลักสูตรนี้

  1. การวิเคราะห์ข้อมูลด้วย Pandas
  2. การแสดงภาพข้อมูลด้วย Matplotlib
  3. NumPy สำหรับการคำนวณเชิงตัวเลข
  4. การจัดการ API ด้วย requests
  5. การดึงข้อมูลจากเว็บด้วย BeautifulSoup
← กลับไปที่ Learn AI with Python