Python Academy · पाठ

BeautifulSoup के साथ वेब स्क्रैपिंग

Python का उपयोग करके वेबसाइटों से डेटा निकालना समझें

पाठ 5, कुल 5 में से11 चरण

BeautifulSoup के साथ वेब स्क्रैपिंग, CoddyKit पर Python Academy का एक निःशुल्क पाठ है। यह 5 में से 5वाँ पाठ है। आप नीचे पूरा पाठ निःशुल्क पढ़ सकते हैं—फिर अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर के साथ ब्राउज़र में इसका व्यावहारिक अभ्यास कर सकते हैं। यह Python Academy सीखने के मार्ग का हिस्सा है और आपकी प्रगति वेब तथा CoddyKit ऐप पर सिंक होती रहती है। Python Academy पाठ्यक्रम में कुल 5 पाठ शामिल हैं।

वेब से डेटा निकालने का परिचय

वेब से डेटा निकालना वेबसाइटों से डेटा प्राप्त करने की प्रक्रिया है। पाइथन की BeautifulSoup लाइब्रेरी HTML या एक्सएमएल दस्तावेज़ों का विश्लेषण करना और उनमें खोजबीन करना आसान बनाती है।

इस पाठ में आप वेब से डेटा निकालने के लिए BeautifulSoup का उपयोग करना सीखेंगे।

BeautifulSoup के साथ वेब स्क्रैपिंग — चित्र 1

BeautifulSoup इंस्टॉल करना

BeautifulSoup और आवश्यक requests लाइब्रेरी इंस्टॉल करने के लिए निम्नलिखित कमांड का उपयोग करें:

pip install beautifulsoup4
pip install requests

इंस्टॉल करने के बाद आप इन्हें अपने पाइथन प्रोग्रामों में इम्पोर्ट कर सकते हैं:

# Importing BeautifulSoup
from bs4 import BeautifulSoup
import requests

print("BeautifulSoup imported successfully")

वेब पृष्ठ प्राप्त करना

आप requests लाइब्रेरी का उपयोग करके कोई वेब पृष्ठ प्राप्त कर सकते हैं:

# Fetching a web page
response = requests.get("https://example.com")
print(response.text)  # Outputs the HTML content

BeautifulSoup से HTML का विश्लेषण करना

BeautifulSoup HTML दस्तावेज़ों का विश्लेषण करने और उनमें खोजबीन करने के लिए विधियाँ उपलब्ध कराता है:

# Parsing HTML
html_content = "<html><body><h1>Hello, World!</h1></body></html>"
soup = BeautifulSoup(html_content, "html.parser")
print(soup.h1.text)  # Outputs: Hello, World!

तत्व ढूँढना

BeautifulSoup तत्वों को ढूँढने के लिए find() और find_all() जैसी विधियाँ उपलब्ध कराता है:

# Finding elements
soup = BeautifulSoup("<html><body><p class='content'>Hello!</p><p>World!</p></body></html>", "html.parser")
element = soup.find("p", class_="content")
print(element.text)  # Outputs: Hello!

लिंक निकालना

आप किसी वेब पृष्ठ से सभी लिंक (<a> टैग) निकाल सकते हैं:

# Extracting links
html = "<html><body><a href='https://example.com'>Example</a></body></html>"
soup = BeautifulSoup(html, "html.parser")
links = soup.find_all("a")
for link in links:
    print(link['href'])  # Outputs: https://example.com

तालिकाएँ निकालना

BeautifulSoup HTML तालिकाओं से डेटा निकालना आसान बनाता है:

# Extracting table data
html = "<table><tr><td>Row 1</td></tr><tr><td>Row 2</td></tr></table>"
soup = BeautifulSoup(html, "html.parser")
rows = soup.find_all("tr")
for row in rows:
    print(row.text)  # Outputs: Row 1, Row 2

अनुपस्थित तत्वों को संभालना

BeautifulSoup अनुपस्थित तत्वों को सुरक्षित रूप से संभालने के लिए विधियाँ उपलब्ध कराता है:

# Handling missing elements
soup = BeautifulSoup("<html><body></body></html>", "html.parser")
element = soup.find("p")
print(element)  # Outputs: None

BeautifulSoup में सामान्य गलतियाँ

यहाँ कुछ ऐसी गलतियाँ दी गई हैं जिनसे बचना चाहिए:

  • उचित HTML पार्सर, जैसे html.parser या lxml, का उपयोग न करना।
  • उचित हेडर के बिना अवरुद्ध या सुरक्षित वेबसाइटों से सामग्री प्राप्त करना।
  • बहुत अधिक बार डेटा निकालना, जिससे आपका IP प्रतिबंधित हो सकता है।

हमने क्या सीखा

इस पाठ में आपने सीखा:

  • BeautifulSoup और requests को इंस्टॉल और इम्पोर्ट करना।
  • HTML सामग्री प्राप्त करना, उसका विश्लेषण करना और उसमें खोजबीन करना।
  • लिंक और तालिकाओं जैसे विशिष्ट तत्वों को निकालना।
  • अनुपस्थित तत्वों को सुरक्षित रूप से संभालना।

बहुत अच्छा! अब अगले विषय पर चलते हैं।

BeautifulSoup के साथ वेब स्क्रैपिंग — चित्र 11
शुरुआत निःशुल्क

एआई शिक्षक के साथ Python सीखें — निःशुल्क

अपने ब्राउज़र में वास्तविक कोड लिखें और चलाएँ, चौबीसों घंटे एआई शिक्षक से तुरंत सहायता पाएँ, और वेब या ऐप पर वहीं से शुरू करें जहाँ आपने छोड़ा था।

पाठ्यक्रम
76
पाठ
320

अक्सर पूछे जाने वाले प्रश्न

क्या “BeautifulSoup के साथ वेब स्क्रैपिंग” पाठ निःशुल्क है?

हाँ—“BeautifulSoup के साथ वेब स्क्रैपिंग” का पूरा पाठ यहाँ वेब पर निःशुल्क पढ़ा जा सकता है। इंटरैक्टिव अभ्यास (अंतर्निहित कोड संपादक और 24/7 एआई ट्यूटर) करने और Python Academy पाठ्यक्रम का बाकी हिस्सा अनलॉक करने के लिए CoddyKit PRO लें। Python Academy पाठ्यक्रम में कुल 5 पाठ शामिल हैं।

“BeautifulSoup के साथ वेब स्क्रैपिंग” में मैं क्या सीखूँगा?

Python का उपयोग करके वेबसाइटों से डेटा निकालना समझें आप ब्राउज़र में सीधे चलाए जाने वाले व्यावहारिक कोड के साथ Python Academy का अभ्यास करते हैं, और पाठ पूरा करते समय 24/7 एआई ट्यूटर आपके प्रश्नों के उत्तर देता है।

क्या Python Academy शुरू करने के लिए मुझे किसी अनुभव की आवश्यकता है?

पहले के अनुभव की आवश्यकता नहीं है। CoddyKit पर Python Academy शुरुआती से लेकर उन्नत शिक्षार्थियों तक सभी के लिए व्यवस्थित किया गया है, इसलिए आप यहीं से या शुरुआत से सीखना शुरू कर सकते हैं और अपनी गति से आगे बढ़ सकते हैं। यह 5 में से 5वाँ पाठ है।

“BeautifulSoup के साथ वेब स्क्रैपिंग” पाठ पूरा करने में कितना समय लगता है?

CoddyKit का अधिकांश पाठ लगभग 5–10 मिनट में पूरा हो जाता है। हर पाठ छोटा और संवादात्मक है, इसलिए आप लगातार प्रगति करते हैं और वेब या ऐप पर वहीं से सीखना जारी रख सकते हैं जहाँ आपने छोड़ा था।

क्या मैं इस Python Academy पाठ में कोड लिख और चला सकता हूँ?

हाँ। हर Python Academy पाठ में एक अंतर्निर्मित कोड संपादक शामिल है, जिससे आप सीधे अपने ब्राउज़र में वास्तविक कोड लिख और चला सकते हैं और तुरंत एआई प्रतिक्रिया पा सकते हैं—स्थानीय सेटअप की आवश्यकता नहीं है।

इस पाठ्यक्रम के सभी पाठ

  1. Pandas के साथ डेटा विश्लेषण
  2. Matplotlib के साथ डेटा विज़ुअलाइज़ेशन
  3. संख्यात्मक गणनाओं के लिए NumPy
  4. requests के साथ APIs संभालना
  5. BeautifulSoup के साथ वेब स्क्रैपिंग
← Python Academy पर वापस जाएँ