Lagring af data i NoSQL-databaser
Lær, hvornår og hvordan De gemmer scraped data i dokumentorienterede NoSQL-lagre som MongoDB til fleksibel lagring med et løst skema.
Lagring af data i NoSQL-databaser er en gratis Webscraping og botudvikling-lektion på CoddyKit. Dette er lektion 4 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Webscraping og botudvikling, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Webscraping og botudvikling-kurset indeholder 4 lektioner i alt.
Når SQL ikke er nok
Scrapede data er ofte uensartede: Forskellige sider giver forskellige felter, indlejrede strukturer og former, der ændrer sig over tid. Faste SQL-skemaer kan være besværlige i denne situation.
NoSQL-dokumentdatabaser gemmer fleksible JSON-lignende poster og passer derfor naturligt til rodede webdata.
Dokumenter og samlinger
I et dokumentlager som MongoDB:
- Et dokument er én JSON-lignende post.
- En samling grupperer relaterede dokumenter, ligesom en tabel.
- Dokumenter i samme samling behøver ikke at have de samme felter.
{
"title": "Widget",
"price": 9.99,
"tags": ["tools", "sale"],
"vendor": { "name": "Acme", "rating": 4.5 }
}Forbindelse med PyMongo
Driveren pymongo forbinder Python med MongoDB. Hent et database- og et samlingshåndtag for at begynde at skrive.
from pymongo import MongoClient
client = MongoClient('mongodb://localhost:27017')
db = client['scraping']
products = db['products']Indsættelse af dokumenter
Indsæt en enkelt scrapet post med insert_one eller en gruppe med insert_many. MongoDB tildeler automatisk et _id.
record = {'title': 'Gadget', 'price': 14.5, 'tags': ['new']}
result = products.insert_one(record)
print(result.inserted_id)Undgå dubletter med upsert
Når en scraper køres igen, bør den ikke oprette dublerede rækker. En upsert opdaterer det matchende dokument eller indsætter det, hvis det ikke findes, baseret på et stabilt felt som produktets URL.
products.update_one(
{'url': record['url']},
{'$set': record},
upsert=True
)Unikke indeks
Håndhæv entydighed på databaseniveau med et indeks. Det beskytter dataintegriteten, selv hvis din kode indeholder en fejl.
products.create_index('url', unique=True)Forespørgsler på gemte data
Hent poster med filterdokumenter. Operatorer som $gt og $in udtrykker betingelser.
cheap = products.find({'price': {'$lt': 10}})
for doc in cheap:
print(doc['title'], doc['price'])Lagring af indlejrede data og array-data
I modsætning til flade SQL-kolonner bevarer dokumenter indlejrede objekter og arrays direkte. Det bevarer den oprindelige struktur i scrapede sider uden join-tabeller.
review_doc = {
'product': 'Widget',
'reviews': [
{'user': 'a', 'stars': 5},
{'user': 'b', 'stars': 4}
]
}
db['catalog'].insert_one(review_doc)Masseindsættelser for bedre hastighed
Ved store scrapingsopgaver reducerer masseoperationer antallet af rundture markant. Saml skriveoperationerne, og send dem samlet.
from pymongo import UpdateOne
ops = [UpdateOne({'url': r['url']}, {'$set': r}, upsert=True) for r in batch]
products.bulk_write(ops)SQL kontra NoSQL til scraping
Vælg ud fra dine data:
- NoSQL til variable, indlejrede og hurtigt skiftende poster.
- SQL, når felterne er stabile, og du har brug for join-operationer eller strenge begrænsninger.
Mange pipelines gemmer rådata midlertidigt i NoSQL og omdanner dem derefter til SQL til analyse.
Tilføjelse af tidsstempler og metadata
Tilføj altid et tidsstempel til hvert scrapet dokument med tidspunktet for indsamlingen og dets kilde. Så kan du følge datas aktualitet, fejlfinde mislykkede kørsler og udvælge forældede poster til ny scraping.
from datetime import datetime
record['scraped_at'] = datetime.utcnow()
record['source'] = 'site.com'
products.insert_one(record)Hurtigt tjek
Test din forståelse af NoSQL-lagring.
Opsummering
Du har lært at gemme scrapede data permanent i NoSQL: dokumenter og samlinger, forbindelse med PyMongo, upserts og unikke indeks for at forhindre dubletter, forespørgsler, indlejrede data og masseindsættelser.
Dokumentlagre giver scrapers fleksibel og skalerbar permanent lagring.
Lær Python med en AI-underviser — gratis
Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.
- Kurser
- 12
- Lektioner
- 48
Ofte stillede spørgsmål
Er lektionen “Lagring af data i NoSQL-databaser” gratis?
Ja — alle 3 lektioner i læringssporet Webscraping og botudvikling, inklusive “Lagring af data i NoSQL-databaser”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Webscraping og botudvikling-kurset indeholder 4 lektioner i alt.
Hvad lærer jeg i “Lagring af data i NoSQL-databaser”?
Lær, hvornår og hvordan De gemmer scraped data i dokumentorienterede NoSQL-lagre som MongoDB til fleksibel lagring med et løst skema. Du øver dig i Webscraping og botudvikling med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.
Skal jeg have erfaring for at begynde på Webscraping og botudvikling?
Der kræves ingen tidligere erfaring. Webscraping og botudvikling på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 4 af 4.
Hvor lang tid tager lektionen “Lagring af data i NoSQL-databaser”?
De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.
Kan jeg skrive og køre kode i denne Webscraping og botudvikling-lektion?
Ja. Alle Webscraping og botudvikling-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.
Alle lektioner i dette kursus
- Lagring af data i CSV/JSON
- Integration med databaser (SQL)
- Cloud Storage-løsninger
- Lagring af data i NoSQL-databaser