Tekoälyagentit LangChainilla ja autonomiset työnkulut · Oppitunti

Dokumenttilataajien perusteet

Tutustukaa siihen, miten PDF-tiedostoista, verkkosivuista ja tietokannoista ladataan tietoa LangChainille sopivaan käyttömuotoon.

Oppitunti 1/411 vaihetta

Dokumenttilataajien perusteet on ilmainen Tekoälyagentit LangChainilla ja autonomiset työnkulut-oppitunti CoddyKitissä. Tämä on oppitunti 1/4. Voit lukea koko oppitunnin alta ilmaiseksi ja harjoitella sen jälkeen käytännössä selaimessa sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla. Oppitunti kuuluu Tekoälyagentit LangChainilla ja autonomiset työnkulut-oppimispolkuun, ja edistymisesi synkronoituu verkon ja CoddyKit-sovelluksen välillä. Tekoälyagentit LangChainilla ja autonomiset työnkulut-kurssilla on yhteensä 4 oppituntia.

Data älykkäämpiä LLM:iä varten

Suuret kielimallit (LLM:t) ovat tehokkaita, mutta niiden tietämys rajoittuu koulutusdataan. Jotta tekoälyagenteista saadaan todella hyödyllisiä, ne tarvitsevat usein pääsyn ajantasaiseen ulkoiseen tietoon.

  • Kuvitelkaa agentti, jonka on vastattava tämän päivän uutisia koskeviin kysymyksiin.
  • Tai agentti, joka tiivistää tietyn asiakirjan yrityksenne sisäiseltä levyltä.

Tässä tarvitaan datan lataamista.

Mitä dokumenttilataajat ovat?

Dokumenttilataajat ovat LangChainin tapa tuoda ulkoista dataa agentin työnkulkuun. Ne toimivat siltoina, jotka muuntavat eri lähteistä peräisin olevan raak datan standardoituun muotoon, jota LLM:t ymmärtävät.

Voitte ajatella niitä erikoistuneina dataliittiminä. Ne käsittelevät tiedostojen lukemisen, verkkosivujen hakemisen ja tietokantojen kyselyjen kaltaiset yksityiskohdat ja esittävät datan sitten selkeästi LangChainille.

LangChainin Document-olio

Kun lataaja hakee dataa, se pakkaa sen Document-olioon. Tämä on LangChainin yleiskäyttöinen datan säilö.

Jokaisella Document-oliolla on yleensä kaksi pääosaa:

  • page_content: lähteestä poimittu varsinainen tekstisisältö (esimerkiksi PDF-sivun tai verkkoartikkelin teksti).
  • metadata: sanakirja, joka sisältää asiakirjan lisätietoja (esimerkiksi lähteen URL-osoitteen, sivunumeron, tiedostopolun ja luontipäivän).

Paikallisten tekstitiedostojen lataaminen

Yksi yksinkertaisimmista tavoista ladata dataa on lukea se tietokoneella olevasta pelkästä tekstitiedostosta. LangChain tarjoaa tätä varten TextLoader-lataajan.

Se ottaa tiedostopolun, lukee sisällön ja luo Document-olion. Katsotaan, miten se toimii luomalla väliaikainen tiedosto ja lataamalla se.

TextLoader käytännössä

Tässä esimerkissä luodaan väliaikainen tekstitiedosto, kirjoitetaan siihen sisältöä, luetaan se sitten TextLoader-lataajalla ja tulostetaan tulos.

from langchain_community.document_loaders import TextLoader
import os
import tempfile

if __name__ == "__main__":
    # Create a temporary file
    with tempfile.NamedTemporaryFile(mode='w', delete=False, encoding='utf-8') as temp_file:
        temp_file.write("Hello CoddyKit!\nThis is a test document.")
        temp_file_path = temp_file.name

    print(f"Created temp file: {temp_file_path}")

    try:
        # Load the document using TextLoader
        loader = TextLoader(temp_file_path)
        documents = loader.load()

        # Print the content of the loaded document
        for doc in documents:
            print("--- Document Content ---")
            print(doc.page_content)
            print("--- Metadata ---")
            print(doc.metadata)
    finally:
        # Clean up the temporary file
        os.remove(temp_file_path)
        print(f"Cleaned up temp file: {temp_file_path}")

Verkkosisällön lataaminen WebBaseLoaderilla

Entä jos data on internetissä? WebBaseLoader sopii erinomaisesti sisällön hakemiseen suoraan verkkosivuilta.

Se osaa poimia pääasiallisen tekstisisällön ja jättää navigoinnin, mainokset sekä muut epäolennaiset elementit huomiotta. Teidän tarvitsee antaa sille vain URL-osoite!

WebBaseLoader-esimerkki

Näin haette sisältöä yksinkertaiselta esimerkkiverkkosivulta. Huomautus: tämä lataaja edellyttää yleensä, että beautifulsoup4 ja lxml on asennettu.

from langchain_community.document_loaders import WebBaseLoader

if __name__ == "__main__":
    # Define the URL to load
    url = "https://www.google.com/search?q=hello"
    print(f"Loading content from: {url}")

    # Initialize the WebBaseLoader
    loader = WebBaseLoader(url)

    # Load the documents
    documents = loader.load()

    # Print the content of the first loaded document
    if documents:
        print("--- Extracted Content (first 200 chars) ---")
        print(documents[0].page_content[:200] + "...")
        print("--- Metadata ---")
        print(documents[0].metadata)
    else:
        print("No documents loaded.")

PDF-tiedostot ja jäsennellyt asiakirjat

Datan lataaminen PDF-tiedostoista on yleinen tarve. LangChain tarjoaa tähän lataajia, kuten PyPDFLoader-lataajan (joka käyttää pypdf-kirjastoa).

Nämä lataajat on suunniteltu poimimaan tekstiä monimutkaisista muodoista ja usein säilyttämään osan rakenteesta. PDF-tiedostoissa jokaisesta sivusta voi tulla erillinen Document-olio, jonka metatiedot ilmaisevat sivunumeron.

Lataajia on myös muille muodoille, kuten CSV:lle, JSON:lle ja Markdownille, sekä tietyille tietorakenteille, kuten Notion-tietokannoille ja Confluence-sivuille.

Tiedostoja pidemmälle: tietokantalataajat

Data saattaa sijaita tietokannoissa. LangChain tukee erilaisia tietokantalataajia, joilla voitte muodostaa suoran yhteyden datalähteisiinne:

  • SQL Database Loader: muodostaa yhteyden relaatiotietokantoihin (esimerkiksi PostgreSQL ja MySQL) ja hakee dataa kyselyjen perusteella.
  • MongoDB Loader: NoSQL-dokumenttitietokantoja varten.
  • Elasticsearch Loader: datan hakemiseen Elasticsearch-indekseistä.

Näiden lataajien avulla agenttinne voivat tehdä kyselyitä olemassa olevaan datainfrastruktuuriinne ja hakea siitä dataa dynaamisesti.

Pikatarkistus

Mikä seuraavista EI ole LangChainin Document Loader -lataajan ensisijainen tarkoitus?

Kertaus: dokumenttilataajat

Tässä oppitunnissa tutustuimme LangChainin Document Loaders -komponentteihin, jotka ovat välttämättömiä työkaluja ulkoisen datan tuomisessa tekoälyagentteihin.

  • Lataajat muuntavat erilaiset tietolähteet (tekstitiedostot, verkkosivut, PDF-tiedostot ja tietokannat) LangChainin yleiseksi Document-objektiksi.
  • Jokainen Document sisältää kentät page_content ja metadata.
  • Tutustuimme käytännön esimerkkeihin, joissa paikallisten tiedostojen lataamiseen käytettiin TextLoader-komponenttia ja verkkosisällön lataamiseen WebBaseLoader-komponenttia.

Seuraavaksi opimme käsittelemään suuria dokumentteja jakamalla ne hallittavan kokoisiin osiin.

Aloita maksutta

Opi Tekoälyagentit LangChainilla ja autonomiset työnkulut tekoälytuutorin avulla — ilmaiseksi

Kirjoita ja suorita oikeaa koodia selaimessa, saa välitöntä apua tekoälytuutorilta ympäri vuorokauden ja jatka siitä, mihin jäit, verkossa tai sovelluksessa.

Kurssit
12
Oppitunnit
50

Usein kysytyt kysymykset

Onko oppitunti ”Dokumenttilataajien perusteet” ilmainen?

Kyllä – oppitunnin ”Dokumenttilataajien perusteet” koko tekstin voi lukea täällä verkossa ilmaiseksi. Jos haluat harjoitella interaktiivisesti sisäänrakennetulla koodieditorilla ja ympäri vuorokauden käytettävissä olevan tekoälytuutorin avulla sekä avata koko Tekoälyagentit LangChainilla ja autonomiset työnkulut-kurssin, päivitä CoddyKit PROhon. Tekoälyagentit LangChainilla ja autonomiset työnkulut-kurssilla on yhteensä 4 oppituntia.

Mitä opin oppitunnilla ”Dokumenttilataajien perusteet”?

Tutustukaa siihen, miten PDF-tiedostoista, verkkosivuista ja tietokannoista ladataan tietoa LangChainille sopivaan käyttömuotoon. Harjoittelet Tekoälyagentit LangChainilla ja autonomiset työnkulut-aihetta koodilla, jonka suoritat suoraan selaimessa. Ympäri vuorokauden käytettävissä oleva tekoälytuutori vastaa kysymyksiisi oppitunnin aikana.

Tarvitsenko kokemusta aloittaakseni Tekoälyagentit LangChainilla ja autonomiset työnkulut-opiskelun?

Aiempi kokemus ei ole tarpeen. CoddyKitin Tekoälyagentit LangChainilla ja autonomiset työnkulut-oppimispolku sopii vasta-alkajista edistyneisiin, joten voit aloittaa tästä tai alusta ja edetä omaan tahtiisi. Tämä on oppitunti 1/4.

Kuinka kauan ”Dokumenttilataajien perusteet”-oppitunnin suorittaminen kestää?

Useimmat CoddyKitin oppitunnit kestävät noin 5–10 minuuttia. Jokainen oppitunti on lyhyt ja interaktiivinen, joten edistyt tasaisesti ja voit jatkaa siitä, mihin jäit – sekä verkossa että sovelluksessa.

Voinko kirjoittaa ja suorittaa koodia tällä Tekoälyagentit LangChainilla ja autonomiset työnkulut-oppitunnilla?

Kyllä. Jokainen Tekoälyagentit LangChainilla ja autonomiset työnkulut-oppitunti sisältää sisäänrakennetun koodieditorin, joten voit kirjoittaa ja suorittaa oikeaa koodia suoraan selaimessa ja saada välitöntä palautetta tekoälyltä – paikallista asennusta ei tarvita.

Kaikki tämän kurssin oppitunnit

  1. Dokumenttilataajien perusteet
  2. Tekstin jakajat ja upotukset
  3. Vektorivarastot tiedonhakuun
  4. Retrievert ja kontekstuaalinen tiivistäminen
← Takaisin: Tekoälyagentit LangChainilla ja autonomiset työnkulut