Lær AI med Python · Lektion

Indlæsning, opdeling og embedding af dokumenter

PyPDFLoader, RecursiveCharacterTextSplitter, OpenAIEmbeddings, strategier for embeddings.

Lektion 2 af 413 trin

Indlæsning, opdeling og embedding af dokumenter er en gratis Lær AI med Python-lektion på CoddyKit. Dette er lektion 2 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i Lær AI med Python, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. Lær AI med Python-kurset indeholder 4 lektioner i alt.

RAG-indlæsningsforløbet

Før en LLM kan svare ud fra dine dokumenter, skal du indlæse, opdele og indlejre dem. Denne lektion gennemgår dette indlæsningsforløb, som er grundlaget for ethvert system med hentningsforstærket generering.

pip install langchain-community pypdf langchain-openai

Indlæsning af en PDF

PyPDFLoader læser en PDF og returnerer en liste med Document-objekter, ét pr. side. Hvert Document har page_content (teksten) og metadata (kilde og sidetal).

from langchain_community.document_loaders import PyPDFLoader

loader = PyPDFLoader("handbook.pdf")
docs = loader.load()
print(len(docs), "pages")

Hvorfor opdele dokumenter?

Hele sider er ofte for store til at blive indlejret eller få plads i en prompt. Opdeling bryder teksten op i mindre tekststykker, der kan indlejres effektivt, og lader hentningen returnere den relevante passage i stedet for en hel side.

RecursiveCharacterTextSplitter

Den anbefalede komponent til opdeling er RecursiveCharacterTextSplitter. Den forsøger først at opdele ved afsnit, derefter ved sætninger og til sidst ved ord, så tekststykkerne bevarer deres semantiske sammenhæng i stedet for at blive skåret over midt i et ord.

from langchain_text_splitters import RecursiveCharacterTextSplitter

splitter = RecursiveCharacterTextSplitter(
    chunk_size=1000,
    chunk_overlap=200
)

chunk_size og chunk_overlap

chunk_size angiver det maksimale antal tegn pr. tekststykke, mens chunk_overlap gentager noget tekst mellem nabotekststykker, så kontekst ikke går tabt ved grænserne. En opdeling på 1000/200 er et almindeligt udgangspunkt.

chunks = splitter.split_documents(docs)
print(len(chunks), "chunks")
print(chunks[0].page_content[:120])

Justering af tekststykkernes størrelse

Små tekststykker giver præcis hentning, men kan mangle den omkringliggende kontekst. Store tekststykker bevarer konteksten, men udvander relevansen og koster flere tokens. En overlapning på 10-20 % af tekststykkets størrelse er en god standardindstilling til at forbinde grænserne.

Hvad er indlejringer?

En indlejring omdanner tekst til en vektor med en fast længde, som indfanger betydningen. Tekster med lignende betydning giver vektorer, der ligger tæt på hinanden. Det gør det muligt at søge efter semantisk lighed i stedet for nøgleord.

OpenAIEmbeddings

Opret indlejringer med OpenAIEmbeddings. Modellen text-embedding-3-small er billig og effektiv. embed_query indlejrer én tekststreng, mens embed_documents indlejrer en liste.

from langchain_openai import OpenAIEmbeddings

embeddings = OpenAIEmbeddings(model="text-embedding-3-small")
vector = embeddings.embed_query("How do I reset my password?")
print(len(vector))  # 1536

Indlejring af flere tekststykker

Indlejr alle dine tekststykker på én gang. Hvert tekststykke bliver til en vektor, som du senere gemmer i en vektordatabase til hurtig søgning efter lighed.

texts = [c.page_content for c in chunks]
vectors = embeddings.embed_documents(texts)
print(len(vectors), "vectors of dim", len(vectors[0]))

Beregning af omkostninger ved indlejring

Indlejringer afregnes pr. token. Beregn det samlede antal tokens på tværs af alle tekststykker, og gang derefter med prisen pr. 1.000 tokens. Hvis du tæller før indlejringen, undgår du uventede regninger for store tekstsamlinger.

import tiktoken
enc = tiktoken.get_encoding("cl100k_base")
total = sum(len(enc.encode(c.page_content)) for c in chunks)
price_per_1k = 0.00002
print("tokens:", total, "cost $:", total / 1000 * price_per_1k)

Opsummering af forløbet

Indlæsningsforløbet er: indlæs dokumenter, opdel dem i tekststykker med overlap, indlejr hvert tekststykke i en vektor, og gem dem i næste lektion. God opdeling og fokus på omkostningerne her afgør kvaliteten og prisen for hele RAG-systemet.

Hurtigt tjek

Test din viden om indlæsning.

Opsamling: Indlæsning, opdeling og indlejring

Du brugte PyPDFLoader til at indlæse dokumenter, RecursiveCharacterTextSplitter med chunk_size og chunk_overlap til at opdele dem i tekststykker og OpenAIEmbeddings til at omdanne tekststykkerne til vektorer. Du lærte også at beregne omkostningen ved indlejring pr. token, før du behandler en stor tekstsamling.

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
53
Lektioner
225

Ofte stillede spørgsmål

Er lektionen “Indlæsning, opdeling og embedding af dokumenter” gratis?

Ja — alle 3 lektioner i læringssporet Lær AI med Python, inklusive “Indlæsning, opdeling og embedding af dokumenter”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Lær AI med Python-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Indlæsning, opdeling og embedding af dokumenter”?

PyPDFLoader, RecursiveCharacterTextSplitter, OpenAIEmbeddings, strategier for embeddings. Du øver dig i Lær AI med Python med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på Lær AI med Python?

Der kræves ingen tidligere erfaring. Lær AI med Python på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 2 af 4.

Hvor lang tid tager lektionen “Indlæsning, opdeling og embedding af dokumenter”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne Lær AI med Python-lektion?

Ja. Alle Lær AI med Python-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. LangChain-arkitektur og LCEL
  2. Indlæsning, opdeling og embedding af dokumenter
  3. Vector stores: Chroma og FAISS
  4. Byg et RAG-spørgsmål-og-svar-system fra ende til anden
← Tilbage til Lær AI med Python