NLP Academy · Lektion

Opdeling og embedding af dokumenter

Forbered en søgbar vidensbase

Lektion 2 af 413 trin

Opdeling og embedding af dokumenter er en gratis NLP Academy-lektion på CoddyKit. Dette er lektion 2 af 4. Du kan læse alle 3 lektioner i dette læringsspor gratis i deres fulde længde — derefter låser CoddyKit PRO alle lektioner op samt praktiske øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. Den er en del af læringsforløbet i NLP Academy, og dine fremskridt synkroniseres på tværs af nettet og CoddyKit-appen. NLP Academy-kurset indeholder 4 lektioner i alt.

Dokumenter er for store til at søge i samlet

En lang PDF indeholder mange emner på én gang. For at kunne hente præcist opdeler du den først i mindre dele, der kaldes tekststykker.

Hvad kendetegner et godt tekststykke

Et godt tekststykke udtrykker én sammenhængende tanke: et eller to afsnit. Hvis det er for stort, skjules svaret; hvis det er for lille, går den omgivende kontekst tabt.

Opdeling efter størrelse

Den enkleste metode opdeler teksten efter et fast antal tegn eller tokens. Det er hurtigt, men kan skære en sætning over midt i den.

chunks = [text[i:i+500] for i in range(0, len(text), 500)]

Overlappende tekststykker

For at undgå at skære en idé over lader du tekststykkerne dele et overlap. Når de sidste linjer gentages, bevares konteksten på tværs af grænserne.

Opdeling efter struktur

Smartere opdelere deler først ved afsnit eller overskrifter. Når du respekterer strukturen, handler hvert tekststykke om ét klart emne.

Fra tekst til vektorer

Søgning har brug for tal, ikke ord. En indlejring omdanner hvert tekststykke til en tæt vektor, der indfanger dets betydning.

Betydning findes i afstanden

Indlejringer placerer lignende tekst tæt på hinanden. To tekststykker om den samme idé ligger tæt på hinanden i vektorrummet.

Kald en indlejringsmodel

Du sender tekst til en indlejringsmodel og får en liste med kommatal tilbage. Den samme model skal kode både tekststykker og forespørgsler.

from sentence_transformers import SentenceTransformer
model = SentenceTransformer("all-MiniLM-L6-v2")

Kodning af dine tekststykker

Kør hvert tekststykke gennem modellen for at opbygge dets vektor. Ét kald kan kode hele listen på én gang, så det går hurtigere.

vectors = model.encode(chunks)

Vektordimensioner

Hver vektor har en fast længde, sin dimension. En lille model kan give 384 tal, mens større modeller giver 768 eller flere.

print(vectors.shape)  # (n_chunks, 384)

Gem tekststykke og vektor sammen

Bevar forbindelsen mellem hver vektor, dens oprindelige tekst og dens kilde. Senere henter du ud fra vektoren, men viser det læsbare tekststykke.

Hurtigt tjek

Overvej, hvorfor vi tilføjer overlap, når vi opdeler dokumenter.

Opsummering

Du opdeler dokumenter i tekststykker, eventuelt med overlap, og indlejrer derefter hvert stykke i en vektor. Gem tekst og vektor sammen, så de kan hentes senere. ✅

Gratis at komme i gang

Lær Python med en AI-underviser — gratis

Skriv og kør rigtig kode i din browser, få øjeblikkelig hjælp fra en AI-underviser døgnet rundt, og fortsæt, hvor du slap, på web eller i appen.

Kurser
30
Lektioner
120

Ofte stillede spørgsmål

Er lektionen “Opdeling og embedding af dokumenter” gratis?

Ja — alle 3 lektioner i læringssporet NLP Academy, inklusive “Opdeling og embedding af dokumenter”, kan læses gratis i deres fulde længde her på webstedet. Derefter låser CoddyKit PRO alle lektioner op samt interaktive øvelser med en indbygget kodeeditor og en AI-underviser døgnet rundt. NLP Academy-kurset indeholder 4 lektioner i alt.

Hvad lærer jeg i “Opdeling og embedding af dokumenter”?

Forbered en søgbar vidensbase Du øver dig i NLP Academy med praktisk kode, som du kører direkte i browseren, og en AI-vejleder døgnet rundt besvarer dine spørgsmål, mens du arbejder dig gennem lektionen.

Skal jeg have erfaring for at begynde på NLP Academy?

Der kræves ingen tidligere erfaring. NLP Academy på CoddyKit er tilrettelagt for både begyndere og øvede, så du kan starte her eller fra begyndelsen og lære i dit eget tempo. Dette er lektion 2 af 4.

Hvor lang tid tager lektionen “Opdeling og embedding af dokumenter”?

De fleste CoddyKit-lektioner tager cirka 5–10 minutter. Hver lektion er kort og interaktiv, så du gør løbende fremskridt og kan fortsætte, hvor du slap – på både web og app.

Kan jeg skrive og køre kode i denne NLP Academy-lektion?

Ja. Alle NLP Academy-lektioner har en indbygget kodeeditor, så du kan skrive og køre rigtig kode direkte i din browser og få øjeblikkelig feedback fra AI – uden lokal opsætning.

Alle lektioner i dette kursus

  1. Hvorfor LLM'er har brug for retrieval
  2. Opdeling og embedding af dokumenter
  3. Vektorsøgning med et vector store
  4. Indbyg retrieval i prompten
← Tilbage til NLP Academy