Elasticsearch en systemen voor zoeken in volledige tekst · Les

Analyzers, tokenizers en de inverted index

Leer hoe Elasticsearch tekst met analyzers omzet in doorzoekbare tokens en die opslaat in een inverted index.

Les 4 van 413 stappen

Analyzers, tokenizers en de inverted index is een gratis Elasticsearch en systemen voor zoeken in volledige tekst-les op CoddyKit. Dit is les 4 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Elasticsearch en systemen voor zoeken in volledige tekst. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Elasticsearch en systemen voor zoeken in volledige tekst bevat in totaal 4 lessen.

Van tekst naar tokens

Voordat tekst doorzoekbaar is, splitst een analyzer de tekst op in tokens en slaat deze op in een geïnverteerde index. Dat is de eerste stap van elke zoekopdracht.

De geïnverteerde index

Een geïnverteerde index koppelt elke token aan de documenten die deze token bevatten — net als de index van een boek — waardoor zoekopdrachten in volledige tekst uiterst snel zijn.

Opbouw van een analyzer

Een analyzer doorloopt drie fasen in deze volgorde: tekenfilters schonen onbewerkte tekst op, een tokenizer splitst de tekst op in tokens en tokenfilters passen de tokens aan.

De standaard-analyzer

De standaard standard analyzer splitst op woordgrenzen en zet alles om naar kleine letters, zodat Quick Brown Fox! verandert in quick, brown, fox.

Testen met _analyze

De API _analyze toont precies welke tokens een analyzer uit je tekst produceert — voer deze uit om de uitvoer te bekijken.

POST /_analyze
{
  "analyzer": "standard",
  "text": "The Quick Brown Foxes"
}

Stamvorming

Een filter voor stamvorming reduceert woorden tot hun stam, zodat running, runs en ran allemaal aan run worden gekoppeld — en zoeken op één ervan de andere vindt.

Stopwoorden

Een stopfilter verwijdert weinig waardevolle woorden zoals the, a en is, waardoor de index kleiner wordt en de relevantie verbetert.

Aangepaste analyzer

Definieer een aangepaste analyzer in de indexinstellingen door een tokenizer met filters te combineren — de code koppelt lowercase, stopwoorden en stamvorming aan elkaar.

PUT /articles
{
  "settings": { "analysis": { "analyzer": {
    "my_english": {
      "tokenizer": "standard",
      "filter": ["lowercase", "english_stop", "english_stemmer"]
    }}}}
}

text versus keyword

Een veld van het type text wordt geanalyseerd voor zoeken in volledige tekst; een veld van het type keyword blijft één exacte token voor filteren, sorteren en aggregaties.

Indexeringstijd versus zoektijd

Analyse wordt uitgevoerd tijdens de indexeringstijd bij het opslaan van een document en opnieuw tijdens het zoeken op de query — meestal met dezelfde analyzer, zodat de tokens overeenkomen.

Toewijzing met meerdere velden

Een handige truc: wijs een tekenreeks toe als text voor zoeken en voeg tegelijk een subveld .keyword toe voor exacte overeenkomsten en aggregaties.

"title": { "type": "text",
  "fields": { "raw": { "type": "keyword" } } }

Korte controle

Waarom worden velden van het type text en keyword verschillend behandeld?

Samenvatting

Samenvatting: analyzers (filters, tokenizer, filters) bouwen de geïnverteerde index op, stamvorming en stopwoorden verfijnen deze en text versus keyword bepaalt hoe velden zich gedragen.

Gratis beginnen

Leer Elasticsearch en systemen voor zoeken in volledige tekst met een AI-tutor — gratis

Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.

Cursussen
12
Lessen
48

Veelgestelde vragen

Is de les “Analyzers, tokenizers en de inverted index” gratis?

Ja — de volledige tekst van “Analyzers, tokenizers en de inverted index” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus Elasticsearch en systemen voor zoeken in volledige tekst wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus Elasticsearch en systemen voor zoeken in volledige tekst bevat in totaal 4 lessen.

Wat leer ik in “Analyzers, tokenizers en de inverted index”?

Leer hoe Elasticsearch tekst met analyzers omzet in doorzoekbare tokens en die opslaat in een inverted index. Je oefent met Elasticsearch en systemen voor zoeken in volledige tekst door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.

Heb ik ervaring nodig om met Elasticsearch en systemen voor zoeken in volledige tekst te beginnen?

Ervaring vooraf is niet nodig. Elasticsearch en systemen voor zoeken in volledige tekst op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 4 van 4.

Hoe lang duurt de les “Analyzers, tokenizers en de inverted index”?

De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.

Kan ik code schrijven en uitvoeren in deze les over Elasticsearch en systemen voor zoeken in volledige tekst?

Ja. Elke les over Elasticsearch en systemen voor zoeken in volledige tekst bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.

Alle lessen in deze cursus

  1. Wat is full-text search?
  2. Kernconcepten van Elasticsearch
  3. Uw eerste cluster opzetten
  4. Analyzers, tokenizers en de inverted index
← Terug naar Elasticsearch en systemen voor zoeken in volledige tekst