Analyzers, tokenizers en de inverted index
Leer hoe Elasticsearch tekst met analyzers omzet in doorzoekbare tokens en die opslaat in een inverted index.
Analyzers, tokenizers en de inverted index is een gratis Elasticsearch en systemen voor zoeken in volledige tekst-les op CoddyKit. Dit is les 4 van 4. Je kunt de volledige les hieronder gratis lezen en daarna in de browser praktisch oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is. Deze les maakt deel uit van het leertraject Elasticsearch en systemen voor zoeken in volledige tekst. Je voortgang wordt gesynchroniseerd op het web en in de CoddyKit-app. De cursus Elasticsearch en systemen voor zoeken in volledige tekst bevat in totaal 4 lessen.
Van tekst naar tokens
Voordat tekst doorzoekbaar is, splitst een analyzer de tekst op in tokens en slaat deze op in een geïnverteerde index. Dat is de eerste stap van elke zoekopdracht.
De geïnverteerde index
Een geïnverteerde index koppelt elke token aan de documenten die deze token bevatten — net als de index van een boek — waardoor zoekopdrachten in volledige tekst uiterst snel zijn.
Opbouw van een analyzer
Een analyzer doorloopt drie fasen in deze volgorde: tekenfilters schonen onbewerkte tekst op, een tokenizer splitst de tekst op in tokens en tokenfilters passen de tokens aan.
De standaard-analyzer
De standaard standard analyzer splitst op woordgrenzen en zet alles om naar kleine letters, zodat Quick Brown Fox! verandert in quick, brown, fox.
Testen met _analyze
De API _analyze toont precies welke tokens een analyzer uit je tekst produceert — voer deze uit om de uitvoer te bekijken.
POST /_analyze
{
"analyzer": "standard",
"text": "The Quick Brown Foxes"
}Stamvorming
Een filter voor stamvorming reduceert woorden tot hun stam, zodat running, runs en ran allemaal aan run worden gekoppeld — en zoeken op één ervan de andere vindt.
Stopwoorden
Een stopfilter verwijdert weinig waardevolle woorden zoals the, a en is, waardoor de index kleiner wordt en de relevantie verbetert.
Aangepaste analyzer
Definieer een aangepaste analyzer in de indexinstellingen door een tokenizer met filters te combineren — de code koppelt lowercase, stopwoorden en stamvorming aan elkaar.
PUT /articles
{
"settings": { "analysis": { "analyzer": {
"my_english": {
"tokenizer": "standard",
"filter": ["lowercase", "english_stop", "english_stemmer"]
}}}}
}text versus keyword
Een veld van het type text wordt geanalyseerd voor zoeken in volledige tekst; een veld van het type keyword blijft één exacte token voor filteren, sorteren en aggregaties.
Indexeringstijd versus zoektijd
Analyse wordt uitgevoerd tijdens de indexeringstijd bij het opslaan van een document en opnieuw tijdens het zoeken op de query — meestal met dezelfde analyzer, zodat de tokens overeenkomen.
Toewijzing met meerdere velden
Een handige truc: wijs een tekenreeks toe als text voor zoeken en voeg tegelijk een subveld .keyword toe voor exacte overeenkomsten en aggregaties.
"title": { "type": "text",
"fields": { "raw": { "type": "keyword" } } }Korte controle
Waarom worden velden van het type text en keyword verschillend behandeld?
Samenvatting
Samenvatting: analyzers (filters, tokenizer, filters) bouwen de geïnverteerde index op, stamvorming en stopwoorden verfijnen deze en text versus keyword bepaalt hoe velden zich gedragen.
Leer Elasticsearch en systemen voor zoeken in volledige tekst met een AI-tutor — gratis
Schrijf echte code en voer die uit in je browser, krijg direct hulp van een AI-tutor die 24/7 beschikbaar is en ga verder waar je gebleven bent op het web of in de app.
- Cursussen
- 12
- Lessen
- 48
Veelgestelde vragen
Is de les “Analyzers, tokenizers en de inverted index” gratis?
Ja — de volledige tekst van “Analyzers, tokenizers en de inverted index” kun je hier gratis op het web lezen. Als je interactief wilt oefenen met een ingebouwde code-editor en een AI-begeleider die 24/7 beschikbaar is, en de rest van de cursus Elasticsearch en systemen voor zoeken in volledige tekst wilt ontgrendelen, kun je upgraden naar CoddyKit PRO. De cursus Elasticsearch en systemen voor zoeken in volledige tekst bevat in totaal 4 lessen.
Wat leer ik in “Analyzers, tokenizers en de inverted index”?
Leer hoe Elasticsearch tekst met analyzers omzet in doorzoekbare tokens en die opslaat in een inverted index. Je oefent met Elasticsearch en systemen voor zoeken in volledige tekst door code rechtstreeks in de browser uit te voeren. Een AI-begeleider die 24/7 beschikbaar is beantwoordt je vragen terwijl je de les doorwerkt.
Heb ik ervaring nodig om met Elasticsearch en systemen voor zoeken in volledige tekst te beginnen?
Ervaring vooraf is niet nodig. Elasticsearch en systemen voor zoeken in volledige tekst op CoddyKit is opgebouwd voor beginners tot gevorderden, zodat je hier of bij het begin kunt starten en in je eigen tempo kunt leren. Dit is les 4 van 4.
Hoe lang duurt de les “Analyzers, tokenizers en de inverted index”?
De meeste lessen van CoddyKit duren ongeveer 5–10 minuten. Elke les is kort en interactief, zodat je gestaag vooruitgaat en op het web en in de app precies verdergaat waar je was gebleven.
Kan ik code schrijven en uitvoeren in deze les over Elasticsearch en systemen voor zoeken in volledige tekst?
Ja. Elke les over Elasticsearch en systemen voor zoeken in volledige tekst bevat een ingebouwde code-editor, zodat je rechtstreeks in je browser echte code kunt schrijven en uitvoeren en direct feedback van AI krijgt — lokale installatie is niet nodig.
Alle lessen in deze cursus
- Wat is full-text search?
- Kernconcepten van Elasticsearch
- Uw eerste cluster opzetten
- Analyzers, tokenizers en de inverted index