Data Woordenboek

Semantische zoekopdracht (semantic search)

Wat is een semantische zoekopdracht?

Een semantische zoekopdracht vindt resultaten op basis van wat je bedoelt, niet de exacte woorden die je typte. Zoek op "mijn abonnement opzeggen" en het kan een hulppagina met de titel "je lidmaatschap beëindigen" terugbrengen, ook al delen die twee geen enkel woord.

Klassiek zoeken matcht reeksen tekens. Als de pagina jouw zoekterm niet bevat, komt ze niet terug. Semantisch zoeken werkt op betekenis, zodat bewoording, synoniemen en formulering niet langer in de weg zitten. Daarom voelt het dichter bij iets vragen aan een collega die het onderwerp goed kent dan bij het bevragen van een database.

Hoe een semantische zoekopdracht werkt

Het idee is om betekenis voor te stellen als getallen. Een embeddingmodel leest een stuk tekst en zet het om in een lijst getallen, een vector, die de betekenis vastlegt. Teksten met een gelijkaardige betekenis krijgen vectoren die dicht bij elkaar liggen, ook als ze andere woorden gebruiken.

De flow verloopt in twee fases.

  1. Indexeren. Elk document, of een stuk ervan, gaat door het embeddingmodel en wordt bewaard als een vector, meestal in een vector database die voor deze taak gebouwd is.

  2. Bevragen. Je zoekopdracht wordt op dezelfde manier in een vector omgezet. Het systeem zoekt dan de bewaarde vectoren die er het dichtst bij liggen en brengt de tekst erachter terug.

Je zoekopdracht een voor een vergelijken met elke bewaarde vector is te traag zodra je er miljoenen hebt. Daarom gebruiken vector databases approximate nearest neighbour search, meestal afgekort tot ANN. Het ruilt een klein beetje nauwkeurigheid voor een grote winst in snelheid, en geeft resultaten die bijna altijd de echte dichtste matches zijn, in een fractie van de tijd.

Semantisch zoeken versus zoeken op trefwoorden

Zoeken op trefwoorden is exact en voorspelbaar. Als je een specifieke productcode, een foutnummer of een achternaam opzoekt, wil je de letterlijke match, en zoeken op trefwoorden geeft je die rechtstreeks. Het heeft ook geen model nodig en is goedkoop om te draaien.

Semantisch zoeken wint wanneer hetzelfde idee op veel manieren verwoord kan worden, of wanneer mensen de exacte term niet kennen om op te zoeken. De zwakte is het spiegelbeeld van de sterkte: omdat het op betekenis werkt, kan het een exacte code of naam missen die een trefwoordindex wel gevonden had.

Omdat elk de blinde vlek van het andere afdekt, draaien veel systemen beide en voegen ze de resultaten samen. Die combinatie heeft een eigen naam, hybrid search, en is in de praktijk vaak de meest betrouwbare optie.

Waarom semantisch zoeken de basis vormt onder RAG

Retrieval-augmented generation, of RAG, is het gangbare patroon om een taalmodel toegang te geven tot je eigen documenten. Voor het model antwoordt, haalt het systeem de meest relevante passages op en geeft ze mee als context, zodat het antwoord geworteld is in echt materiaal in plaats van in het geheugen van het model.

Semantisch zoeken is de ophaalstap. Als je een vraag stelt, is dat het deel dat de handvol passages vindt die er echt over gaan, uit de duizenden die je bewaard hebt. Een RAG-systeem is maar zo goed als de passages die het ophaalt, dus de kwaliteit van het semantisch zoeken bepaalt de kwaliteit van het antwoord. Zwak ophalen leidt recht naar een zelfzeker maar fout antwoord.

Waar moet je op letten bij het gebruik van semantisch zoeken

Het embeddingmodel bepaalt het plafond. Een model dat getraind is op algemene webtekst begrijpt het jargon van jouw sector misschien niet. Als twee termen die je bedrijf als verschillend behandelt er voor het model gelijk uitzien, lijdt de zoekkwaliteit eronder. Het voeden met data uit je eigen vakgebied kan de extra moeite waard zijn.

Chunking bepaalt wat vindbaar is. Tekst wordt meestal in stukken, chunks, gesplitst voor het embedden. Chunks die te groot zijn, vervagen meerdere ideeën tot een vage vector. Te klein en ze verliezen de context die ze betekenis gaf. Hoe je de tekst splitst, bepaalt stilletjes elk resultaat.

Exacte matches kunnen erdoor glippen. Een puur semantisch systeem kan een resultaat dat qua betekenis dicht ligt hoger zetten dan de exacte code of naam die iemand typte. Waar precieze matches tellen, voeg je zoeken op trefwoorden of hybrid search toe in plaats van enkel op betekenis te vertrouwen.

Het kost meer om te draaien. Elk document embedden, de vectoren bewaren en de zoekopdracht draaien vraagt rekenkracht en geheugen die een trefwoordindex niet nodig heeft. Voor een kleine, nette set documenten kan zoeken op trefwoorden volstaan.

Laatst Bijgewerkt: July 18, 2026 Terug naar Woordenboek
Trefwoorden
semantische zoekopdracht semantic search embeddings vector search ann vector database hybrid search rag chunking ai