Data Woordenboek

Knowledge cutoff

Wat is een knowledge cutoff?

De knowledge cutoff is de datum waarna een taalmodel niets nieuws meer bijgeleerd heeft. De training stopt, de gewichten liggen vast, en wat daarna gebeurd is zit er gewoon niet in. Het model kan er nog altijd over praten, maar alleen als jij de informatie zelf meegeeft.

Denk aan een gedrukt naslagwerk. Wat klopte op het moment dat het naar de drukker ging staat erin, de rest niet. Het verschil is dat op een boek een jaartal staat. Een model toont dat niet terwijl het antwoordt, dus je ziet aan het antwoord zelf niet welk stuk actueel is en welk stuk een jaar achterloopt.

Elk gehost model heeft er een. Microsoft schrijft het onomwonden in de eigen documentatie voor agents: de modellen hebben een knowledge cutoff en raken niet aan informatie van na dat vaste punt. Daarom bestaan zoekfuncties en ophaaltools als aparte uitbreiding, in plaats van als iets dat het model uit zichzelf doet.

Trainingsdata en betrouwbare kennis zijn twee verschillende datums

Sommige leveranciers publiceren twee datums in plaats van één, en net tussen die twee zitten de meeste slechte antwoorden.

Anthropic vermeldt ze allebei voor elk Claude-model. De training data cutoff is de bredere periode waaruit de trainingsdata komt. De reliable knowledge cutoff is de datum tot waar de kennis van het model het volledigst en het betrouwbaarst is. Bij Claude Haiku 4.5 loopt de trainingsdata tot juli 2025, terwijl de betrouwbare kennis stopt in februari 2025.

Die vijf maanden zijn niet leeg, ze zijn dun. Op het moment dat de training afliep was er over die periode nog weinig geschreven, dus het model heeft er een handvol vermeldingen over gezien in plaats van duizenden. Het beantwoordt vragen over die maanden gewoon, en klinkt daarbij even zeker als over 2023.

OpenAI zet er één datum per model bij. Google vermeldt op de modelpagina van Gemini helemaal geen cutoff. "Wat weet dit model" is dus geen vraag die je bij elke leverancier op dezelfde manier beantwoord krijgt.

Wat het eerst verouderd is

Niet alle kennis veroudert even snel. De categorieën die het snelst stukgaan zijn net degene waar een bedrijf effectief naar vraagt.

  • Prijzen en licentiepakketten. Softwareleveranciers passen hun prijs per gebruiker aan, hernoemen hun formules en schuiven functies tussen abonnementen. Een model dat een licentieprijs noemt, noemt een oude.

  • API's en SDK's. Parameters verdwijnen, endpoints krijgen een andere naam, standaardwaarden wijzigen. Code die een model uit het geheugen schrijft draait tegen de bibliotheek van vorig jaar.

  • Productnamen en eigendom. Software wordt hernoemd, overgenomen of in een suite geschoven. Een model gebruikt zonder aarzelen een productnaam die niet meer bestaat.

  • Regelgeving en deadlines. Invoeringsdatums verschuiven, er komt nieuwe richtlijn bij, overgangsperiodes lopen af. Hier kost een zelfverzekerd fout antwoord het meest.

  • Alles over je eigen bedrijf. Je prijslijst, je klanten, je rapporteringsdefinities zaten op geen enkele datum in de trainingsdata. Geen enkele cutoff schuift ver genoeg op om die mee te nemen.

Waarom het model zelf niet merkt dat het achterloopt

Een model bewaart feiten niet met een datum eraan vast. Het bewaart patronen uit tekst, en "de prijs van die licentie is X" komt uit dezelfde machinerie als "water kookt bij 100 graden". Er is geen intern veldje dat het ene als bederfbaar markeert.

Het weet ook niet welke dag het vandaag is, tenzij iemand het zegt. Een model zonder systeeminstructie en zonder tools heeft niets om de datum van af te lezen. Het kan er alleen eentje uit afleiden uit de tekst waaruit het geleerd heeft, en die wijst naar achter, naar de eigen trainingsperiode.

Zet die twee samen en je krijgt het probleem waar mensen effectief tegenaan lopen: een verouderd antwoord zonder één slag om de arm. Dat ligt dicht bij hallucinatie, maar het is een andere fout. Een hallucinatie is een verzonnen feit. Een verouderd antwoord was ooit juist, en het model heeft geen manier om te merken dat het dat niet meer is.

Hoe je een model bij de tijd houdt

De cutoff verschuiven lukt niet. Wat je wel stuurt, is wat het model voor zich heeft op het moment dat het antwoordt.

  1. Geef de datum mee.
    Zet de datum van vandaag in de systeeminstructie en schrijf er expliciet bij dat de trainingsdata vroeger stopt en dat het model vragen over versies of prijzen niet uit het geheugen mag beantwoorden. Dat kost niets en het verandert het gedrag meer dan je zou denken.

  2. Plak de actuele bron erbij.
    Voor een losse vraag haalt de echte prijspagina of changelog meegeven het altijd van hoe goed je de vraag ook formuleert. Wat in de prompt staat weegt zwaarder dan wat in de gewichten zit.

  3. Ophalen uit je eigen bronnen.
    Een RAG-opzet zoekt de relevante passages in je documentatie, contracten of productdata en stuurt die mee met de vraag. Het is meteen ook de enige manier om een model kennis te geven die het nooit gehad heeft, zoals je interne definities.

  4. Zoeken op het web via grounding.
    Met grounding-tools stelt de agent zelf een zoekopdracht op, voert die uit, leest de resultaten en verwijst ernaar. De Bing-grounding van Microsoft doorloopt precies die stappen: zoekvraag opstellen, zoeken, informatie samenbrengen, bron vermelden. Die bronvermelding is het stuk waar het om draait, want daarmee kan je nakijken waar een antwoord vandaan komt.

Fine-tuning is hier niet de oplossing. Daarmee leer je een model een stijl, een formaat of een taak aan. Een model hertrainen telkens wanneer een prijslijst wijzigt is geen werkbare manier om bij te blijven.

Waar moet je op letten bij het gebruik van een knowledge cutoff

Opgehaalde documenten die genegeerd worden. Een actueel document meegeven garandeert niet dat het model het gebruikt. Modellen mengen opgehaalde tekst met wat ze al dachten te weten, en die mengeling zie je niet in het antwoord. Vraag naar bronvermelding en controleer of het antwoord echt terugslaat op wat je meegaf.

Een groter context window is geen latere cutoff. Die twee worden voortdurend door elkaar gehaald. Het context window is hoeveel je het model nu kan tonen. De cutoff is wat het geleerd heeft voor je iets toonde. Het ene groter maken doet niets met het andere.

De cutoff schuift mee als je van versie wisselt. Stap over naar een nieuwer model en de kennis verandert onder je voeten. Antwoorden die op een voorspelbare manier fout waren, worden subtiel anders. Alles wat je bouwde op veronderstelde modelkennis test je best opnieuw na zo'n overstap.

Een gepubliceerde datum is geen dekkingsgarantie. Een cutoff van januari 2026 betekent dat de trainingsdata tot daar loopt, niet dat het model je nichesoftware kent zoals ze die maand in elkaar zat. Over obscure onderwerpen is het materiaal op elke datum dun.

Laatst Bijgewerkt: July 20, 2026 Terug naar Woordenboek
Trefwoorden
knowledge cutoff trainingsdata llm large language model hallucinatie grounding rag context window fine-tuning ai generatieve ai