Data Woordenboek

Context rot

Wat is context rot?

Context rot is het geleidelijke kwaliteitsverlies van een taalmodel naarmate de tekst die je meestuurt langer wordt. Het model blijft antwoorden. Het wordt alleen minder betrouwbaar in het terugvinden en correct combineren van een specifiek feit uit die hoop tekst.

Het woord geleidelijk is hier belangrijk. Er is geen drempel waarop het plots misgaat, en het is iets anders dan plaatsgebrek. De kwaliteit zakt mee met de lengte, elk model zakt anders, en het begint ruim voor het context window technisch vol zit.

Vergelijk het met een nieuwe collega inwerken. Geef je hem één blad met het klantnummer, de juiste contractclausule en de laatste twee mails, dan kan hij ermee aan de slag. Geef je hem het volledige archief van vier jaar en stel je dezelfde vraag, dan vindt hij het antwoord vaak nog altijd, maar de kans dat hij het mist of een oude versie van die clausule citeert stijgt met elke extra map.

De term raakte ingeburgerd nadat Chroma in juli 2025 een rapport publiceerde dat het effect over achttien modellen mat, en Anthropic hem overnam in zijn technische teksten over context.

Waarom de kwaliteit zakt bij lange invoer

Er spelen twee dingen mee.

Het eerste is aandacht. In een transformer weegt elk token zijn relatie met elk ander token af, dus een prompt van n tokens levert ongeveer n kwadraat verbanden op. Anthropic noemt dat een aandachtsbudget: het model heeft een eindige hoeveelheid aandacht te verdelen, en elke token die je toevoegt neemt daar een stukje van. Er gaat niks stuk als dat budget dun wordt, het model verdeelt zich gewoon over meer materiaal en wordt over alles wat vager.

Het tweede is positie. Het onderzoek Lost in the Middle uit 2023 testte modellen op vragen over meerdere documenten en op het opzoeken van sleutel-waardeparen. Het relevante document schoof daarbij doorheen de prompt, en op elke plaats werd de nauwkeurigheid gemeten. Het antwoord klopte het vaakst wanneer de nodige informatie vooraan of achteraan stond, en merkbaar minder vaak wanneer ze in het midden zat. Ook bij modellen die net voor lange context gebouwd zijn. Dat is het lost in the middle-effect, en het maakt van de plaats van een document in je prompt een ontwerpkeuze in plaats van een detail.

Wat de tests laten zien

De bekendste meting is de needle in a haystack-test, die Greg Kamradt eind 2023 publiceerde. Je verstopt één zin op een gekozen diepte in een lange lap tekst die er verder niks mee te maken heeft, vraagt het model die zin terug, en varieert twee dingen: hoe lang de tekst is en hoe diep de zin zit. Leveranciers citeren hun hoge scores op die test graag. Google zegt zelf dat Gemini goed presteert op die opzoekevaluaties, maar voegt eraan toe dat de nauwkeurigheid niet dezelfde is zodra je meerdere stukken informatie tegelijk zoekt in plaats van één.

Die nuance telt, want de simpele versie van de test is makkelijker dan echt werk. Het is een letterlijke woordmatch: de vraag herhaalt woorden uit de verstopte zin, dus het model kan hem op bewoording alleen terugvinden. Chroma draaide een zwaardere reeks varianten over achttien modellen, waaronder GPT-4.1, Claude 4, Gemini 2.5 en Qwen3. Een paar resultaten zijn de moeite om te onthouden:

  • De prestatie verschilde sterk met de invoerlengte, zelfs bij taken die bij korte invoer voor niks doorgaan.

  • Deelden de vraag en het antwoord weinig woorden, zodat het model de link inhoudelijk moest leggen, dan zakte de nauwkeurigheid sneller naarmate de tekst groeide.

  • Eén enkele passage die geloofwaardig lijkt maar het antwoord niet bevat, kost al nauwkeurigheid. En de ene zo'n passage richt veel meer schade aan dan de andere.

  • Modellen scoorden beter wanneer de omliggende tekst door elkaar geschud was dan wanneer ze als een samenhangend document las. Dat is net het omgekeerde van wat de meeste mensen verwachten.

  • Op een test met lange gesprekken deed elk model het beter met een prompt die tot de relevante historiek herleid was dan met het volledige gespreksverslag.

Chroma deed ook een test waar helemaal niks in op te zoeken valt: geef een lijst herhaalde woorden gewoon terug. Ook daar zakte de nauwkeurigheid naarmate de lijst langer werd. Modellen verzonnen woorden, gaven er te weinig terug of weigerden de opdracht. Lengte alleen volstaat dus al om het mis te laten lopen.

Context rot versus een vol context window

Die twee worden vaak door elkaar gehaald, en het verschil zit in wat je ziet als het fout loopt.

Tegen de limiet van je window botsen is luid. De API geeft een foutmelding, of de oudste berichten vallen weg, en je weet dat er iets is afgeknipt. Je lost het op met chunking, samenvatten of minder ophalen.

Context rot is stil. Alles past, er komt geen enkele foutmelding, en het antwoord komt vlot en overtuigend terug terwijl het document in het midden gewoon genegeerd is. Er is geen logregel voor. Daarom ontdekken teams het meestal doordat een gebruiker meldt dat een antwoord niet klopte, en niet via hun monitoring.

Waar moet je op letten bij context rot?

In projecten zien we telkens dezelfde reflex: het volledige databaseschema erin plakken, alle beleidsdocumenten, de hele ticketgeschiedenis, en het model het maar laten uitzoeken. Dat is het snelst gebouwd en het eerst wisselvallig, meestal net wanneer iemand een vraag stelt waarvoor een feit uit het midden nodig is.

Haal op in plaats van te dumpen
Stuur de vier tabellen mee die met de vraag te maken hebben, niet alle tweehonderd. Daar dient RAG voor, en een strakke prompt van vijfduizend tokens verslaat er een van vijfhonderdduizend meestal tegelijk op juistheid, kost en snelheid.

Zet je instructie waar het model goed leest
Moet er toch een lang document mee, hou de vraag en de regels dan achteraan in plaats van ze ervoor te zetten en te hopen dat ze blijven hangen.

Gooi bijna-dubbels eruit
Drie versies van hetzelfde beleid in het window zijn drie kansen om de verouderde te citeren. Ontdubbel voor de opgehaalde resultaten in de prompt belanden.

Test op echte lengte
Een assistent die perfect antwoordt op drie voorbeelddocumenten zegt weinig over zijn gedrag bij driehonderd. Bouw je testset met vragen die mensen echt stellen en draai ze op de lengte die je in productie krijgt.

Behandel het window als een budget dat je uitgeeft
Niet als plaats die je opvult. Die reflex is waar context engineering over gaat, en context rot is de reden dat het vak bestaat.

Laatst Bijgewerkt: July 20, 2026 Terug naar Woordenboek
Trefwoorden
context rot context window context engineering lost in the middle needle in a haystack tokens rag prompt engineering llm hallucinatie ai generatieve ai