Jagged intelligence

Wat is jagged intelligence?

Jagged intelligence is het patroon waarbij een AI-model een moeilijke taak goed doet en daarnaast struikelt over een makkelijke. Dezelfde assistent die een degelijk leverancierscontract opstelt, rekent een btw-bedrag verkeerd uit. Aan welke kant van de lijn een taak valt, heeft weinig te maken met hoe moeilijk een mens ze vindt.

Dat laatste is de kern. Bij een collega mag je doortrekken: wie de moeilijke versie van een job aankan, kan ook de simpele. Bij een taalmodel gaat die regel niet op. De capaciteit komt in pieken en putten, en de putten zitten op plaatsen waar je niet zou gaan kijken.

Het beeld dat Ethan Mollick ervoor gebruikt: een vestingmuur met torens van ongelijke hoogte. Binnen de muur is het model betrouwbaar, erbuiten niet, en de muur slingert dwars door taken die voor jou identiek lijken.

Hoe ontstaat jagged intelligence?

Twee dingen bepalen waar de pieken liggen, en geen van beide is menselijke moeilijkheid.

Hoeveel van de taak in de trainingsdata zit. Een model wordt goed in wat het massaal gezien heeft. Contracten, code, marketingteksten: daar staat het internet vol van. Een specifieke berekening onder een Belgische btw-regel komt veel minder voor, dus daar is de grip zwakker, ook al noemt een boekhouder dat routine.

Of de taak automatisch te controleren valt. De grote labs trainen hun modellen de laatste jaren zwaar met reinforcement learning: het model probeert een taak, een automatische controleur geeft een score, en het model leert van die score. Dat werkt alleen waar zo'n controleur bestaat. Wiskundevraagstukken en code hebben een exact antwoord, dus daar kan het model miljoenen keren oefenen. Beoordelen of een mail juist klinkt voor een klant, of vijftig meter beter te voet dan met de auto gaat, heeft geen controleur, dus daar oefent het model niet op. Andrej Karpathy, de AI-onderzoeker die de term bedacht, zei het in 2026 zo: klassieke software automatiseert wat je in code kan specificeren, de huidige modellen automatiseren wat je kan verifiëren.

Onze intuïtie over moeilijkheid is afgesteld op mensen, bij wie vaardigheden samen groeien: niemand leert integralen voor hij kan tellen. Bij een model zijn die vaardigheden nooit verplicht samen gegroeid.

Waar de term vandaan komt

In 2023 zette een team van Harvard Business School, Wharton, MIT Sloan en Warwick, met Ethan Mollick als een van de auteurs, een experiment op met 758 medewerkers van Boston Consulting Group. Op 18 realistische taken uit hun dagelijks werk die binnen de mogelijkheden van het model vielen, werkten de mensen met GPT-4 zowat 12 procent meer taken af, gingen ze ongeveer 25 procent sneller en werd hun werk meer dan 40 procent hoger beoordeeld op kwaliteit. Op één bedrijfsvraagstuk dat bewust buiten die mogelijkheden gekozen was, kwam de groep met AI 19 procentpunten minder vaak bij het juiste antwoord uit dan de groep zonder. De auteurs noemden die grillige grens de jagged technological frontier.

In juli 2024 gaf Andrej Karpathy hetzelfde fenomeen de kortere naam jagged intelligence, nadat een topmodel gevorderde wiskunde oploste en tegelijk volhield dat 9,11 groter is dan 9,9.

De AI Index 2026 van Stanford bracht het naar een breder publiek. Modellen uit dezelfde generatie die op de Internationale Wiskunde Olympiade van 2025 goud haalden, lezen een klok met wijzers in ongeveer de helft van de gevallen juist, waar mensen dat negen op tien keer doen.

Twee voorbeelden die je zal herkennen

Het contract en de btw-lijn. Vraag een assistent om een dienstenovereenkomst met een Belgische leverancier op te stellen en je krijgt iets dat een advocaat als een ernstige eerste versie zou erkennen: clausules over aansprakelijkheid, opzegging, vertrouwelijkheid, alles in de juiste volgorde. Geef hem daarna een restaurantrekening van 345 euro inclusief btw en vraag hoeveel btw erin zit. Een Belgisch restaurant rekent 12 procent op de maaltijd en 21 procent op de wijn. Was de maaltijd 200 euro en de wijn 100 euro exclusief btw, dan is de btw 24 plus 21, dus 45 euro. Een model dat de opsplitsing niet meekreeg, deelt gerust gewoon door 1,21 en antwoordt 59,88 euro, vol overtuiging en fout. Het contract was de moeilijke taak. De rekening was de makkelijke.

De grafiek en de klok. Toon een model een screenshot van een dashboard en vraag wat er in het tweede kwartaal met de marge gebeurde. Het leest de balken, pikt de dip eruit en legt de link met de opmerking in de hoek. Toon het een foto van een wandklok en vraag hoe laat het is, en het zit er soms uren naast. Grafieken zitten overal in de trainingsdata. Wijzers op een wijzerplaat komen er zelden in voor, en niets controleerde het antwoord, dus het model heeft er nooit op geoefend.

Jagged intelligence tegenover hallucinatie

Een hallucinatie is één foute output: een verzonnen bron, een cijfer uit de lucht, een regeling die niet bestaat. Jagged intelligence is een eigenschap van de capaciteitskaart van het model: ze zegt in welke zones foute outputs waarschijnlijk zijn. Hallucinatie is het symptoom dat je in één antwoord vangt. De grilligheid is de reden waarom dat symptoom rond bepaalde taken samenklit en bij andere wegblijft.

Het praktische verschil zit in wat je eraan doet. Tegen hallucinatie werk je per antwoord: grounding, brondocumenten, een mens die nakijkt. Tegen grilligheid werk je per taak: je zoekt uit waar de putten zitten voor je er op vertrouwt, en je beslist per taak hoeveel controle er nodig is.

De twee hangen ook samen via verificatie. De taken waar een model het sterkst in is, zijn grotendeels de taken met een ingebouwde controle, dus net daar wordt een fout antwoord het snelst gevangen. De putten zitten bij taken die niemand automatisch nakijkt, en dat is precies waar een zelfzeker fout antwoord het verst geraakt.

Wat het betekent als je AI uitrolt in een kmo

  1. Test per taak, niet per afdeling. "AI voor de boekhouding" kan je niet testen. "Schrijf de eerste herinnering voor een openstaande factuur" wel. "Wijs inkomende leveranciersfacturen toe aan een kostenplaats" ook. De ene valt binnen de grens, de andere misschien niet, en alleen een aparte proef per taak vertelt je welke.

  2. Schrijf een kleine eval per taak. Verzamel twintig tot vijftig echte gevallen met een gekend juist antwoord, laat ze door het model lopen en tel. Dat is dezelfde discipline als in de entry over evals, toegepast op één taak. Een taak die 95 procent haalt op je eigen voorbeelden kan je automatiseren met een lichte controle. Eentje die op 70 procent blijft hangen, blijft bij een mens.

  3. Trek geen conclusies uit een demo. Een demo van een leverancier toont je de piek. Dat het model indruk maakte op een moeilijk voorbeeld zegt niks over het simpele voorbeeld ernaast. Breng je eigen lelijke gevallen mee: de factuur met twee btw-tarieven, de mail in dialect, het Excel-blad met samengevoegde cellen.

  4. Leg de controle waar de putten zitten. Een taak met een automatische check (een totaal dat moet kloppen, code die moet draaien) mag sneller en met minder nazicht. Een taak zonder (een inschatting, een toon, een juridische interpretatie) krijgt een mens in de loop, hoe vlot de output er ook uitziet.

  5. Draai je evals opnieuw na elke modelupdate. De grens verschuift bij elke release, meestal naar buiten, soms zijwaarts. Een taak die in de lente in een put zat, kan in de herfst in orde zijn, en af en toe omgekeerd. Hou je testset bij en zet er een datum op.

Waar moet je op letten bij jagged intelligence

De duurste fout is vertrouwen meenemen van de ene taak naar de volgende. Het model deed maandag de moeilijke analyse perfect, dus dinsdag kijkt niemand het simpele totaal nog na. Het experiment bij Boston Consulting Group toonde dat mechanisme in cijfers: op de taak buiten de grens deden de mensen met AI het slechter dan de mensen zonder. Het antwoord van het model was fout en las als juist.

De tweede is de vlotheid. Output uit een put ziet er precies uit als output van een piek. Dezelfde toon, dezelfde structuur, dezelfde zekerheid. In de tekst zelf zit geen signaal. Het enige signaal is je eigen eval, vooraf gedraaid.

Laatst Bijgewerkt: September 3, 2026 Terug naar Woordenboek
Trefwoorden
jagged intelligence jagged frontier hallucinatie evals large language model taalmodel redeneermodel sycophancy bias ai generatieve ai machine learning