World models

Wat is een world model?

Een world model is een model dat leert hoe een omgeving zich gedraagt, zodat het kan voorspellen hoe die omgeving eruitziet na een handeling. Geef het de huidige toestand en een actie, en het geeft je de volgende toestand terug. Zet een paar van die stappen achter elkaar en een agent kan binnen die voorspelling plannen in plaats van het in het echt te proberen.

De naam komt van een paper van David Ha en Jurgen Schmidhuber uit 2018. Wat mensen zich daarvan herinneren: ze trainden het stuurdeel van hun agent volledig binnen de omgeving die het model zelf genereerde, op een autoracespel en een Doom-level, en zetten het daarna terug in de echte omgeving, waar het bleef werken.

Het contrast met een taalmodel is waarom de term rondgaat. Een large language model leert uit tekst over de wereld. Een world model leert uit waarnemingen van de wereld zelf, vooral video en sensoropnames van robots en voertuigen, en het voorspelt een toestand en geen woord. Dit is een onderzoeksrichting en geen productcategorie: bijna alles hieronder is een paper, een demo of een intern instrument bij een lab.

De discussie achter de term

Yann LeCun zette de redenering uiteen in een positiepaper uit 2022, met een architectuur waarin een world model centraal staat. Zijn versie voorspelt in een abstracte representatieruimte en niet pixel per pixel, want als je elke pixel voorspelt, gaat de capaciteit van het model naar details waar niemand iets aan heeft. Over taalmodellen is hij kort: die leven in de discrete wereld van tekst, dus niets in hun training vertelt hen wat er gebeurt als je een glas naar de rand van de tafel duwt. Hij vertrok in november 2025 bij Meta en richtte een maand later AMI Labs op in Parijs om op die architectuur te bouwen.

Demis Hassabis van Google DeepMind leest hetzelfde bewijs omgekeerd. In mei 2025 noemde hij het verbluffend hoe goed Veo 3 intuïtieve fysica modelleert, en zei hij dat world models altijd al de route van DeepMind naar algemene AI geweest zijn. In die lezing rolt een bruikbaar model van de wereld vanzelf uit genoeg video en genoeg schaal, ongeveer zoals een kind fysica oppikt lang voor iemand er een formule bij haalt. Beide kampen bouwen, en dat zegt meer dan de discussie zelf.

Wat een demo niet bewijst

Een model dat overtuigende beelden maakt van water dat over de rand loopt, lijkt iets over water te weten. In januari 2025 publiceerde een groep bij Google DeepMind en enkele universiteiten Physics-IQ, een testset van gefilmde situaties rond vloeistoffen, optica, magnetisme en warmte, waarbij elk model de eerste seconden kreeg en het fragment moest verderzetten. Ze lieten Sora, Runway, Pika, Lumiere, Stable Video Diffusion en VideoPoet erop los, en vonden dat het fysieke begrip zwaar beperkt is en losstaat van hoe realistisch de beelden eruitzien. De mooiste output was niet de fysisch juiste.

Een team bij ByteDance Seed trainde videomodellen op gesimuleerde fysica die ze zelf genereerden, in werk dat in 2025 op een machine learning-conferentie voorgesteld werd. Binnen het trainingsbereik waren die modellen accuraat en werden ze beter met meer data en meer parameters. Erbuiten lagen de fouten op snelheid een grootteorde hoger en meer schaal veranderde daar niets aan: de modellen zochten het dichtstbijzijnde voorbeeld uit de training op en kopieerden dat gedrag, in plaats van een regel toe te passen.

Het scherpste voorbeeld gaat niet eens over video. Een team van Harvard, MIT en Cornell trainde een transformer op miljoenen taxiritten in New York en vroeg er routebeschrijvingen aan. De nauwkeurigheid was bijna perfect. Daarna reconstrueerden ze de kaart die uit die antwoorden volgde, en kregen ze een stad met straten die schuin door het raster sneden en wegen die over andere wegen heen vlogen. Sloten ze één procent van de straten af en vroegen ze om een omleiding, dan zakte de nauwkeurigheid van bijna 100 procent naar 67 procent. Dat werk verscheen eind 2024.

Een goeie demo zegt dus dat het model enorm veel materiaal gezien heeft dat op die demo lijkt. Of het een regel vasthoudt waarop je kan bouwen, merk je pas als je één ding verandert.

Waar world models vandaag gebruikt worden

Rijsimulatie is het duidelijkste geval waar world models echt werk doen. Wayve bracht GAIA-2 uit in maart 2025, dat rijbeelden van meerdere camera's genereert uit gestructureerde invoer en zo zeldzame en gevaarlijke situaties kan maken die je niet veilig of niet praktisch kan filmen. GAIA-4, van augustus 2026, sluit de lus: wat het rijsysteem doet, verandert wat het daarna ziet. Waymo kondigde in februari 2026 een eigen world model aan, gebouwd op Genie 3 van DeepMind en aangepast om camera en lidar te leveren, zodat hun rijsysteem overstromingen, sneeuw en vreemde obstakels eerst in simulatie tegenkomt.

Robotica loopt een stap achter. Meta publiceerde in juni 2025 V-JEPA 2, een model van 1,2 miljard parameters dat korte grijp- en plaatsacties plant, met een slaagpercentage van 65 tot 80 procent bij voorwerpen en omgevingen die het nooit gezien had. Dat is een onderzoeksrelease met code en gewichten erbij, geen robot die je kan bestellen. NVIDIA zette er een platform achter met Cosmos, aangekondigd in januari 2025: modellen die je kan downloaden en die video genereren van de toekomstige toestand van een omgeving, met de fysica erin verwerkt. NVIDIA noemt onder meer 1X, XPENG, Uber en Waabi als bedrijven die erop bouwen.

Genie 3 van DeepMind, in augustus 2025 aangekondigd als beperkte research preview, is de interactieve variant: het bouwt uit een tekstprompt een omgeving waar je door kan bewegen, op 720p en 24 beelden per seconde, en houdt die enkele minuten grotendeels consistent. Die systemen hebben allemaal dezelfde vorm. World models worden gebruikt om andere systemen te trainen en te testen, niet om een vraag over jouw bedrijf te beantwoorden.

Een world model tegenover een digital twin

Die twee worden voortdurend door elkaar gehaald, en één dimensie scheidt ze: is het model aangeleerd of uitgeschreven.

Een digital twin is uitgeschreven. Iemand modelleert deze pomp, deze lijn, dit gebouw, legt de objecten en hun relaties vast, en koppelt er live sensordata aan zodat het model het echte ding volgt. ISO 23247-1, de industriestandaard uit 2021, omschrijft het als een digitale representatie op maat van een waarneembaar element, die met dat element gesynchroniseerd blijft. De reikwijdte is één installatie. Een world model is aangeleerd: niemand schrijft ergens op dat een doos kantelt als je tegen de bovenrand duwt, dat gedrag wordt uit waarnemingen gehaald, en er is geen live koppeling met één bepaalde machine.

Ze beantwoorden dus verschillende vragen. Vraag aan een twin wat deze pomp volgende week gaat doen op basis van haar trillingen en haar onderhoudshistoriek, en je krijgt antwoord. Vraag aan een world model wat een scène als deze doorgaans daarna doet, en je krijgt dat antwoord. Gaat je vraag over je eigen installatie, dan is de twin het juiste instrument.

Een taak waar je het tekort ziet

Neem de planning bij een firma met twee techniekers, één bestelwagen en vier interventies op een dag. Geef een assistent de adressen, de geschatte duurtijden en de tijdsvensters van de klanten, en je krijgt een verstandige dagplanning terug. Dat stuk is het probleem niet.

Verander nu één fysiek detail. De machine bij de tweede interventie staat op de eerste verdieping, de goederenlift is buiten dienst, en het wisselstuk weegt 68 kilo. Wie ooit iets een trap op gedragen heeft, ziet het gevolg meteen: die stop heeft allebei de techniekers tegelijk nodig, en daardoor schuiven de twee andere opdrachten. De assistent leidt dat meestal niet af, want niets in de tekst waaruit hij geleerd heeft, verbindt 68 kilo en geen lift met twee mensen samen en de rest die opschuift.

Zeg je hem de regel, dan past hij ze netjes toe. Dat is de eerlijke vorm van het tekort, en meteen ook de hele praktische les. Er is hier niets te kopen: geen enkele leverancier verkoopt een kmo een world model. Waar de term wel voor dient, is als uitleg waarom een assistent die een prima offertebrief schrijft, toch niets waard kan zijn bij een vraag over ruimte, volgorde of fysieke oorzaak.

Schrijf de fysieke voorwaarden dus op. Overal waar je mensen, voertuigen, voorraad of machines plant, moeten de regels die op de werkvloer vanzelfsprekend zijn (dat gaat niet door die deur, daar heb je met twee man voor nodig) in de prompt staan of in een checklist errond. Test daarna zoals de taxi-onderzoekers deden: geef het systeem een geval waarin één ding anders is dan normaal, en kijk of het antwoord mee verandert.

Laatst Bijgewerkt: September 4, 2026 Terug naar Woordenboek
Trefwoorden
world model world models foundation model multimodaal model digital twin large language model reinforcement learning generatieve ai robotica ai machine learning