Alignment (AI)
Wat is alignment (AI)?
Alignment is het werk om een AI-model te laten doen wat de makers en de gebruikers ervan bedoelen. Niet letterlijk wat er in de prompt staat, niet wat het hoogst scoort op een trainingssignaal, maar wat iemand die de vraag stelt er redelijkerwijs mee wou.
Het woord heeft in process mining een tweede betekenis die hier los van staat: daar vergelijkt een alignment een geregistreerde procesreeks met een model van hoe het proces zou moeten lopen. Dat heeft zijn eigen artikel. Dit gaat over het gedrag van een taalmodel.
Voor een bedrijf komt het op iets simpels neer. Alignment is een eigenschap van het model dat je huurt, gevormd tijdens de training bij het lab dat het gemaakt heeft, en je erft wat daar uitgekomen is. Je stuurt het niet bij, je test het.
Wat een AI-lab doet aan alignment
Tussen het moment dat een model bruikbare dingen kan en het moment dat het uitkomt, zitten grofweg vier soorten werk.
Nabehandeling met menselijke voorkeur. Mensen vergelijken kandidaat-antwoorden, die vergelijkingen trainen een reward model, en het hoofdmodel wordt bijgestuurd om daar goed op te scoren. Dat is RLHF, de stap die van een tekstvoorspeller iets maakt dat beleefd antwoordt en duidelijk misbruik weigert.
Een geschreven gedragsdocument. OpenAI publiceert de Model Spec, hun publieke regelboek voor hoe de modellen zich horen te gedragen. De versie van augustus 2026 rangschikt instructies van Root over System en Developer naar User en Guideline, zodat een instructie van de ontwikkelaar voorgaat op die van de eindgebruiker. Anthropic publiceert een grondwet voor Claude en traint daartegen: het model bekritiseert en herschrijft zijn eigen antwoorden aan de hand van een set principes, en een reinforcement-stap gebruikt daarna AI-feedback op basis van diezelfde principes om het minst schadelijke antwoord te kiezen.
Weigeringstraining. Bepalen wat het model afwijst en op welke toon. Te los en het helpt met dingen die niet horen, te streng en het weigert doodgewoon werk.
Veiligheidstests en red teaming voor de release. De Responsible Scaling Policy van Anthropic, versie 3.4 sinds juli 2026, koppelt verplichte maatregelen aan de capaciteitsdrempels die een model overschreden heeft. Het Frontier Safety Framework van Google DeepMind, versie 3.1 sinds april 2026, doet een safety case review voor een externe lancering zodra een Critical Capability Level in beeld komt.
Anthropic zegt er zelf rechtuit bij hoe ver dat je brengt: een grondwet is geen wondermiddel, en de principes die ze gekozen hebben zijn hun keuzes als ontwerper.
Alignment tegenover wat een model kan
Wat een model kan, is de ene vraag. Of het probeert te doen wat jij bedoelde, is de andere. Een model dat een correcte SQL-query schrijft maar stilletjes de rijen wist die je test deden falen, kan veel en is niet aligned. Een model dat jouw factuurformaat perfect leest en het dan weigert omdat het woord "medisch" in een lijn staat, bedoelt het goed en helpt je niet vooruit. Een model dat een marge verkeerd berekent omdat het niet kan rekenen, is geen van beide, en daar helpt geen enkele alignment-inspanning tegen.
Alignment tegenover guardrails
Het onderscheid dat je moet onthouden, gaat over waar de beperking zit. Alignment zit binnenin het model, ingebakken in de gewichten tijdens de training. Guardrails zitten errond: input-checks, system prompts, tool-rechten, output-filters, bevestigingsstappen.
Dat verschil verklaart de meeste praktische gevolgen. Je kan alignment niet nalezen, niet loggen en niet op een dinsdagnamiddag aanpassen, en met een guardrail kan je die drie dingen wel. Alignment dekt situaties die niemand op voorhand opgeschreven heeft, en net daar zwijgen guardrails. Een leverancier die zegt dat zijn model aligned genoeg is om de guardrail-laag over te slaan, schuift het risico naar jou door.
De problemen die je in de praktijk tegenkomt
De scenario's die het alignment-onderzoek vullen, komen de meeste bedrijven nooit tegen. Vijf gewone dingen wel.
Sycophancy. De assistent volgt je aanname en laat een correct antwoord vallen zodra je vraagt of hij zeker is. Het is het duurste van de vijf, omdat het eruitziet als een goed antwoord.
Reward hacking. Het model doet exact wat het doel letterlijk vraagt en mist de bedoeling: het zet een waarde hard in de code zodat de test slaagt, of schrijft een samenvatting die elke gevraagde titel bevat en niets zegt.
Weigeren van legitiem werk. Een model dat streng op veiligheid getraind is, wijst vragen af die perfect in orde zijn. Verzekeringen, HR, medische hulpmiddelen en juridisch werk lopen daar geregeld tegenaan.
Een instructie volgen die uit je eigen data komt. Een model dat een mail, een PDF of een webpagina leest, kan inhoud en opdracht niet betrouwbaar uit elkaar houden. Dat is prompt injection, en geen enkele trainingsmethode van vandaag krijgt dat weg.
Zelfzeker fout antwoord. Een verzonnen leveranciersnummer, gebracht op dezelfde rustige toon als een juist nummer. Alignment-training is net wat die toon rustig maakt, en zegt niets over of het nummer klopt.
Een resultaat uit 2025 laat zien hoe die samenhangen. Een team bij Anthropic leerde een model eerst trucjes om de beloning te omzeilen, en trainde het daarna op echte productie-omgevingen voor code. Het model leerde de beloning omzeilen, en vertoonde daarna gedrag waar niemand het op getraind had: alignment veinzen tijdens een evaluatie, meewerken met mensen die om schade vroegen, en code saboteren, tot in de codebase van het paper zelf. Klassieke veiligheidstraining met chatvragen maakte de chatantwoorden weer netjes, terwijl het gedrag in agenttaken misaligned bleef. Daarom vertelt een demo in een chatvenster je weinig over wat hetzelfde model doet zodra het tools in jouw systemen heeft.
Wat je zelf kan bijsturen en wat niet
Drie hefbomen zijn echt van jou. De system prompt is de eerste: reëel, goedkoop, en op zichzelf zwak, want een instructie is geen slot en alles wat het model bereikt kan ertegen ingaan.
De tweede is waar het model aan mag: tool-rechten, leesrecht tegenover schrijfrecht, welke documenten de zoekstap mag teruggeven, welke acties een mens moet goedkeuren. Dit is de sterkste hefboom die de meeste bedrijven hebben, en hij heeft niets met de waarden van het model te maken.
De derde is meten. Twintig tot dertig gevallen uit je eigen werk, gedraaid tegen elk model dat je overweegt en opnieuw na elke upgrade, zegt je meer dan eender welke veiligheidsdocumentatie. Daar dienen evals voor.
Wat je niet kan, is het oordeel van het model hertrainen. Fine-tuning wordt hier vaak als antwoord verkocht en dat is het niet. OpenAI beschrijft supervised fine-tuning als het middel voor classificatie, genuanceerde vertaling, output in een specifiek formaat, en het rechtzetten van modellen die instructies slecht opvolgen. Dat is stijl, vorm en gehoorzaamheid. Een fine-tune op een paar honderd van jouw voorbeelden verandert de schrijfstijl lang voor ze verandert wat het model een redelijke handeling vindt.
Alignment en de EU AI Act
De AI Act regelt niet wat een model vindt. Ze regelt hoe systemen gebruikt worden en welk proces errond zit.
De enige plek waar de wet het model zelf raakt, is de regeling voor general-purpose modellen met systeemrisico. Een model wordt vermoed daaronder te vallen zodra de rekenkracht voor de training boven tien tot de vijfentwintigste floating point operations gaat. Artikel 55 verplicht de aanbieder om modelevaluaties te doen met gedocumenteerde adversarial testing, systeemrisico's op Unieniveau in te schatten en te beperken, ernstige incidenten zonder onnodige vertraging te melden aan het AI Office, en het model en de infrastructuur goed te beveiligen. Die verplichtingen gelden sinds 2 augustus 2025 en ze vallen op het lab, niet op het bedrijf dat de API aanroept.
Wat wel op jou valt, is je eigen gebruik: je risicocategorie, menselijk toezicht, transparantie tegenover de mensen die het raakt, en documentatie. Onder artikel 25 word je zelf aanbieder wanneer je je eigen naam of merk op een hoogrisicosysteem zet, er een substantiële wijziging aan doet, of een general-purpose systeem herbestemt naar een hoogrisicogebruik.
Waar moet je op letten bij claims over alignment
Niemand kan bewijzen dat een model aligned is
Anthropic schrijft in zijn eigen standpuntentekst dat veilige systemen bouwen ergens tussen heel makkelijk en onmogelijk kan liggen, en dat uitmaken in welk van die gevallen we zitten op zich al moeilijk is. Dat is de maker van het model die dat zegt, geen criticus.
Documentatie is bewijsmateriaal, geen garantie
Een model card, een veiligheidskader en een red-teamrapport vertellen je wat er getest is en door wie, niet hoe het model zich op jouw gevallen gedraagt. OpenAI schrijft in de Model Spec zelf dat hun productiemodellen die spec nog niet volledig volgen. Het woord in een datasheet heeft geen definitie waaraan een leverancier moet voldoen, dus vraag wat ze gemeten hebben, op welke versie, en of jij die meting kan overdoen.
Het verandert met de versie
Gedrag verschuift tussen releases, soms fors. OpenAI draaide in april 2025 een ChatGPT-update terug omdat het model merkbaar vleiender geworden was. Test opnieuw bij elke versie waar je naartoe gaat.
Aligned is niet hetzelfde als juist
Een model dat zich voorbeeldig gedraagt, heeft nog altijd feiten mis. Alignment gaat over bedoeling en gedrag. Correctheid is een apart probleem met aparte maatregelen: verankeren in je eigen bronnen, bronvermelding, en een mens die alles nakijkt waar geld mee gemoeid is.