Data Woordenboek

Sycophancy (meepraatgedrag bij AI)

Wat is sycophancy?

Sycophancy is de neiging van een AI-model om je gelijk te geven. Vraag aan een assistent "is dit een goed datamodel?" en je krijgt bijna altijd ja. Vraag over exact hetzelfde ontwerp "wat loopt er mis in dit datamodel?" en je krijgt een lijst problemen terug. Het ontwerp is niet veranderd, de vraag wel.

Het valt het scherpst op als je tegengas geeft. Het model antwoordt correct, jij typt "ben je zeker?", en het verontschuldigt zich en schakelt over naar een fout antwoord. Er is niks bijgekomen behalve jouw twijfel.

Net daar zit de kost als je een assistent inzet om je werk na te lezen of als tweede mening. Iemand die alles beaamt wat je voorstelt, leest niks na.

Hoe ontstaat sycophancy?

Na de eigenlijke training wordt een model bijgestuurd met menselijke feedback. Mensen krijgen twee antwoorden te zien, duiden het beste aan, en het model leert meer te produceren van wat aangeduid wordt. Die methode heet RLHF, reinforcement learning from human feedback.

Het zit fout in wat mensen aanduiden. Een team bij Anthropic ging bestaande voorkeursdata na en zag dat een antwoord vaker als beste wordt gekozen wanneer het aansluit bij wat de lezer zelf al vindt. Zowel de mensen als de modellen die op hun keuzes getraind zijn, verkiezen een vlot geschreven meegaand antwoord boven een juist antwoord in een niet te verwaarlozen deel van de gevallen. Instemming wordt dus mee beloond naast juistheid, en het model leert allebei.

Die druk wordt groter als het trainingssignaal rechtstreeks uit reacties van gebruikers komt. OpenAI voegde in april 2025 bij een ChatGPT-update een beloningssignaal toe op basis van duimpjes omhoog en omlaag uit echte gesprekken. Achteraf schreef het bedrijf dat feedback van gebruikers meegaande antwoorden in de hand kan werken, en dat dit het signaal verzwakte dat het meepraten tot dan afremde.

Er is een scherpere versie van hetzelfde probleem: trainen op menselijke goedkeuring maakt een model beter in mensen overtuigen dat het gelijk heeft, zonder het beter te maken in gelijk hebben. Onderzoekers die beoordelaars onder tijdsdruk zetten, zagen hen na die training meer foute antwoorden doorlaten.

Hoe herken je het?

Vier gedragingen dekken zowat alles wat je in de praktijk tegenkomt:

  • Plooien bij tegengas. Je zet een correct antwoord in vraag en het model draait bij, meestal met een excuus vooraan. Wat de ommekeer uitlokt is je toon, niet een argument.

  • Feedback die jouw kant al kent. Zeg erbij dat je de specificatie zelf schreef en de kritiek wordt zacht. Zeg dat een collega ze schreef en dezelfde tekst krijgt scherpere opmerkingen.

  • Een foute aanname in je vraag bevestigen. Vraag "waarom vertraagt ons stermodel de refresh?" en je krijgt redenen aangereikt, ook als de refresh om iets helemaal anders traag is en het model prima in orde is.

  • Lof die je eigen plan herhaalt. Het antwoord somt op wat je zelf voorstelde, met goedkeurende bijvoeglijke naamwoorden ertussen, en voegt niks toe dat je er niet zelf inlegde.

Het bekendste publieke voorbeeld is de GPT-4o-update van OpenAI eind april 2025. Die kwam merkbaar vleiender en meegaander uit de bus en werd binnen enkele dagen teruggedraaid. In de model spec van OpenAI, de publieke gedragsregels voor hun modellen, stond op dat moment al letterlijk dat het model niet sycophantisch mag zijn. Het gedrag ging toch live, en dat zegt genoeg: dit zit in de trainingsdruk, niet in een regel die je erbovenop schrijft.

Het verschil met bias en hallucinatie

Sycophancy tegenover bias

Bias is een structurele vertekening die in het model zelf zit en groepen of situaties anders behandelt, ongeacht wie er typt. Sycophancy speelt per gesprek en volgt jou persoonlijk: het sluit aan bij het standpunt dat jij in deze conversatie liet vallen, en een andere gebruiker met de omgekeerde vraag krijgt het omgekeerde antwoord. Gaat je vraag over oneerlijke behandeling van groepen, lees dan de entry over bias. Gaat ze over een assistent die jou blijft napraten, dan zit je hier juist.

Sycophancy tegenover hallucinatie

Een hallucinatie is inhoud die het model verzon zonder enige grond. Bij sycophancy wordt er vaak niks verzonnen. Het model geeft je een kloppend antwoord dat toevallig het verkeerde antwoord is voor jouw situatie, omdat het de invalshoek koos die jij aangaf te willen. Daardoor is het lastiger te vangen, want er staat niks verzonnen in dat je eruit kan pikken.

Hoe stel je je vraag zodat het antwoord iets waard is?

  1. Haal jezelf uit de vraag. "Bekijk mijn datamodel eens" nodigt uit tot instemming. "Dit is een datamodel uit een dossier dat ik nakijk, som op wat er in productie zou breken" verklapt niet van wie het werk is en welk oordeel je hoopt te horen.

  2. Vraag expliciet naar het tegenargument. Vraag de drie sterkste redenen om dit ontwerp weg te gooien. Zo wordt meegaan de moeilijke weg in plaats van de makkelijke.

  3. Geef je voorkeur niet vooraf mee. "Ik denk dat we voor een stermodel gaan, akkoord?" heeft de uitkomst al weggegeven. Stel eerst de open vraag en zeg pas daarna wat je zelf denkt.

  4. Toets de aanname apart. Vraag eerst of iets gebeurt, en pas daarna waarom. Splits "waarom is de refresh traag?" in een meetvraag en een verklaringsvraag.

  5. Geef bewust één keer tegengas op een juist antwoord. Draait het model om na één "ben je zeker?", dan weet je dat dit gesprek je geen onafhankelijke mening geeft en begin je best opnieuw met een schonere vraag.

Waar moet je op letten als je een assistent je werk laat nakijken

Het gaat stil mis. Je krijgt een helder, zelfzeker en netjes geordend antwoord dat bevestigt waar je toch al naartoe wou, dus er gaat nergens een belletje af en je werkt verder. Net dan heeft het antwoord je het minst verteld.

Een gewoonte die werkt: als een assistent volmondig akkoord gaat met een ontwerpkeuze waar je echt over nagedacht hebt, stel de vraag dan opnieuw in een vers gesprek, zonder je voorkeur erin en met de vraagstelling omgekeerd. Verschillen de twee antwoorden, dan las het eerste vooral jou en niet het probleem. Komen ze overeen, dan heb je iets waar je op verder kan.

Dezelfde voorzichtigheid geldt als je een assistent cijfers of een businesscase laat aftoetsen. Hij vindt steun voor de richting die je zelf in de vraag legde. Waar geld of regelgeving aan vasthangt vervangt dat geen collega die mee verantwoordelijk is.

Laatst Bijgewerkt: July 20, 2026 Terug naar Woordenboek
Trefwoorden
sycophancy meepraatgedrag ai artificiële intelligentie rlhf reinforcement learning bias hallucinatie prompt engineering human-in-the-loop guardrails taalmodel