Data Woordenboek

RLHF (Reinforcement Learning from Human Feedback)

Wat is RLHF?

RLHF, kort voor reinforcement learning from human feedback, is een manier om een AI-model zo te trainen dat zijn antwoorden aansluiten bij wat mensen echt verkiezen. Mensen rangschikken verschillende antwoorden die het model maakt, en die rangschikkingen leren het model naar welk soort respons het moet mikken.

Het is de trainingsstap die ruwe taalmodellen omtoverde tot de chat-assistenten en andere generatieve AI-tools die de meeste mensen vandaag gebruiken. Een basismodel dat alleen tekst gelezen heeft, is goed in het voorspellen van het volgende woord, maar het produceert net zo makkelijk een lomp, wijdlopig of onveilig antwoord. RLHF duwt het richting antwoorden die behulpzaam en aangenaam om te lezen zijn.

De techniek werd breed bekend via InstructGPT, een reeks modellen die OpenAI in 2022 op deze manier bijstelde. Hetzelfde recept zit achter de populaire chat-assistenten die volgden.

Waarom RLHF bestaat

"Schrijf een goed antwoord" is niet iets wat je in een simpele wiskundige formule kan gieten. Of een antwoord helder, beleefd of veilig is, is een kwestie van menselijk oordeel, en er is geen enkele juiste output om tegen te trainen.

Gewone gesuperviseerde training heeft voor elk voorbeeld een gelabeld juist antwoord nodig. Voor open vragen bestaat zoiets niet. RLHF omzeilt dit door in plaats daarvan uit vergelijkingen te leren. Een persoon hoeft niet het perfecte antwoord te schrijven, hij moet alleen zeggen welke van twee antwoorden beter is. Zulke voorkeuren verzamelen is veel makkelijker en schaalt naar veel voorbeelden.

Hoe werkt RLHF?

RLHF verloopt meestal in drie fases, elk voortbouwend op de vorige.

  1. Gesuperviseerde fine-tuning. Mensen schrijven goede voorbeeldantwoorden op een reeks prompts, en het basismodel wordt daarop bijgesteld. Dit geeft het model een eerste gevoel voor de instructievolgende stijl voor er ook maar gerangschikt wordt.

  2. Een beloningsmodel trainen. Het model maakt verschillende antwoorden op dezelfde prompt. Mensen rangschikken die antwoorden van best naar slechtst. Die rangschikkingen trainen een tweede model, het beloningsmodel, waarvan de enige taak is om naar een antwoord te kijken en de score te voorspellen die een persoon zou geven.

  3. Reinforcement learning. Het hoofdmodel oefent nu tegen het beloningsmodel. Het schrijft een antwoord, het beloningsmodel geeft er een score aan, en het hoofdmodel past zich aan om hogere scores te halen. Over veel ronden leert het het soort antwoord te maken dat mensen hoog rangschikten. Het algoritme dat hiervoor het vaakst gebruikt wordt heet PPO, al zijn er intussen nieuwere methodes die ermee concurreren.

Eén resultaat maakte de waarde duidelijk. OpenAI meldde dat mensen de antwoorden van een InstructGPT-model van 1,3 miljard parameters verkozen boven die van het veel grotere GPT-3 met 175 miljard parameters, puur omdat het kleinere model dit proces doorlopen had.

RLHF versus gewone fine-tuning

Gewone fine-tuning toont het model een set juiste antwoorden en traint het om ze na te bootsen. Dat werkt goed als er een duidelijk doel is, zoals een e-mail classificeren of een datum uit een factuur halen.

RLHF is voor gevallen waar "juist" een spectrum is. In plaats van vaste antwoorden na te bootsen, wordt het model gescoord op hoe goed zijn output aansluit bij de menselijke voorkeur, zodat het kan verbeteren op eigenschappen als toon, behulpzaamheid en het weigeren van een onveilige vraag. In de praktijk worden de twee samen gebruikt: eerst gesuperviseerde fine-tuning, RLHF erbovenop.

Waar moet je op letten bij RLHF?

Het beloningsmodel is maar zo goed als de rangschikkingen. Als de mensen die rangschikken gehaast, inconsistent of niet representatief zijn, leert het model hun blinde vlekken. De datakwaliteit van de voorkeuren zet het plafond op alles wat erboven zit.

Modellen leren de score te bespelen. Een model kan antwoorden vinden die het beloningsmodel hoog scoort, maar die mensen eigenlijk niet fijn vinden, zoals antwoorden die zelfzeker klinken maar weinig zeggen. Dit heet reward hacking, en het vraagt opvolging.

Het kan een model overvoorzichtig maken. Duw je te hard op veiligheidsrangschikkingen, dan begint het model onschuldige vragen te weigeren. Behulpzaamheid tegen voorzichtigheid afwegen is een doorlopende afstelklus, geen eenmalige instelling.

Het vormt gedrag, geen kennis. RLHF verandert hoe een model antwoordt, niet welke feiten het kent. Het herstelt geen model dat informatie mist, dus teams zetten er meestal aparte guardrails bovenop om onveilige invoer en output te vangen die training alleen laat passeren.

Laatst Bijgewerkt: July 18, 2026 Terug naar Woordenboek
Trefwoorden
rlhf reinforcement learning fine-tuning large language model llm generatieve ai guardrails machine learning datakwaliteit ai