Samenvatten met AI
Wat is samenvatten met AI?
Samenvatten is een lange tekst korter maken zonder te verliezen wat er echt toe doet. Het is de AI-functie die in een bedrijf het meest gebruikt en het minst nagekeken wordt: het verslag dat donderdagochtend in je mailbox staat, de samenvatting bovenaan een supportdossier, de twee alinea's in de plaats van een rapport van veertig pagina's dat niemand gelezen heeft.
Er bestaan twee manieren om een tekst in te korten, en het verschil bepaalt hoeveel je zelf moet nakijken.
Extractief samenvatten kiest zinnen uit de brontekst en zet die naast elkaar. De taaldienst van Azure werkt zo: elke zin krijgt een score, de hoogst scorende zinnen komen terug, en bij elke zin zit de tekenpositie waar ze in het origineel stond.
Abstractief samenvatten schrijft nieuwe zinnen. Microsoft omschrijft die in dezelfde documentatie als bondige, lopende zinnen die geen letterlijke uittreksels uit de bron zijn. Dat is wat ChatGPT, Claude en Copilot doen als je hen iets laat samenvatten.
Eén vraag scheidt de twee: vind je die zin met ctrl-F terug in de bron? Bij extractie altijd, bij abstractie zo goed als nooit. Daarom leest een abstractieve samenvatting vlotter, en daarom kan ze fout gaan op een manier die bij extractie niet bestaat. Een zin die in elkaar gezet is in plaats van gekopieerd, kan een feit bevatten dat nergens in de bron stond.
Vier samenvattingen, vier verschillende opdrachten
Iedereen zegt "vat dit even samen" alsof het één taak is. In een bedrijf zijn het er minstens vier, en elk gaat op zijn eigen manier mis.
Het vergaderverslag. Wat is beslist, wie doet wat tegen wanneer, wat blijft open. Een beslissing die terugkomt als "het team besprak de leveranciersopties" gooide net dat ene weg waarvoor het verslag bestond.
De samenvatting van een mailketen bij een overdracht. Een collega die een dossier met zestig mails overneemt, heeft de vraag van de klant nodig, wat er al beloofd is en waar het nu staat, in de eigen woorden van de klant waar de formulering zelf telt.
De documentsamenvatting met de cijfers erin. Een offerte, een contract, een auditrapport. Bedragen, datums en voorwaarden moeten exact overkomen, en wat wegvalt moet zichtbaar wegvallen.
De samenvatting van veel documenten tegelijk. Twintig enquêtes, een jaar tickets, vijf offertes. Deze is moeilijker, want het model moet uitmaken wat gemeenschappelijk is, wat een uitschieter is en wat elkaar tegenspreekt. "De meeste klanten vermelden de levertermijn" is een telling, en een taalmodel telt niet betrouwbaar. Laat een query tellen en gebruik het model enkel voor de formulering.
Wat er misloopt
Microsoft schrijft het zelf in de responsible-AI-nota bij zijn eigen samenvatdienst: het model parafraseert in plaats van uittreksels te nemen, en daarbij kan informatie of nauwkeurigheid verloren gaan. Dat is het eerlijke vertrekpunt.
Feiten die nooit in de bron stonden. Dit is hallucinatie in de meest alledaagse vorm, en ze is meetbaar. Vectara, een bedrijf dat retrieval-systemen bouwt, houdt daar een publieke ranglijst voor bij: modellen krijgen een tekst met de opdracht om samen te vatten met enkel de informatie uit die tekst, en een detector telt hoeveel samenvattingen iets toevoegen wat de bron niet ondersteunt. In de versie van november 2025, met meer dan 7.700 artikels uit onder meer recht, geneeskunde en financiën, kwam het beste model uit rond 3 procent en zaten verschillende bekende modellen boven 10 procent. Dat zijn korte teksten met een expliciete instructie, dus het makkelijke geval.
Een cijfer dat stilletjes verschuift. Afronding, een percentage dat een bedrag wordt, een daling die als stijging terugkomt, een totaal dat niet meer klopt met de regels erboven. Niets ziet er verkeerd uit, want de zin rond het cijfer loopt perfect.
De voorwaarde valt weg, de conclusie blijft staan. Dit gaat het vaakst mis en valt het minst op. "We kunnen in april live gaan als de stocktelling in maart rond is" wordt "live in april". Korter, vlotter, en een voorwaarde is een belofte geworden.
Wie het luidst sprak, wint. Wie het meest gesproken heeft, heeft ook de meeste tekst geproduceerd en krijgt dus het grootste deel van de samenvatting. Een bezwaar van één zin op minuut vijftig valt eruit. Microsoft voegt eraan toe dat zijn modellen voor gesprekssamenvattingen vooral getraind zijn op transcripten tussen twee deelnemers en minder goed presteren op andere genres. Handig om te weten voor je er een workshop met twaalf mensen door haalt.
De samenvatting van een samenvatting. Een lang document past niet in een context window, dus knipt chunking het eerst in stukken, elk stuk wordt samengevat en die samenvattingen worden nog eens samengevat. Het recept van OpenAI voor lange documenten werkt zo, en waarschuwt wanneer stukken sneuvelen omdat ze niet meer passen. Elke ronde kan een voorwaarde kosten, en in de eindtekst zie je niet meer wat er twee rondes eerder uitviel. Dezelfde afdrijving zie je in een weekrapport dat de samenvatting van vorige week samenvat.
Dezelfde vergadering, twee samenvattingen
Vijf minuten uit een operationeel overleg, teruggebracht tot wat er gezegd is:
Bram: leverancier A vraagt 42.000 euro voor het eerste jaar, daarna 18.000 per jaar.
Anke: april lukt enkel als de stocktelling in maart rond is, anders is het volgende venster september.
Chris: het budget houdt stand onder 45.000 in jaar één. Ik geef groen licht voor de pilot, niet voor de volledige uitrol.
Bram: de migratiekost staat niet in de offerte, ik vraag ze schriftelijk op.
Anke: goed, leverancier A voor de pilot.
Een verslag zoals een assistent het doorgaans maakt:
Het team besliste om met leverancier A in zee te gaan. De kost bedraagt 42.000 euro voor het eerste jaar en daarna 18.000 per jaar. De livegang is voorzien in april. Chris bevestigde het budget.
Elke zin ligt dicht bij iets dat gezegd is, en toch zitten er drie fouten in. April was voorwaardelijk en de voorwaarde is weg. Chris keurde de pilot goed, terwijl "bevestigde het budget" leest als een akkoord voor het hele project. De migratiekost is verdwenen, en dat is net het bedrag dat jaar één boven de 45.000 kan duwen.
De weggevallen voorwaarde is de gevaarlijkste. Wie het verslag leest, heeft geen enkele reden om nog naar maart te vragen.
Dezelfde vergadering, geschreven voor iemand die er iets mee moet doen:
Beslissing. Leverancier A, enkel de pilot. De volledige uitrol is niet goedgekeurd.
Cijfers. 42.000 euro in jaar één, daarna 18.000 per jaar. Plafond voor jaar één is 45.000. De migratiekost ontbreekt in de offerte, dus het totaal van jaar één ligt niet vast.
Planning. April enkel als de stocktelling in maart rond is, anders september.
Actie. Bram vraagt de migratiekost schriftelijk op bij leverancier A.
Open. Goedkeuring voor de volledige uitrol.
De tweede versie is langer dan de eerste, en het is de enige waar iemand mee verder kan zonder de opname te openen. Het doel is niet de kortste tekst, wel de tekst waarmee de lezer de volgende stap kan zetten.
Hoe krijg je een samenvatting die je kan nakijken?
Zeg waarvoor ze dient en wie ze leest. "Vat deze vergadering samen" en "schrijf de vijf regels die de financieel verantwoordelijke nodig heeft om te beslissen of het budget vrijkomt" leveren een andere tekst op. Alleen de tweede geeft het model een maatstaf voor wat weg mag.
Vraag velden, geen lopende tekst. Beslissing, voorwaarden, cijfers, acties met een eigenaar, openstaande punten. Een leeg veld "voorwaarden" is een vraag die je kan stellen. Een vlotte alinea verbergt datzelfde gat.
Maak elk cijfer en elke naam traceerbaar. Laat het model eerst de bronregel citeren bij elk bedrag, voor het iets schrijft. Anthropic geeft dat als vaste raad voor lange documenten: eerst de relevante citaten ophalen, dan pas de opdracht uitvoeren op die citaten. Dat is grounding, toegepast op een samenvatting. Diezelfde richtlijn zegt ook om de lange tekst boven je vraag en je instructies te zetten, en meldt dat vragen achteraan de antwoordkwaliteit tot 30 procent verbeterden in tests met complexe invoer uit meerdere documenten.
Hou de bron naast de samenvatting. Een verslag met een link naar de opname wordt af en toe nagekeken. Een verslag dat in een mail geplakt is niet, want daar begint nakijken met zoeken.
Test op je eigen materiaal. Neem tien vergaderingen of documenten waarvan je het juiste antwoord al kent, haal ze erdoor en tel wat er wegviel. Die kleine eval zegt meer over jouw teksten dan eender welke publieke ranglijst, en is het waard om te herhalen als je leverancier het model bijwerkt.
Waar moet je op letten bij samenvatten met AI?
Het echte risico is niet de foute samenvatting, wel dat iemand erop handelt zonder de bron te openen. Een foute samenvatting die iemand nakijkt, kost vijf minuten. Diezelfde tekst doorgestuurd naar een klant of gebruikt als basis voor een bestelling, wordt een beslissing die niemand nog heeft teruggezocht. Elke stap die ze verder reist, verkleint de kans dat nog iemand het origineel opent.
Een samenvatting is nooit het officiële stuk. Contracten, medische verslagen, incidentrapporten, alles met een juridisch gevolg, alles wat een auditor of een toezichthouder leest: het brondocument is het stuk en de samenvatting is een leeshulp. Zodra mensen met de samenvatting werken, is een ondertekende tekst vervangen door een parafrase.
Een ongecontroleerde samenvatting is workslop. Als de afzender de bron niet geopend heeft, is het nakijken verhuisd naar de ontvanger, die minder context heeft en niet ziet wat er geschrapt is. Wie een verslag doorstuurt, staat in voor wat erin staat. Microsoft zet de waarschuwing onder zijn eigen resultaat: AI-gegenereerde inhoud kan onnauwkeurig, onvolledig of ongepast zijn.