AI-ready data
Wat is AI-ready data?
AI-ready data is data waar een AI-systeem zelfstandig mee aan de slag kan. Ze moet proper en volledig zijn, wat datakwaliteit altijd al van je vroeg, maar ze moet zichzelf ook uitleggen. De betekenis van een veld, de regels errond en de rechten erop moeten allemaal ergens vastgelegd staan waar een machine ze kan lezen.
De reden dat hier een aparte term voor bestaat, is dat assistenten en agents de menselijke buffer weggehaald hebben. Als een analist vroeger een tabel opende met een kolom STAT_CD, dan wist die uit ervaring dat een 3 geannuleerd betekent en dat alles van voor 2019 nog de oude codering gebruikt. Als een model diezelfde tabel opent, dan ziet het enkel een kolomnaam van een paar letters, en dus begint het te gokken. Alle kennis die vroeger in hoofden zat, moet dus verhuizen naar de data zelf.
Er is een test die je echt kan doen. Geef je data aan een goeie nieuwe collega die niemand iets mag vragen en die enkel heeft wat er opgeschreven staat. Alles wat die persoon fout zou doen, gaat een assistent ook fout doen.
Wat een model nodig heeft en een mens niet
Namen die zeggen wat ze betekenen. Een mens kan wel leven met een tabel die fct_sls_ln_v2 heet. Een model gebruikt die naam als voornaamste aanwijzing over wat er in de tabel zit, dus een slechte naam is niet enkel cosmetisch. Het is een bron van foute antwoorden.
Beschrijvingen en synoniemen. Jouw bedrijf zegt omzet, het model ziet NET_AMT, en je zaakvoerder zegt top line. Iets moet die drie aan elkaar knopen, en dat iets is metadata die je één keer opschrijft.
Relaties die uitgeschreven staan. Mensen leiden uit de context af hoe tabellen aan elkaar hangen. Een model leidt dat af uit de relaties die jij hebt vastgelegd, of het verzint ze.
Eén definitie per cijfer. Als omzet drie keer bestaat met licht andere filters, dan gaat een assistent er één van kiezen, en niet altijd dezelfde.
Rechten die op de datalaag zitten. Als je toegang regelt door te bepalen welk rapport iemand mag openen, dan valt die controle weg zodra een chatvenster de onderliggende tabel kan bereiken.
Een verversing die je kan aanwijzen. Een antwoord zonder datum erachter is een bewering en geen feit. Wanneer de data voor het laatst geladen is, moet zichtbaar zijn, want niemand denkt eraan om die vraag aan een chatvenster te stellen.
Hoe dat er in de praktijk uitziet
In de Microsoft-stack is het werk heel concreet. Op een Power BI semantisch model krijg je drie knoppen, die samen onder "Prep data for AI" zitten en die bewaard worden op het model in plaats van op het rapport. Een AI data schema duidt aan welke tabellen en velden ertoe doen. AI-instructies zijn vrije tekst waarin je je bedrijfswoordenschat en je regels uitlegt. En verified answers koppelen een visual die je vertrouwt aan een vraag die mensen vaak stellen. Zodra het model op punt staat, markeer je het als goedgekeurd voor Copilot.
Op een lakehouse of een warehouse is het equivalente werk: tabelbeschrijvingen, kolombeschrijvingen, een kleine gekozen set tabellen in plaats van alles wat je hebt, en paren van een voorbeeldvraag met haar query op de agent die ze uitleest.
Voor documenten en andere ongestructureerde inhoud betekent AI-ready weer iets anders. Je hebt een consistente structuur nodig en een zinnige opdeling in stukken. Je hebt daarnaast metadata nodig die de bron, de datum en de doelgroep meedraagt. De zoekstap kan daar dan op filteren, zodat een beleidsdocument uit 2019 niet boven de huidige versie komt te staan.
Het stuk dat geen technische taak is
Het meeste werk richting AI-ready data gaat naar het eens worden over definities, en dat is eerder een organisatietaak dan een technische taak. Wat telt als een actieve klant. Of een intercompanyfactuur omzet is. Welke datum de business bedoelt als ze de datum van een bestelling zegt.
Die vragen bestonden al lang voor AI, en bedrijven leven er al jaren mee door ze in een gesprek uit te klaren. Een assistent kan niet aan dat gesprek deelnemen. Hij kiest de lezing die het best past bij de metadata die hij ziet, en hij doet dat zonder het je te zeggen.
Er is een volgorde die werkt. Begin bij de vragen die mensen nu al het vaakst stellen. Volg die terug naar de tabellen en velden waar ze op steunen. Zet daar eerst de betekenis en de rechten recht, en breid pas uit zodra dat smalle pad je betrouwbare antwoorden geeft. Als je eerst je hele datahuishouding wil documenteren, dan start je een project dat nooit af raakt.
Waar moet je op letten bij AI-ready data
Volume is geen gereedheid. Een grote lake zonder beschrijvingen is voor een assistent slechter dan een klein en goed gedocumenteerd model, want elke extra dubbelzinnige tabel is een extra kans om de verkeerde te pakken.
Documentatie loopt achter. Een beschrijving die je één keer schrijft en daarna nooit meer bekijkt, klopt niet meer zodra het veld van betekenis verandert. Behandel beschrijvingen als een onderdeel van je wijzigingsproces en niet als een opkuis die je één keer doet.
Gereedheid geldt per gebruik. Data die klaar is voor een verkoopvraag, is niet automatisch klaar voor een financiële vraag. Hou je uitspraak beperkt tot het domein dat je effectief hebt voorbereid.
De prompt herschrijven repareert het model niet. Als de antwoorden tegenvallen, dan is de reflex om aan de instructies te gaan sleutelen. In negen van de tien gevallen zit de fout in een naamloze kolom, een ontbrekende relatie of een dubbele metriek, en daar gaat geen enkele prompt tegenop.