Data Woordenboek

Data wrangling

Wat is data wrangling?

Data wrangling is het handwerk om rommelige ruwe data om te vormen tot een propere, gestructureerde vorm waar je echt mee kan analyseren. Je leest ze in, verbetert de fouten, geeft ze een andere vorm, koppelt ze aan andere bronnen en levert iets af waar een rapport of een model mee overweg kan. Het wordt ook data munging genoemd.

De meeste ruwe data komt niet klaar voor gebruik binnen. Een verkoopexport heeft datums in drie formaten, een enquête heeft half lege vrije-tekstvelden, twee systemen schrijven dezelfde klant op twee manieren. Wrangling is het werk dat de kloof dicht tussen die ruwe dump en een tabel waar je op kan bouwen.

Het is berucht als het deel dat de dag vult. Analisten en data scientists zeggen geregeld dat het opschonen en vormgeven veel meer tijd vraagt dan de analyse die erop volgt.

De belangrijkste stappen

Wrangling is niet één handeling maar een lus die je herhaalt tot de data standhoudt. Een gangbare manier om het op te delen:

  1. Verkennen. Kijk wat je echt in handen hebt. Wat zit er in elke kolom, hoeveel ontbreekt er, waar zitten de duidelijke problemen. Dit overlapt met data profiling.

  2. Structureren. Geef de data de vorm die je analyse nodig heeft: één kolom in meerdere splitsen, rijen naar kolommen draaien, of net omgekeerd.

  3. Opschonen. Herstel wat fout is. Zet datum- en getalformaten gelijk, verbeter typfouten, behandel lege velden, verwijder dubbele records, pak uitschieters aan.

  4. Verrijken. Koppel extra data bij die context geeft, zoals een regio-opzoeking of een wisselkoers, zodat de tabel meer vragen beantwoordt.

  5. Valideren. Voer controles uit om te bevestigen dat het resultaat klopt: totalen sluiten aan, elke bestelling heeft een geldige klant, geen enkele datum ligt in de toekomst.

Die stappen lopen zelden in één keer netjes af. Bij het valideren duikt een probleem op dat je gemist had, en dan val je terug in het opschonen.

Een uitgewerkt voorbeeld

Stel dat je een export van bestellingen uit een webshop krijgt. De kolom besteldatum mengt 03/04/2026 en 2026-04-03. Klantnamen staan er als "ACME nv", "Acme NV" en "acme". Drie rijen zijn exacte duplicaten van een dubbele verzending. De kolom land is leeg voor de oudere bestellingen.

Deze data wranglen betekent beide datumformaten naar één omzetten, de drie schrijfwijzen van Acme samenvoegen tot één klant, de dubbele rijen schrappen en het ontbrekende land afleiden uit de postcode. Wat eruit komt, is één propere bestellingentabel waar een totaal per klant of per maand eindelijk klopt.

Data wrangling versus datatransformatie

De twee overlappen en mensen gebruiken ze los door elkaar, maar er zit een verschil in de aard. Transformatie is de brede categorie van data van de ene vorm of het ene formaat naar het andere brengen, en dat omvat automatische, herhaalbare stappen in een pijplijn evengoed als handwerk.

Data wrangling is het meer verkennende, handmatige uiteinde daarvan. Het is wat je doet wanneer je een rommelige dataset voor het eerst tegenkomt en al doende moet uitzoeken wat er fout is en hoe je het herstelt. Eens je dat uitgevlooid hebt en dezelfde aanvoer elke week binnenkomt, verhuist die logica meestal naar een ETL- of ELT-pijplijn, zodat niemand ze nog met de hand moet wranglen.

Tools waar mensen naar grijpen

Aan de kleine kant gebeurt heel wat wrangling gewoon in een spreadsheet. Dat werkt tot de stappen herhaald of gecontroleerd moeten worden, en dan worden handmatige aanpassingen een risico.

Power Query, ingebouwd in Excel en Power BI, legt elke stap die je zet vast, zodat de hele opkuis vanzelf opnieuw draait wanneer er nieuwe data binnenkomt. In de Microsoft-wereld is het de gangbare keuze voor herhaalbare wrangling zonder code.

pandas, de Python-bibliotheek, is de favoriet van analisten en data scientists die volledige controle in code willen. Het leest, koppelt, hervormt en schoont data op over datasets die veel groter zijn dan een spreadsheet aankan.

De regel om te onthouden: een spreadsheet is prima voor een eenmalige klus, maar herhaalbaar werk hoort in een tool die de stappen vastlegt.

Waar moet je op letten bij data wrangling

Ongedocumenteerde handmatige aanpassingen. Waarden met de hand verbeteren in een spreadsheet laat geen spoor na van wat er veranderde en waarom. Worden de cijfers later in vraag gesteld, dan kan je ze niet verklaren. Kies liever voor stappen die vastgelegd worden en opnieuw kunnen draaien.

Eeuwig dezelfde aanvoer wranglen. Schoon je elke week dezelfde export met de hand op, dan is dat een pijplijn die staat te wachten om gebouwd te worden. Handmatige wrangling is voor verkennen, niet voor een vast proces.

Stille aannames. Rijen met lege waarden schrappen of een datumformaat afdwingen kan het antwoord ongemerkt veranderen. Schrijf de keuzes op die je maakt tijdens het opschonen, want het zijn analysebeslissingen, geen loutere opkuis.

Laatst Bijgewerkt: July 18, 2026 Terug naar Woordenboek
Trefwoorden
data wrangling data munging transformatie data profiling datakwaliteit pandas power query etl / elt data engineering