AI en datakwaliteit: waarom goede data het fundament van AI-succes is

AI-systemen zijn zo goed als de data waarop ze draaien. Het principe 'garbage in, garbage out' blijkt keer op keer de oorzaak van mislukte AI-projecten. Slechte data leidt tot onbetrouwbare voorspellingen en — in gevoelige domeinen als zorg of openbaar vervoer — aantoonbare schade.

Toch investeren veel Nederlandse organisaties meer in het model dan in de data waarop het model draait. Datakwaliteit begint bij de bron. Julia Janssen laat in S06E85 zien dat dataverzameling een ambacht is: keuzes over steekproeven, meetmomenten en labeling-instructies bepalen al vroeg wat een model later kan.

Data-annotatie is daarin een onderschat onderdeel — in S05E10 zien we hoe annotators de stille makers zijn van elk getraind model. Hun interpretaties en blindspots zitten versleuteld in elk model dat op hun werk is getraind. Madeleine Schellaars beschrijft in S04E09 hoe NS een organisatiebrede datakwaliteit-visie bouwde: gestandaardiseerde definities, eigenaarschap per domein en meetbare kwaliteitsindicatoren.

Juist het ontbreken van die structuur leidt tot datachoas — spreadsheets met conflicterende versies en KPI's die per afdeling anders worden berekend, zoals S05E71 illustreert. In de zorg toont Daniel Kapitan in S06E69 hoe datakwaliteitsproblemen levens beinvloeden. Elektronische patiëntdossiers zijn zelden schoon: ontbrekende waarden, inconsistente codering en data die voor een ander doel is verzameld.

Datagovernance is hier geen luxe maar een vereiste. Kernles uit S06E78: goede datakwaliteit vergt dat organisaties beginnen bij hun doelen. De productieve vraag is niet 'we hebben veel data, wat kunnen we ermee?' maar 'welk besluit willen we beter nemen?' Die omslag bepaalt welke kwaliteitseisen er werkelijk toe doen.

Veelgestelde vragen over AI en datakwaliteit

Waarom mislukken AI-projecten door slechte datakwaliteit?

Het principe 'garbage in, garbage out' geldt voor elk AI-model: een model optimaliseert op wat er in de trainingsdata zit, niet op wat je bedoelt te meten. Slechte datakwaliteit uit zich in ontbrekende waarden, inconsistente definities, lage representativiteit en verkeerde labels. Het gevolg: een model dat in de test goed presteert maar in productie systematisch foute beslissingen neemt. Organisaties die dit voorkomen, investeren vroeg in datagovernance: eigenaarschap per domein, gedeelde definities en meetbare kwaliteitsindicatoren, zoals NS laat zien in S04E09.

Hoe meet je datakwaliteit voor een AI-project?

Datakwaliteit heeft meerdere dimensies: volledigheid (zijn er geen cruciale waarden leeg?), consistentie (worden begrippen overal hetzelfde gedefinieerd?), nauwkeurigheid (klopt de data met de werkelijkheid?), actualiteit (is de data nog representatief?) en representativiteit (dekt de data de populatie waarop het model wordt toegepast?). Begin met een data-audit voordat je modelleert. Definieer per variabele wie de eigenaar is en welk kwaliteitsniveau acceptabel is. Gebruik kwaliteitsscores als poortwachter in je data-pipeline om degradatie vroegtijdig te signaleren.

Wat is datagovernance en waarom is het nodig voor AI?

Datagovernance is het geheel van afspraken, rollen en processen rondom data: wie mag data aanmaken en wijzigen, hoe worden begrippen gedefinieerd, hoe lang wordt data bewaard en hoe wordt kwaliteit geborgd? Voor AI is het onmisbaar omdat modellen worden getraind op historische data — als die data inconsistent of bevooroordeeld is, neem je die problemen mee het model in. Zonder governance ontbreekt het aan eigenaarschap als datakwaliteit afneemt. Met governance weet elke afdeling wat 'klant', 'conversie' of 'incident' betekent, en train je modellen op een gedeelde werkelijkheid.

Wat gasten hierover zeiden

Organisaties die dit voorkomen, investeren vroeg in datagovernance: eigenaarschap per domein, gedeelde definities en meetbare kwaliteitsindicatoren. Bij NS was dat de omslag die AI-projecten van experiment naar waarde bracht.

Madeleine Schellaars, Data Director — S04E09

Spreadsheets als primaire databron leiden tot conflicterende versies, handmatige fouten en KPI's die per afdeling anders worden berekend — precies de datachoas die AI-modellen onbetrouwbaar maakt.

Joop Snijder, Head of AI — S05E71

De productieve vraag is niet 'we hebben veel data, wat kunnen we ermee?' maar 'welk besluit willen we beter nemen?' Die omslag bepaalt welke data je nodig hebt en welke kwaliteitseisen er werkelijk toe doen.

Joop Snijder, Head of AI — S06E78

Afleveringen over AI en datakwaliteit: waarom goede data het fundament van AI-succes is

S04E09

De datakwaliteit-visie bij Nationale Spoorwegen (NS) met Madeleine Schellaars

Madeleine Schellaars beschrijft hoe NS een organisatiebrede datakwaliteit-visie bouwde met gestandaardiseerde definities, eigenaarschap per domein en meetbare kwaliteitsindicatoren als fundament voor AI-toepassingen.

S04E09 artwork
S05E10

Sociale impact door AI: Hoe het annotatielab levens verandert

Het annotatielab van AI for Good toont hoe data-labeling een ambacht is dat de kwaliteit van elk getraind model bepaalt — en hoe dat werk tegelijk werkgelegenheid schept in kwetsbare gemeenschappen.

S05E10 artwork
S05E62

Wordt mijn data gebruikt bij het trainen van ChatGPT?

Praktische uitleg over welke bedrijfsdata door commerciele aanbieders als trainingsdata kan worden ingezet, afhankelijk van contract en instellingen — en wat dat betekent voor datakwaliteit en compliance.

S05E62 artwork
S05E71

Hell of Excel: de vijand van datakwaliteit

Spreadsheets als primaire databron leiden tot conflicterende versies, handmatige fouten en KPI's die per afdeling anders worden berekend — precies de datachoas die AI-modellen onbetrouwbaar maakt.

S05E71 artwork
S06E69

De rol van data in moderne zorg met Daniel Kapitan

Daniel Kapitan laat zien hoe elektronische patiëntendossiers zelden 'schoon' zijn en hoe ontbrekende waarden en inconsistente codering klinische AI-modellen ondermijnen als datagovernance ontbreekt.

S06E69 artwork
S06E78

AI begint niet met data, maar met doelen

De productieve richting voor AI is niet 'we hebben veel data, wat kunnen we ermee?' maar 'welk besluit willen we beter nemen?' — die omslag bepaalt welke data je nodig hebt en welke kwaliteitseisen er gelden.

S06E78 artwork
S06E85

Over de kunst van dataverzameling met Julia Janssen

Julia Janssen laat zien hoe keuzes over steekproeven, meetmomenten en labeling-instructies al vroeg in de dataverzamelingsfase bepalen wat een model later kan — en welke blinde vlekken het meedraagt.

S06E85 artwork
S08E30

Wat écht verandert bij AI-agents — en wat niet

AI-projecten falen niet primair door slechte modellen, maar door gebrekkige governance en monitoring. Dit onderstreept dat datakwaliteit en datagovernance crucialer zijn dan technologische innovatie voor AI-succes.

S08E30 artwork
S08E16

AI in de ruimte: hoe satellieten autonoom beslissen

Edge AI op satellieten vereist strenge datakwaliteit: systemen moeten autonoom beslissen welke data relevant is (bijv. bewolkte foto's filteren) zonder grondstation-feedback, dus schone trainingsdata is kritisch.

S08E16 artwork
S08E59

Groter is niet altijd beter, het verhaal achter GPT-NL

GPT-NL demonstreert het belang van datakwaliteit en -transparantie: een Europees taalmodel gebouwd met zorgvuldig geselecteerde, transparante trainingsdata in plaats van maximale schaal. Dit illustreert het 'garbage in, garbage out'-princip

S08E59 artwork
S08E53

Werkgeluk in de zorg verbeteren met AI-tools

Betrouwbare AI in high-stakes omgevingen vereist nadruk op datakwaliteit en betrouwbaarheid. De aflevering illustreert hoe slechte data (of onbetrouwbare AI-output) in de zorg ernstige gevolgen heeft en waarom fundamentele AI-principes esse

S08E53 artwork
S08E41

Non-discriminatie in overheidsalgoritmes: jij hebt invloed op de nieuwe standaard

Bias in trainingsdata en algoritmes vereist actieve governance en toetsing. De aflevering toont hoe datakwaliteit en -annotatie kritiek zijn voor het voorkomen van discriminatie in AI-systemen.

S08E41 artwork
S08E66

Vibe citations: waarom de waarschuwing niet genoeg is

Organisaties falen bij het controleren van AI-bronnen door vier recurrente patronen. De aflevering biedt concrete stappen om betrouwbare output te waarborgen—essentieel omdat slechte data (garbage in) direct leidt tot onbetrouwbare AI-resul

S08E66 artwork
S08E75

Waar kan 30 seconden stem meer zeggen dan een bloedtest?

Stemanalyse demonstreert hoe AI-modellen kwaliteitsdata nodig hebben: stemgegevens moeten nauwkeurig worden verzameld en geannoteerd voordat AI medische signalen betrouwbaar kan herkennen.

S08E75 artwork
S08E40

"Hallucineer niet" zeggen lost niets op. Dit wel!

RAG en verificatietechnieken zijn praktische methodes om hallucinaties in AI-systemen tegen te gaan. Dit raakt direct op datakwaliteit: schone, geverifieerde trainingsdata en retrieval-bronnen voorkomen incorrecte AI-outputs.

S08E40 artwork