AI en datakwaliteit: waarom goede data het fundament van AI-succes is
AI-systemen zijn zo goed als de data waarop ze draaien. Het principe 'garbage in, garbage out' blijkt keer op keer de oorzaak van mislukte AI-projecten. Slechte data leidt tot onbetrouwbare voorspellingen en — in gevoelige domeinen als zorg of openbaar vervoer — aantoonbare schade.
Toch investeren veel Nederlandse organisaties meer in het model dan in de data waarop het model draait. Datakwaliteit begint bij de bron. Julia Janssen laat in S06E85 zien dat dataverzameling een ambacht is: keuzes over steekproeven, meetmomenten en labeling-instructies bepalen al vroeg wat een model later kan.
Data-annotatie is daarin een onderschat onderdeel — in S05E10 zien we hoe annotators de stille makers zijn van elk getraind model. Hun interpretaties en blindspots zitten versleuteld in elk model dat op hun werk is getraind. Madeleine Schellaars beschrijft in S04E09 hoe NS een organisatiebrede datakwaliteit-visie bouwde: gestandaardiseerde definities, eigenaarschap per domein en meetbare kwaliteitsindicatoren.
Juist het ontbreken van die structuur leidt tot datachoas — spreadsheets met conflicterende versies en KPI's die per afdeling anders worden berekend, zoals S05E71 illustreert. In de zorg toont Daniel Kapitan in S06E69 hoe datakwaliteitsproblemen levens beinvloeden. Elektronische patiëntdossiers zijn zelden schoon: ontbrekende waarden, inconsistente codering en data die voor een ander doel is verzameld.
Datagovernance is hier geen luxe maar een vereiste. Kernles uit S06E78: goede datakwaliteit vergt dat organisaties beginnen bij hun doelen. De productieve vraag is niet 'we hebben veel data, wat kunnen we ermee?' maar 'welk besluit willen we beter nemen?' Die omslag bepaalt welke kwaliteitseisen er werkelijk toe doen.
Veelgestelde vragen over AI en datakwaliteit
Waarom mislukken AI-projecten door slechte datakwaliteit?
Het principe 'garbage in, garbage out' geldt voor elk AI-model: een model optimaliseert op wat er in de trainingsdata zit, niet op wat je bedoelt te meten. Slechte datakwaliteit uit zich in ontbrekende waarden, inconsistente definities, lage representativiteit en verkeerde labels. Het gevolg: een model dat in de test goed presteert maar in productie systematisch foute beslissingen neemt. Organisaties die dit voorkomen, investeren vroeg in datagovernance: eigenaarschap per domein, gedeelde definities en meetbare kwaliteitsindicatoren, zoals NS laat zien in S04E09.
Hoe meet je datakwaliteit voor een AI-project?
Datakwaliteit heeft meerdere dimensies: volledigheid (zijn er geen cruciale waarden leeg?), consistentie (worden begrippen overal hetzelfde gedefinieerd?), nauwkeurigheid (klopt de data met de werkelijkheid?), actualiteit (is de data nog representatief?) en representativiteit (dekt de data de populatie waarop het model wordt toegepast?). Begin met een data-audit voordat je modelleert. Definieer per variabele wie de eigenaar is en welk kwaliteitsniveau acceptabel is. Gebruik kwaliteitsscores als poortwachter in je data-pipeline om degradatie vroegtijdig te signaleren.
Wat is datagovernance en waarom is het nodig voor AI?
Datagovernance is het geheel van afspraken, rollen en processen rondom data: wie mag data aanmaken en wijzigen, hoe worden begrippen gedefinieerd, hoe lang wordt data bewaard en hoe wordt kwaliteit geborgd? Voor AI is het onmisbaar omdat modellen worden getraind op historische data — als die data inconsistent of bevooroordeeld is, neem je die problemen mee het model in. Zonder governance ontbreekt het aan eigenaarschap als datakwaliteit afneemt. Met governance weet elke afdeling wat 'klant', 'conversie' of 'incident' betekent, en train je modellen op een gedeelde werkelijkheid.
Wat gasten hierover zeiden
“Organisaties die dit voorkomen, investeren vroeg in datagovernance: eigenaarschap per domein, gedeelde definities en meetbare kwaliteitsindicatoren. Bij NS was dat de omslag die AI-projecten van experiment naar waarde bracht.
Madeleine Schellaars, Data Director — S04E09
“Spreadsheets als primaire databron leiden tot conflicterende versies, handmatige fouten en KPI's die per afdeling anders worden berekend — precies de datachoas die AI-modellen onbetrouwbaar maakt.
Joop Snijder, Head of AI — S05E71
“De productieve vraag is niet 'we hebben veel data, wat kunnen we ermee?' maar 'welk besluit willen we beter nemen?' Die omslag bepaalt welke data je nodig hebt en welke kwaliteitseisen er werkelijk toe doen.
Joop Snijder, Head of AI — S06E78
Afleveringen over AI en datakwaliteit: waarom goede data het fundament van AI-succes is
De datakwaliteit-visie bij Nationale Spoorwegen (NS) met Madeleine Schellaars
Madeleine Schellaars beschrijft hoe NS een organisatiebrede datakwaliteit-visie bouwde met gestandaardiseerde definities, eigenaarschap per domein en meetbare kwaliteitsindicatoren als fundament voor AI-toepassingen.

Sociale impact door AI: Hoe het annotatielab levens verandert
Het annotatielab van AI for Good toont hoe data-labeling een ambacht is dat de kwaliteit van elk getraind model bepaalt — en hoe dat werk tegelijk werkgelegenheid schept in kwetsbare gemeenschappen.

Wordt mijn data gebruikt bij het trainen van ChatGPT?
Praktische uitleg over welke bedrijfsdata door commerciele aanbieders als trainingsdata kan worden ingezet, afhankelijk van contract en instellingen — en wat dat betekent voor datakwaliteit en compliance.

Hell of Excel: de vijand van datakwaliteit
Spreadsheets als primaire databron leiden tot conflicterende versies, handmatige fouten en KPI's die per afdeling anders worden berekend — precies de datachoas die AI-modellen onbetrouwbaar maakt.

De rol van data in moderne zorg met Daniel Kapitan
Daniel Kapitan laat zien hoe elektronische patiëntendossiers zelden 'schoon' zijn en hoe ontbrekende waarden en inconsistente codering klinische AI-modellen ondermijnen als datagovernance ontbreekt.

AI begint niet met data, maar met doelen
De productieve richting voor AI is niet 'we hebben veel data, wat kunnen we ermee?' maar 'welk besluit willen we beter nemen?' — die omslag bepaalt welke data je nodig hebt en welke kwaliteitseisen er gelden.

Over de kunst van dataverzameling met Julia Janssen
Julia Janssen laat zien hoe keuzes over steekproeven, meetmomenten en labeling-instructies al vroeg in de dataverzamelingsfase bepalen wat een model later kan — en welke blinde vlekken het meedraagt.

Wat écht verandert bij AI-agents — en wat niet
AI-projecten falen niet primair door slechte modellen, maar door gebrekkige governance en monitoring. Dit onderstreept dat datakwaliteit en datagovernance crucialer zijn dan technologische innovatie voor AI-succes.

AI in de ruimte: hoe satellieten autonoom beslissen
Edge AI op satellieten vereist strenge datakwaliteit: systemen moeten autonoom beslissen welke data relevant is (bijv. bewolkte foto's filteren) zonder grondstation-feedback, dus schone trainingsdata is kritisch.

Groter is niet altijd beter, het verhaal achter GPT-NL
GPT-NL demonstreert het belang van datakwaliteit en -transparantie: een Europees taalmodel gebouwd met zorgvuldig geselecteerde, transparante trainingsdata in plaats van maximale schaal. Dit illustreert het 'garbage in, garbage out'-princip

Werkgeluk in de zorg verbeteren met AI-tools
Betrouwbare AI in high-stakes omgevingen vereist nadruk op datakwaliteit en betrouwbaarheid. De aflevering illustreert hoe slechte data (of onbetrouwbare AI-output) in de zorg ernstige gevolgen heeft en waarom fundamentele AI-principes esse

Non-discriminatie in overheidsalgoritmes: jij hebt invloed op de nieuwe standaard
Bias in trainingsdata en algoritmes vereist actieve governance en toetsing. De aflevering toont hoe datakwaliteit en -annotatie kritiek zijn voor het voorkomen van discriminatie in AI-systemen.

Vibe citations: waarom de waarschuwing niet genoeg is
Organisaties falen bij het controleren van AI-bronnen door vier recurrente patronen. De aflevering biedt concrete stappen om betrouwbare output te waarborgen—essentieel omdat slechte data (garbage in) direct leidt tot onbetrouwbare AI-resul

Waar kan 30 seconden stem meer zeggen dan een bloedtest?
Stemanalyse demonstreert hoe AI-modellen kwaliteitsdata nodig hebben: stemgegevens moeten nauwkeurig worden verzameld en geannoteerd voordat AI medische signalen betrouwbaar kan herkennen.

"Hallucineer niet" zeggen lost niets op. Dit wel!
RAG en verificatietechnieken zijn praktische methodes om hallucinaties in AI-systemen tegen te gaan. Dit raakt direct op datakwaliteit: schone, geverifieerde trainingsdata en retrieval-bronnen voorkomen incorrecte AI-outputs.
