Datakwaliteit als fundament: waar AI-projecten stranden vóór het eerste model

Voordat er één AI-model gebouwd wordt, bepaalt de kwaliteit van de onderliggende data al of een AI-project slaagt of vastloopt — precies waar de meeste AI-initiatieven stranden.

Voordat een AI-model ook maar één voorspelling doet, is het lot ervan al bepaald door de data waarmee het gevoed wordt. Toch behandelen veel organisaties datakwaliteit als een nazorg-probleem in plaats van een fundament. Harm Bodewes laat in S05E71 zien hoe Excel — ooit bedoeld als rekenblad — is uitgegroeid tot de belangrijkste bron van datachaos in Nederlandse organisaties: spreadsheets zonder validatie, zonder versiebeheer en zonder eigenaarschap worden alsnog ingezet als 'single source of truth' voor machine learning.

Julia Janssen toont in S06E85 een ander aspect van hetzelfde probleem vanuit een kunstenaarsperspectief: we baseren onze keuzes op algoritmes waarvan we niet weten op welke data ze getraind zijn, laat staan hoe representatief of eerlijk die data is. Joop Snijder trekt in S06E78 de conclusie samen: datakwaliteit is geen technisch detail dat je achteraf oplost, maar een randvoorwaarde die je vooraf vastlegt — vertrekkend vanuit het besluit dat je beter wilt nemen, niet vanuit de data die toevallig beschikbaar is.

Veelgestelde vragen over Datakwaliteit als fundament

Waarom is Excel zo'n groot risico voor datakwaliteit in AI-projecten?

Excel wordt vaak ingezet als database, terwijl het daar nooit voor bedoeld is: bij invoer zijn er geen formaatchecks, geen integriteitsregels en geen versiebeheer. Harm Bodewes legt in S05E71 uit dat dit leidt tot conflicterende 'single sources of truth' — iedere afdeling exporteert, bewerkt en importeert weer eigen kopieën. Voor machine learning is dat funest: je kunt data niet versioneren en dus nooit precies herleiden waarop een model getraind is. De oplossing is Excel als applicatie te behandelen, met een datacontract over tabbladen, datatypes en eigenaarschap.

Hoe beïnvloedt de kwaliteit van trainingsdata het gedrag van AI-algoritmes?

Julia Janssen laat in S06E85 zien dat we dagelijks keuzes baseren op aanbevelingsalgoritmes — van Netflix tot Google Maps — zonder te weten op welke data ze getraind zijn of wie de onderliggende beslissingen neemt. Die ondoorzichtigheid is een datakwaliteitsprobleem in vermomming: als niemand kan navertellen welke data een model heeft gevormd, kan niemand ook beoordelen of de uitkomst representatief, eerlijk of achterhaald is.

Waarom moet een AI-project beginnen met doelen in plaats van met data?

Joop Snijder betoogt in S06E78 dat het verzamelen van zoveel mogelijk data zonder helder doel een van de grootste valkuilen is bij AI-implementaties. Data zonder context is 'een berg enen en nullen'; pas als je weet welk besluit je beter wilt nemen, kun je bepalen welke data je nodig hebt en welke kwaliteitseisen daarbij horen. Deze omslag voorkomt dat je kostbare tijd investeert in modellen die geen praktische waarde hebben.

Citaten uit onze afleveringen

Wat ik continu merk in mijn werk is dat we last hebben van datakwaliteitsproblemen. De data scientist kan pas zijn werk doen als hij goede kwaliteit data heeft. En die datakwaliteitsproblemen zijn eigenlijk heel vaak, een jaar of twintig geleden, ontstaan door het verschrikkelijke tool Excel.

Harm Bodewes, Zelfstandig adviseur Data Analytics & Data Science — S05E71

Het verwaarlozen van datakwaliteit. Hoewel data niet het startpunt moet zijn, is de kwaliteit ervan wel cruciaal. Slecht of vertekende data leidt onherroepelijk tot onbetrouwbare AI-systemen.

Joop Snijder, Head of AI — S06E78

We gaan steeds meer onze keuzes maken op basis van zo'n statistiek, die we vaak ook niet begrijpen, waarvan we vaak ook niet weten op welke data het getraind is, wat er voor die modellen daarachter zijn, wie dit soort beslissingen maken.

Julia Janssen, Kunstenaar en onderzoeker — S06E85

Bewijsafleveringen

S05E71

Hell of Excel: de vijand van datakwaliteit

Spreadsheets als primaire databron leiden tot conflicterende versies, handmatige fouten en KPI's die per afdeling anders worden berekend — precies de datachaos die AI-modellen onbetrouwbaar maakt.

S05E71 artwork
S06E78

AI begint niet met data, maar met doelen

De productieve richting voor AI is niet 'we hebben veel data, wat kunnen we ermee?' maar 'welk besluit willen we beter nemen?' — die omslag bepaalt welke data je nodig hebt en welke kwaliteitseisen er gelden.

S06E78 artwork
S06E85

Over de kunst van dataverzameling met Julia Janssen

Julia Janssen laat zien hoe keuzes over steekproeven, meetmomenten en labeling-instructies al vroeg in de dataverzamelingsfase bepalen wat een model later kan — en welke blinde vlekken het meedraagt.

S06E85 artwork
S08E73

AI van pilot naar productie: zo slaag je!

De aflevering verklaart waarom AI-projecten falen bij de overgang naar productie en benadrukt dat een solide datafundament cruciaal is – dit sluit aan bij het kernthema dat datakwaliteit de basis vormt waar projecten stranden.

S08E73 artwork
S08E53

Werkgeluk in de zorg verbeteren met AI-tools

Sensire's case demonstreert hoe slechte datakwaliteit in zorgrapportages (10 minuten per cliënt) direct impact heeft op AI-implementatie. Betrouwbare AI vereist eerst de chaos in brondata aanpakken voordat modellen toegevoegd kunnen worden.

S08E53 artwork
S08E40

"Hallucineer niet" zeggen lost niets op. Dit wel!

RAG en verificatietechnieken adresseren fundamenteel probleem van AI-betrouwbaarheid. Deze methodieken helpen hallucinations voorkomen door betere datakwaliteit en structuur in trainings- en retrieval-processen.

S08E40 artwork
S08E31

Praktische AI voor bedrijven en sport: van CRM-automatisering tot hockeyanalyse

AI-projecten slagen wanneer je eerst processen analyseert voordat je modellen bouwt. Dit voorkomt datakwaliteitsproblemen door bewuste doelstellingen en procesoptimalisatie als fundament.

S08E31 artwork
S08E18

AIToday Live wint Nationale AI Award 2025

Doelgericht AI-gebruik prevaleert boven technische mogelijkheden. Marc van Meel benadrukt dat organisaties AI moeten inzetten waar het werkelijk waarde creëert, niet omdat de technologie beschikbaar is—een kernprincipe voor succesvolle AI-i

S08E18 artwork
S07E86

Context engineering: de onzichtbare motor achter betrouwbare AI

Context engineering voorkomt datavervuiling en verbetert AI-betrouwbaarheid. Dit sluit aan op het fundament van datakwaliteit: schone, goed-gecontextualiseerde data is essentieel voordat AI-modellen kunnen slagen.

S07E86 artwork
S08E75

Waar kan 30 seconden stem meer zeggen dan een bloedtest?

AI-modellen zijn afhankelijk van hoogwaardige inputdata: Healfie's succes met stemherkenning toont hoe schone, relevante trainingsdata essentieel is voor accurate AI-voorspellingen in de gezondheidszorg.

S08E75 artwork
S08E71

Ai van Columbus: vijf lagen van betekenis

Taalmodellen halluccineren structureel, niet accidenteel. Dit maakt verificatie en bewuste data-handling essentieel voordat je AI inzet—users moeten begrijpen dat 'garbage in' niet alleen slechte trainingsdata betekent, maar ook verkeerde i

S08E71 artwork
S08E67

Niet onze AI: waarom regie pakken belangrijker is dan voor of tegen AI zijn

Organisaties stranden in AI-projecten door verkeerd te beginnen: eerst 'hoe zetten we AI in?' in plaats van 'welk probleem lossen we op?'. Dit leidt tot slechte datakwaliteit en discriminatie (Amsterdam bijstandscase). Probleemdefiniëring v

S08E67 artwork

Verder lezen over Datakwaliteit als fundament