AI-hallucinaties en databetrouwbaarheid: waarom vertrouwen zonder controle misgaat
Organisaties vertrouwen AI-output steeds vaker zonder verificatie — met vibe citations en hallucinaties tot gevolg. De oplossing zit niet in waarschuwen, maar in betrouwbare brondata en verplichte verificatie.
Onbetrouwbare AI-output en databetrouwbaarheid zijn twee kanten van dezelfde medaille. Joop Snijder laat in S08E66 zien hoe zelfs 's werelds grootste adviesbureaus rapporten publiceerden met tientallen verzonnen bronvermeldingen — 'vibe citations' die er echt uitzien, maar bij controle niet blijken te kloppen. Vier onderliggende patronen verklaren waarom dit ondanks reviewrondes toch gebeurt: automation bias, het gemak dat we verwarren met waarheid, en het omstanderseffect waarbij niemand zich verantwoordelijk voelt voor controle.
In S08E40 legt Joop uit waarom de instructie 'hallucineer niet' niet werkt: een taalmodel kiest woord voor woord het meest waarschijnlijke vervolg en heeft geen intern mechanisme om waarheid te toetsen. Wel werkt het aanleveren van geverifieerd bronmateriaal via RAG, expliciete bronvermelding en chain-of-thought redeneren. S05E62 laat zien dat databetrouwbaarheid ook begint bij begrijpen welke data je zelf deelt met een AI-dienst, want ook dat bepaalt wat een model later kan reproduceren.
Betrouwbare AI-output vraagt dus om betrouwbare brondata én een werkproces waarin controle een expliciete taak is, niet een vage verwachting.
Veelgestelde vragen over AI-hallucinaties en databetrouwbaarheid
Wat zijn vibe citations en waarom zijn ze een probleem?
Vibe citations zijn AI-gegenereerde bronvermeldingen die er precies uitzien als een echte bron — auteur, titel, jaartal, uitgever — maar bij controle niet blijken te kloppen of zelfs helemaal niet te bestaan. Joop Snijder bespreekt in S08E66 hoe drie van de vier grootste adviesbureaus ter wereld hier last van hadden: in één rapport bleken 40 van de 45 bronvermeldingen verzonnen. Het probleem is geen incident maar een patroon, veroorzaakt door automation bias, het gemak dat aanvoelt als waarheid, en het omstanderseffect waarbij iedereen aanneemt dat een ander de bron al heeft gecontroleerd.
Waarom werkt de instructie 'hallucineer niet' niet bij een taalmodel?
Een taalmodel voorspelt woord voor woord het meest waarschijnlijke vervolg op een tekst en heeft geen apart mechanisme dat controleert of iets feitelijk klopt. Joop Snijder legt in S08E40 uit dat hallucinatie daarom geen stijlkeuze is die je kunt verbieden, zoals 'schrijf geen Engels' — het model kent het onderscheid tussen feit en verzinsel simpelweg niet. Wat wel helpt: het model bronmateriaal meegeven (RAG, vermindert hallucinaties met ongeveer 71%), om expliciete bronvermelding vragen, en het model stap voor stap laten redeneren.
Wordt mijn data gebruikt om AI-modellen zoals ChatGPT te trainen?
Dat hangt af van de versie die je gebruikt. Bij de gratis ChatGPT 3.5 wordt gebruikersdata niet meer voor training ingezet, al blijft de chatgeschiedenis wel bewaard voor eigen gemak. Bij de betaalde ChatGPT Plus (GPT-4) kunnen vragen en antwoorden wél worden gebruikt om het model te verbeteren. Via Azure OpenAI (Microsoft) geldt een ander regime: data wordt na 30 dagen verwijderd en nooit gebruikt voor training, ongeacht de modelversie — relevant voor organisaties die zakelijke databetrouwbaarheid en compliance willen waarborgen.
Citaten uit onze afleveringen
“Vibe citations is laten we zeggen het bronnenbroertje van vibe coding. Een verwijzing die de juiste vibe heeft. Hij heeft de vorm van een echte bron: auteur, titel, jaartal, uitgever. Daardoor voelt hij betrouwbaar. Tot je hem echt nakijkt.
Joop Snijder, Head of AI — S08E66
“Een taalmodel voorspelt woord voor woord wat het meest waarschijnlijke vervolg is op de vorige tekst. Het heeft geen apart mechanisme dat tussendoor zegt: wacht even, is dit wel waar. Het heeft simpelweg geen besef van waarheid.
Joop Snijder, Head of AI — S08E40
“De gratis versie, ChatGPT 3.5, daar wordt de data van gebruikers niet meer gebruikt voor trainingsdoeleinden. In de betaalde versie, GPT 4, ChatGPT Plus abonnement, als je die hebt, dan kan je data voor trainingsdoeleinden worden gebruikt.
Joop Snijder, Head of AI — S05E62
Bewijsafleveringen
Vibe citations: waarom de waarschuwing niet genoeg is
Organisaties falen bij het controleren van AI-bronnen door vier recurrente patronen: automation bias, de moeite van verificatie, gemak als waarheidssignaal en het omstanderseffect. De aflevering biedt concrete stappen om betrouwbare output te waarborgen.

"Hallucineer niet" zeggen lost niets op. Dit wel!
RAG en verificatietechnieken zijn praktische methodes om hallucinaties in AI-systemen tegen te gaan. Dit raakt direct op datakwaliteit: schone, geverifieerde trainingsdata en retrieval-bronnen voorkomen incorrecte AI-outputs.

Wordt mijn data gebruikt bij het trainen van ChatGPT?
Praktische uitleg over welke bedrijfsdata door commerciële aanbieders als trainingsdata kan worden ingezet, afhankelijk van contract en instellingen — en wat dat betekent voor datakwaliteit en compliance.

Verder lezen over AI-hallucinaties en databetrouwbaarheid
Dit thema valt onder
AI en datakwaliteit: waarom goede data het fundament van AI-succes is →