Waarom snapt Artificial Intelligence je vraag bijna nooit precies zoals jij hem bedoelt? Het probleem is dat een taalmodel altijd zelfverzekerd antwoordt, ook als het de context mist die jij als vanzelfsprekend beschouwt. Een tik-experiment uit 1990 laat zien waarom: luisteraars raadden een getikt liedje maar in 2,5 procent van de gevallen goed, terwijl tikkers 50 procent verwachtten.
Dezelfde kloof zit in elke prompt die je stelt zonder je context expliciet te maken, van een directierapport tot een klantmail. Morgen kun je die kloof dichten door één prompt aan te vullen met drie zinnen context die je normaal weglaat, en te testen of de output beter aansluit.
Het taalmodel zegt nooit dat het jou niet volgt.
Joop SnijderEen taalmodel kent als het ware alle liedjes ter wereld, behalve dat van jou.
Joop SnijderHoi, leuk dat je weer luistert naar een nieuwe aflevering van AIToday Live. Dit is de korte aflevering, mijn naam is Joop Snijder, Head of AI bij Info Support. Ik ga je een belofte doen, want dit is een aflevering over taalmodellen, dat beloof ik je alvast. Maar om goed duidelijk te maken wat ik je in deze aflevering mee wil geven, begin ik met een spelletje. Ik ga namelijk een liedje tikken. Ongeveer acht tellen en jij mag raden welk nummer het is.… Ben je klaar voor? Komt die aan. Ik denk dat het best wel lastig was, het was namelijk Lang zal ze leven. En voor mij was dat niet te missen. Want ik weet wat ik tik. En bij mij liep de hele melodie mee in mijn hoofd. Inclusief de tekst en zelfs die ene tante die dan te laag inzet. Ik denk dat jij gewoon iemand hoorde kloppen op de microfoon. Geen idee, toch? In dat verschil zit de verklaring voor iets wat je vast herkent. Je vraagt namelijk een AI-assistent, een taalmodel iets wat glashelder is. En je krijgt iets terug, wat net naast de bedoeling zit. Een taalmodel kent als het ware alle liedjes ter wereld, behalve dat van jou. En dat speelt niet alleen bij een los promptmomentje. Hetzelfde mechanisme zit in elk reviewproces waarin een team AI-teksten goedkeurt voordat ze de deur uitgaan. Hoe zit dit nou eigenlijk? In 1990 promoveerde namelijk Elizabeth Newton aan Stanford op precies dit spelletje. En zij had het over tikkers en luisteraars. De een tikte het ritme van een bekend liedje op de tafel, net wat ik deed op de microfoon. En de ander moest raden welk nummer het was. En voordat er getikt werd, vroeg Newton de tikkers. Hoe vaak denk je dat jouw luisteraar het straks goed heeft. En hun antwoord was de helft. Nou bleek dat van de 120 getikte liedjes. Hoeveel procent denk je dat er echt geraden werd? Noem eens even een getal hardop of nu in je hoofd. Het waren er drie. Er werden er drie geraden van de 120, dus 2,5%. Dus de tikkers dachten dat een boodschap één op de twee keer zou aankomen. In werkelijkheid was het dus één op de 40 keer. En de kans is groot dat jouw getal ook te hoog was. Dat je dacht dat het veel vaker herkend zou worden. Nou, hoe kom ik je nou aan? Ik zal het boek te lezen van Chip Heath. Een boek Made to Stick en zij noemde dit de curse of knowledge, de vloek van kennis. Zodra je iets weet, kun je je niet meer voorstellen hoe het is om het niet te weten. Dat is dan de prijs van vakmanschap. Dus hoe beter je in je werk bent, hoe zwaarder uiteindelijk die vloek weegt. Wie tikt hoort het nummer meelopen met de tikken. Dat lukt niet anders. Probeer het nu maar eens. En probeer tegelijkertijd de melodie in je hoofd uit te zetten. Dat is echt kansloos. En wat je ook ziet, is dat kennis stapelt niet alleen. Kennis kan namelijk ook blokkeren. Het maakt jouw uitleg de vanzelfsprekende uitleg. En het verstopt alle andere manieren waarop iemand jouw woorden kan opvatten. Dat haar tikkers zich verbaasden. Sterker nog, soms ergerde ze zich. Waarom doet hij anders zo moeilijk? Het is toch duidelijk. Dat zij jouw alarmbel moeten zijn. Dus wie denkt het is toch duidelijk die zit dus te tikken. En dit is dus het punt wat ik wil maken in deze aflevering. Want je hebt te maken met dat je communiceert met een taalmodel. En het taalmodel zegt nooit dat het jou niet volgt. Hier wordt het anders dan bij mensen. Een menselijke luisteraar geeft nog een signaal terug. Die valt stil, vraagt door of zegt eerlijk, ik volg je niet. En dat signaal kan je dan oppikken. En dat zou dan zeg maar de redding kunnen zijn van de vloek, als je dat zo zou mogen zeggen. Het taalmodel doet dat niet. Het antwoordt altijd vloeiend netjes geformuleerd, kopjes, opsommingen erbij. Je kent het allemaal wel. En dat antwoord is niet anders dan een aannemelijke gok op basis van jouw tikken. Niet in het antwoord vertelt je dat de melodie onderweg verdwenen is. En daar komt nog iets bij. Dat model weet werkelijk veel. Het kent bijvoorbeeld wat. De AI-verordening, het kent de boekhoudregels. Het kent zelfs de vaktaal van jouw sector. Precies daarom is het ook zo makkelijk om in deze val te trappen. Je merkt hoeveel het weet en je concludeert dat het jouw situatie dan ook wel snapt. Maar het kent dus alle liedjes ter wereld, behalve dat van jou. Een voorbeeld om het tastbaar te maken. Je typt: schrijf een samenvatting van dit rapport voor de directie, zeven woorden. In jouw hoofd zit er ook bij dat de directie dit vrijdag in 20 minuten behandelt, dat één directielid het project vorig jaar heeft afgeschoten, dat de cijfers over dat derde kwartaal gevoelig liggen, en dat samenvatting bij jullie eigenlijk aanbeveling met onderbouwing betekent. Het model, die leest zeven woorden en levert een keurige samenvatting op. Prima werk. Alleen niet het liedje dat jij hoorde. Er is onderzoek dat in dezelfde richting wijst. In 2023 verscheen er een studie met de titel Why Johnny can't prompt. Onderzoekers lieten mensen zonder AI-achtergrond een chatbot bouwen met prompts en onderzochten waar het dan misging. En het ging om een kleine kwalitatieve studie. Dus reken er geen harde percentages dan af. Maar er zat wel een interessante patroon in. De deelnemers instrueerden het model zoals ze een mens zouden instrueren. En gingen ervan uit dat het de bedoeling ervanzelf wel bij begrepen werd. En even eerlijk over de vergelijkingen. Newton onderzocht mensen en ritmen, geen prompts. Dus het is meer een analogie en geen meting. Maar het mechanisme is alleen wel hetzelfde. En toen ik dit las en deed, kreeg ik dat ook. Als je dat weet van dat tikken en dat een ander daar helemaal geen wijsheid kan worden. Vond ik wel buitengewoon. Wat kunnen we je nou aan doen? Drie dingen kunnen helpen. Het eerste schrijf op wat alleen in jouw hoofd zit voordat je op enter drukt. En dat is makkelijker gezegd dan gedaan. Want hoe weet je wat alleen in jouw hoofd zit? Even terug naar dat rapport. Dus in plaats van die zeven woorden, typ je dat het gaat om vier directieleden die je vrijdag 20 minuten voor over hebben. Dat je wel eindigen met een aanbeveling met onderbouwing en dat de cijfers over het derde kwartaal gevoelig liggen. Dat zijn geen mooiere woorden die je meegeven aan het taalmodel. Het zijn echt andere en het geeft gewoon uiteindelijk meer inzicht, kennis en context. Het zijn de dingen die je een nieuwe collega op dag één ook zou vertellen. Je moet wel letten op overcorrectie. Dus meer context, is niet altijd betere context. Dus wie uit angst voor misverstanden, het halve dossier erin plakt, krijgt dan een model dat het overzicht verliest tussen de bijzaken. Een tweede en het is niet iets wat je altijd hoeft toe te passen, maar zodra je het idee krijgt, word ik wel goed begrepen. Kan je net als bij mensen vragen om een samenvatting van de opdracht voordat er ook maar iets gemaakt wordt vraag om vragen die het model zelf nog heeft. Dus zet bijvoorbeeld onderaan de prompt zin. Vat eerst in twee zinnen samen, wat je gaat maken. En welke drie vragen je nog hebt voordat je begint. Dat is het equivalent van de melodie laten neuriën in plaats van laten raden, zou je kunnen zeggen. Het kost je een paar seconden, maar het dicht wel een kloof. Die nog heel goedkoop is om te dichten. Het derde. Leg de terugkerende context gewoon één keer vast. Dus huisstijl, doelgroepen, verboden woorden, vaste bronnen. Dan type je niet elke keer opnieuw over en dat zet je één keer in de instellingen van je assistent of in een document dat je meestuurt. Kijk, het lastige aan het hele verhaal, de vloek van kennis. Je kunt niet vergeten wat je weet, gelukkig maar. Kijk maar, als ik nu dit tik. Dan weet je gewoon wat het wel is. Kijk, wat je wel kunt, is stoppen met de aanname dat dit vanzelf een liedje is. Dus hier is je actie voor vandaag. Pak de laatste prompt waarvan het resultaat tegenviel. Niet om het te verbeteren, maar om één vraag te beantwoorden: wat wist ik wel en heb ik niet opgeschreven? Het ene antwoord levert je meer op dan 10 nieuwe prompttrucs. Kijk, voor mij was het best wel een heel interessant inzicht van: oh ja, we hebben de tikkers wat communiceren. En we hebben luisteraars. En als je dat in gedachte houdt met het communiceren met je taalmodel, word je er gewoon beter in. Dankjewel weer voor het luisteren. Abonneer je via je favoriete podcast app. Dan mis je geen aflevering en onthoud natuurlijk: AI is niet de oplossing voor elk probleem, maar onmisbaar waar het past.