Marijn van Aerle, medeoprichter en CTO van Floryn, bouwde een controlesysteem waarbij een beoordelaar niet zomaar akkoord kan klikken op een AI-voorstel. Het probleem: na tweehonderd keer goedkeuren wordt controleren een reflex, ook bij AI-voorstellen die fout zijn. Van Aerle laat zien hoe zijn systeem afwijkende beslissingen automatisch naar een tweede beoordelaar stuurt, met de vraag wat er anders is aan dit dossier.
Bij Floryn corrigeert het model de mens niet, maar signaleert het wanneer een besluit afwijkt van vergelijkbare zaken - vóór het bericht naar de klant gaat. Uit onderzoek van Info Support blijkt dat minder dan 10% van de organisaties AI-governance formeel heeft vastgelegd, terwijl 80% AI al gebruikt in het ontwikkelproces. Morgen kun je zelf één cijfer opzoeken: hoeveel van de laatste honderd AI-voorstellen zijn afgekeurd.
Wie het gelijkmatig uitsmeert over alles wat een AI-systeem oplevert, houdt dus uiteindelijk gewoon een heel dun laagje over.
Joop SnijderToezicht dat je niet inricht verdwijnt uiteindelijk vanzelf.
Joop SnijderHoi, leuk dat je luistert naar een korte aflevering van AIToday Live. Ik ben Joop Snijder, Head of AI bij Info Support. We gaan het vandaag hebben over Human-in-the-loop. Misschien iets anders dan dat je verwacht. Kijk, tweehonderd keer heb je op goedkeuren gedrukt. Tweehonderd keer klopt het voorstel dat je voorgelegd kreeg. Wat doe je dan de tweehonderdeneerste keer? Je drukt. Natuurlijk druk je. Misschien gaat het bij jou over facturen die automatisch worden gecodeerd of conceptantwoorden aan klanten over codewijzigingen die een agent voorstelt. Het patroon is overal hetzelfde. Een systeem doet het voorwerk en een mens zet er zijn naam onder. Vandaag gaat het over die tweehonderdeneerste keer. Over de zin die ik in vrijwel elk AI-beleid onder ogen krijg. Er beoordeelt altijd een mens het voorstel voordat het definitief wordt. Human-in-the-loop, menselijk toezicht, de tweede handtekening. De woorden verschillen per organisatie, de gedachte is steeds hetzelfde. De techniek stelt voor, een mens beslist. En die zin stelt directies gerust. Toezichthouders ook. En ik snap dat, want het klinkt als een rem waar je altijd op kunt trappen. Maar mijn stelling van vandaag is misschien wat ongemakkelijker, want toezicht dat je niet inricht verdwijnt uiteindelijk vanzelf. Oplettendheid slijt. Mensen zijn goed in van alles. In één ding zijn we uiteindelijk ronduit slecht: eindeloos opletten terwijl er bijna nooit iets misgaat. Wie wel eens een tweede handtekening heeft gezet onder andermans werk, herkent dit. De eerste week lees je misschien alles, daarna lees je de kop en de conclusie, nog wat later herken je het formaat, klopt het patroon, en teken je. Dat is geen luiheid. Dat is wat er met aandacht gebeurt, wanneer aandacht bijna nooit iets oplevert. Je brein leert razendsnel dat controleren zonde van de tijd is. Want het klopt toch altijd. Met AI-voorstellen gaat dat sneller dan met menselijk werk. Menselijke fouten zijn rommelig en verschillen van vorm. Iemand is moe, wordt gestoord, slaat een stap over. Maar AI maakt fouten die verzorgd zijn opgeschreven. Een verkeerd bedrag staat in dezelfde nette zin als een goed bedrag. In aflevering S07E64 ging ik in op de vraag of een fout van AI erger is dan een fout van een mens. Daar kwam ook automatiseringsbias langs. De neiging om het advies van een systeem over te nemen zonder het na te lopen. Het bekendste voorbeeld blijft de advocaat die rechtszaken aanhalen die nooit hadden bestaan. Wat organisaties hiertegen doen, is meestal een zin toevoegen. Controleer de uitvoer altijd. Gebruik het antwoord niet zonder verificatie. Een waarschuwing verplaatst de verantwoordelijkheid, maar verandert weinig aan het gedrag dat je wilt bijsturen. Zeker niet bij de tweehonderdeneerste keer. Er is een vraag waarmee je binnen vijf minuten weet hoe het bij jou staat. Namelijk: hoe vaak keurt jouw beoordelaar een voorstel af? Niet op gevoel, maar als percentage over de afgelopen maand. Bij nul procent zijn er twee mogelijkheden. Of het systeem is uitzonderlijk goed, of er wordt niet gecontroleerd. Je kunt het verschil niet vaststellen. Dat is precies het probleem. Niet dat het misgaat, maar dat je niet weet of het goed gaat. In aflevering S08E78 besprak ik het Agentic Engineering-onderzoek van Info Support onder driehonderddertig Nederlandse IT-beslissers. En ruim tachtig procent van de organisaties zegt dat zij AI gebruiken in het softwareontwikkelproces. Maar bij minder dan tien procent is AI-governance formeel vastgelegd. Een derde gaf aan dat zij actief toezicht hebben met logging en audits. Eigenlijk is het dus beleid op papier met weinig eronder. En voordat je nu overal een strengere controle bovenhangt, dat werkt averechts. Toezicht is een schaars goed, net als dus de aandacht van de mensen, zoals we hebben gezien. En wie het gelijkmatig uitsmeert over alles wat een AI-systeem oplevert, houdt dus uiteindelijk gewoon een heel dun laagje over. De vraag is dus waar een fout echt pijn doet. Een verkeerd samengevatte vergadernotitie wordt binnen een dag rechtgezet door iemand die erbij was, of niet, en dan was hij helemaal niet belangrijk. Een afgewezen aanvraag, een verkeerde prijs richting een klant, of een gemiste signalering in een dossier, komt vaak pas maanden later boven water. En wanneer je het herstellen eigenlijk niet meer zo makkelijk is. Datzelfde geldt voor besluiten die persoonlijk uitpakken voor iemand. Daar hoort menselijke beoordeling die die naam waardig is, met de tijd en aandacht erbij. Bij de rest mag je accepteren dat er af en toe toch wel iets doorheen glipt. Hoeveel en snel te herstellen is, dat onderscheid maken, dat is eigenlijk werk waar we mee bezig moeten zijn. Het is het enige wat overeind blijft wanneer aantallen uiteindelijk toenemen. Vier dingen maken verschil. Dit is wat je kunt doen. Het eerste is namelijk een soort van brandoefening. Zet daar bewust fouten tussen, voer regelmatig een voorstel in dat aantoonbaar niet deugt, en houdt bij of het wordt tegengehouden. Een brandoefening is geen wantrouwen richting je collega's, het is de enige manier om te weten of de vluchtroute werkt. Zonder zo'n oefening meet je de kwaliteit van het systeem. En nooit die van het toezicht. Tweede is tempo. Wie tachtig voorstellen per uur moet beoordelen, beoordeelt niet, die klikt. Meer controlepunten toevoegen maakt dat erger: meer stapels, minder aandacht per stuk. Beter is minder controle op beter gekozen plekken, met de tijd erbij die dat werk dan ook vraagt. Dus reken eens uit hoeveel tijd er per voorstel overblijft. Het aantal voorstellen per dag, afgezet tegen de uren die iemand daarvoor krijgt. Wanneer dat minder dan een minuut uitkomt, bij werk dat lezen en wegen vraagt, dan weet je genoeg. Het derde gaat over durven. In de meeste organisaties kost afkeuren iets. Je vertraagt het proces, je legt uit waarom, je krijgt de vraag of het niet wat sneller kan. Meegaan kost niets. Want bij een fout was het het systeem. En zolang die verhouding zo ligt, is meegaan voor je medewerker gewoon een verstandige keuze. Reken mensen dus af op gevonden fouten en niet op doorlooptijd. Wie nooit iets afkeurt, hoort een lastig gesprek te krijgen en niet wie er wel iets uithaalt. Het vierde zit in het ontwerp zelf. Dat is echt wel heel cool, want het AI Lab van de gemeente Amsterdam bouwde daar prototypen voor, waaronder een expres slecht voorbeeld dat ze de doorklikmachine noemen. Je speelt dan een ambtenaar die bezwaren tegen parkeerboetes behandelt en een teller houdt bij of je je targets haalt. De knop voor akkoord is groter dan die van afwijzen. En wie afwijkt van het AI-voorstel moet dan uitgebreid motiveren. Alles in dat ontwerp duwt richting het geven van akkoord. Hun conclusie vat het eigenlijk samen. Aandacht ontwerp je. Bouw wrijving in op het moment dat telt en zet de details die er echt toe doen vooraan. Het is echt een heel mooi stuk wat ze hebben opgeleverd, of een framework moet ik zeggen, en de link staat in de shownotes. Er is nog een manier die ik in de praktijk weinig terugzie. Die pakt het probleem ook veel meer bij de kern aan. En dat is namelijk in seizoen vijf hadden wij Marijn van Aerle te gast, hij is medeoprichter en CTO van Floryn. En zij lenen geld uit aan ondernemers en beoordelen kredietaanvragen met een combinatie van modellen en menselijke beoordelaars. Het bekende deel is dat de mens het laatste woord heeft. Het onbekende deel is wat ze daaronder hebben gebouwd. Echt heel gaaf. Namelijk stel, een beoordelaar wijst een aanvraag af. Het model merkt op dat gelijksoortige dossiers meestal wel worden goedgekeurd. Het systeem maakt dan een taak aan voor een tweede beoordelaar en die zegt let op, deze aanvraag gaat normaal gesproken door en nu niet. Wat speelt hier eigenlijk? En dat kan natuurlijk ook de andere kant op zijn. Twee dingen vind ik daar echt heel sterk aan. Het eerste is het moment, dus die toets staat net na het besluit, maar voor het bericht aan de klant. Er is dus nog ruimte om iets te veranderen. En het tweede is de richting van het leren. Marijn was daar namelijk duidelijk over, vaak ligt het aan het model en niet aan de mens. Elke onenigheid tussen die twee komt in een lijst en de beoordelaars en het machine learning team lopen die periodiek samen na. De machine corrigeert de mens niet, de machine stelt een vraag. En het antwoord verbetert één van beide, of de mens of de machine. Eerlijk gezegd, gaf Marijn toe dat het model intern niet populair is. Niemand wordt graag overruled en al helemaal niet door een computer. Maar dat is wel precies de reden waarom het werkt. Dit is toezicht dat je niet kunt wegklikken. En het komt met een concrete vraag in plaats van met een enorme stapel waar je doorheen moet. Human-in-the-loop is dus geen vinkje in een document. Het is een ontwerpkeuze met een prijs, tijd, aandacht en de ruimte om nee te zeggen zonder dat het je iets kost. Wie die prijs niet betaalt, heeft geen controle georganiseerd, maar een handtekening. Zoek daarom deze week naar dat ene cijfer. Van je laatste honderd AI-voorstellen, hoeveel zijn er afgekeurd? Wanneer dat cijfer er niet is, heb je eigenlijk je antwoord al. Wil je op de hoogte blijven van de nieuwste ontwikkelingen binnen AI? Druk op de volgknop in je podcastapp. Dan mis je geen enkele aflevering en bedenk. AI is niet de oplossing voor elk probleem, maar onmisbaar waar het past. Tot de volgende keer.