Rick Stoop, data expert bij NS, meet het energieverbruik van treinen met GPS-data, energiemeters en dienstregelingen van dertig verschillende teams. Eén verkeerde aanname en de hele score klopt niet meer, dus zijn team ontdekte pas na onderzoek waarom bepaalde trajecten structureel geen score kregen. De oorzaak: tunnels verstoorden de GPS-meting stelselmatig, zonder dat iemand dat wist.
Rick laat zien hoe NS met een genormaliseerde score van 0 tot 100 machinisten begrijpelijke feedback geeft, en waarom bewust geen AI-conclusies worden getrokken over rijgedrag. Morgen kun je bij twijfelachtige databronnen zoeken naar patronen in de uitval, zodat je structurele meetfouten ontdekt voordat ze je rapportages maanden lang onbetrouwbaar maken.
Rick Stoop verscheen als gast in 1 aflevering van AIToday Live.
Bekijk gastprofielWelkom bij nieuwe aflevering van AIToday Live. Vandaag spreken we Rick Stoop, data expert bij NS. Hij vertelt hoe zijn team energiezuinig rijden bij de trein meetbaar maakt met data. En wat er allemaal bij komt kijken. We hebben het gesprek in twee delen geknipt, zodat je morgen na deel twee kunt luisteren. Dit is het eerste deel. Deze week is het bij ons namelijk Data Expo week. De hele week hoor je sprekers van het evenement. Dataexpo zelf vindt plaats op 9 en 10 september in de Jaarbeurs in Utrecht. Je ticket is gratis. Hier is het gesprek met Rick. Joop Snijder, Head of AI bij Info Support. Niels, die eerste vandaag even niet. Maar gelukkig hebben we een ontzettend leuke gast, Rick Stoop. Rick, voordat jij jezelf gaat voorstellen, wil ik eigenlijk eerst even benoemen dat je gaat spreken op de Dataexpo. En we nemen dit ook op in het kader van de Dataexpo week. Zou je jezelf eerst even willen voorstellen aan de luisteraars? Ja, zeker. Ja, ik ben Rick Stoop. Ik ben data expert bij NS bij team duurzaam ondernemen en energie. Kijk, dat is meteen best wel een mooie mond vol. Wat doet het team? Wij houden ons bezig met verschillende dataproducten en informatieproducten voor NS op gebied van duurzaamheid. En onder andere gaat het over tractie-energie en over vermeden CO2. Ik denk niet dat alle luisteraars weten wat tractie-energie is. Daar kan ik me voorstellen. Toen ik bij het team kwam, duurde het ook even voor ik door had wat dat nou precies is. Het gaat om het tractie, zeg maar het tractie geven van de trein, dus het optrekken van de trein en het op constante snelheid houden van het rijden van de trein eigenlijk. Het is het gewoon het geven van gas. En waarom is dat zo belangrijk? Het kost heel veel stroom. En daarom is het heel belangrijk om daar wat meer over te weten, zeg maar. En dan neem ik aan bij de duurzaamheid dat jullie gaan kijken: hoe zou je met minder stroom hetzelfde kunnen doen? Ja, wat belangrijk is, is dat de treinen natuurlijk op tijd rijden. En dat de reizigers gewoon goed van A naar B komen. Alleen het verbruik van de trein is ongeveer 1% van stroomverbruik van Nederland. Dus dat is best een hoop. Daar valt dus ook heel veel in te winnen als je wat meer weet van aan welke knoppen kan je draaien, om dat iets terug te brengen, zeg maar. En alle kleine beetjes helpen. Dus daar doen wij ons best voor om daar met behulp van data om dat zeg maar zo mooi mogelijk te maken. En hoe gaat data je behelpen dan? Ten eerste, maar het hoofddoel van ons op dit moment is dat we echt inzicht geven. Inzicht geven bij teammanagers en later ook bij machinisten zelf, dat ze ook weten van oké, als ik zo rijdt, dan heeft dat dit tot gevolg een goede score. Of iets minder goede score. Dus het begint eerst met die inzicht te krijgen van hoe doe ik het eigenlijk en daarna kunnen we na knoppen gaan zoeken waar we aan kunnen draaien. Dan kunnen we ook kijken van hoe gaan we dat dan verbeteren. En die data, want je gaat daarover spreken. Dus ik neem aan dat daar een complexiteit in zit. Die misschien niet voor de hand liggend is. Nee, het is best wel lastig. Sommigen hebben best wel veel verschillende materieelsoorten die op het spoor van NS rijden, waar we mee rijden. En sommigen hebben al energiemeters van zichzelf. En die data kunnen we dan ook gebruiken van de energiemeters, maar sommige treinen hebben dat nog niet. En de grote puzzel die wij proberen te leggen is: hoe gaan we naar een uitgevoerde dienstregeling data, zeg maar. Dus trein van station Utrecht, ik zat in Venlo te klompen vandaag. Dat begint eerst met een plandatum en daarna ga je naar een uitvoeren datumtijd, zeg maar. Hoe zorg je ervoor dat je van die gegevens kan koppelen aan de energiegegevens. En dan op de juiste vormen van gebruikte energie te komen. Best wel lastig, zeker als je geen meters hebt. Daarvoor gebruiken we dan bijvoorbeeld GPS-data om het basis van GPS de natuurkunde toe te passen en dan met snelheid en versnelling dan te kijken van oké, wat is dan op die manier die verbruikte energie. En dat is een hele puzzel met allerlei businesslogica en allerlei regels die je dan toe moet passen en best wel pittig proces om doorheen te komen. Maar dat is wel gelukt uiteindelijk. Daar kom ik over vertellen. Ja, en wat krijg je dan de teammanager of de machinist dan te zien? Wij berekenen op basis van wat er is verleden, berekenen we op historische gegevens een score door. Dus dat je op basis van de referentie eigenlijk kan kijken van hoe heb ik het gedaan ten opzichte van een soort van nulmeting. En die nulmeting of dat eindpunt, dat gebruiken we dan om ook de performance te volgen over de tijd. En ze krijgen een genormaliseerde score. Dus niet zoveel kilowatturen heb je gebruikt of het is wel iets wat wat makkelijker klikt, als het ware. En het zijn ook vaak gemiddeld dus, want dat praat nog weer makkelijker dan echt als je heel specifieke stukjes gaat maken. Dan krijg je een score van 0 tot 100, of dat je bij de beste zoveel hoort. Nu moet ik daar moet ik daarover denken. Dat is wel grappig dat je dit vraagt, want wij zaten zelf ook met de mensen die dit moeten gaan vertalen, ook te kijken wat praat nou makkelijk. Wat we hebben gemerkt is dat een score boven de 100, dat is niet goed. Je moet naar de 100 toe. Maar ze willen het liever van een hoge score naar de 100, dus boven de 100 is minder goed. Steeds meer dan 100, dat is dan goed, zeg maar. En welke logica staat erachter? Ja, dat zijn de gesprekken die je voert met de mensen die het gaan gebruiken, wat we eerst dachten was, als je bijvoorbeeld beter scoort. Hoe die score precies werkt is, we nemen dus de referentie van vorig jaar bijvoorbeeld. Da zetten we alles op een rij van op dit traject zoveel verbruikt. En dan pakken we niet de beste score, maar dan pakken we tiende percentiel. En van de tiende percentiel rekenen we dan de referentiewaarde. En van dat tiende percentiel krijg je dan als het ware, je kan beter scoren dan tiende percentiel of slechter. Je kan ook dus lager scoren. Maar wat we hebben gemerkt is dat als je dus beter scoort, dan val je dus in die score van 0 tot 100 val je buiten de range. Want dan score je opeens 105 bijvoorbeeld. Of in ons geval dan 95. En dat praat heel lastig. Dus wat we hebben gezegd, we ronden alles af naar die 100. Als je beter bent ben je 100. Als je erop zit, ben je ook 100. Maar daar houden we, dat maakt niet uit. 100 is gewoon goed. Maar als je te hoog zit, dus 120 bijvoorbeeld. Dan heb je gebruikt, heb je te veel verbruikt. En dan gaan we naar beneden toe. Dan is het de kunst om dichter bij die 100 te komen. Oké. Zijn al eerste resultaten of niet? Ja, dat is de resultaten lastig, zeg maar te bespreken. Het is niet dat je meteen zeggen van we hebben dit product klaargezet. We zien meteen effect, zeg maar. Wat we wel merken, is dat het onderwerp echt leeft binnen doorgezet. Het leeft sowieso al een tijdje, zeg maar. En nu heb je echt iets om mee te zitten en mee te praten. En wij krijgen daar ook op die manier feedback over. Het helpt helemaal als het bijvoorbeeld op deze manier weer gegeven worden. Iets meer detail kunnen krijgen. Dat zijn allemaal stappen die je dan vervolgens gaat zetten. Maar het helpt in ieder geval dat gesprek op gang te brengen. En dat is natuurlijk al heel waardevol, dat je met elkaar over praat van let erop, dat je wel zuinig rijdt, dat is het hele doel. En er zit veel meer programma loopt al best wel lang, maar er zijn mensen die weten er veel meer van dan ik. Ik zit echt meer in die datahoek, maar je merkt wel dat het dan gaat leven. Dat is wel leuk. Dat kan ik me wat bij voorstellen. En net wat je zegt, weet je, het gaat over iets heel belangrijks. We hebben heel veel netcongestie, dus als daar iets aan gedaan kan worden, alle beetjes helpen. Zeker. Kijk, we hadden heel kort al even een voorgesprek gehad. Toen gaf je aan van ja, maar we zijn nu vooral nog in de voorbereidende fase. We zit hier in AIToday Live. We zijn nog niet bij de AI-modellen. Wat doen jullie aan voorbereiding op om straks met AI machine learning aan de slag te kunnen gaan? Wat we nu hebben op dit moment is dat we op het punt staan dat we een goede dataset hebben, die de input kan zijn voor de AI of voor een machine learning model. En daar hebben er nu voor gezorgd dat dat mogelijk is, het doel van waar we eigenlijk naartoe willen, is de machinisten hebben een soort tomtom in de trein, dat noemen we TIM TIM. En dat is vroeger ooit eens een keer per dag door een wetenschapper of onderzoek dat geweest is bij NS. En wat we nu willen proberen is om met de dataset die wij hebben, plus allerlei extra parameters, weersvariabelen, noem maar op, weerstand van het spoor. Ga zo maar door dat we dat wat ze in de cockpit krijgen als rijadvies, als het ware, dat we dat kunnen verbeteren. En als ze dan makkelijker dat kunnen volgen of beter dat kunnen volgen, dan gaan we ervan uit dat energie ook af zal nemen. Dus dat is het uiteindelijk het doel. En die verbetering, zeg maar. Dat model trainen om die TIM TIM te gaan verbeteren, dat is de stap die we eigenlijk zouden moeten gaan zetten. Dat je eigenlijk live kan zien van verbruik ik te veel of twijfel of dat echt live zal gaan zijn. Ik weet ook niet hoe die stroom, zeg maar, of hoe dat precies in de cockpit terecht gaat komen. Maar dat we in ieder geval voor vertrek al een patroon kunnen neerzetten. Als je dit volgen, dan zou dat betekenen dat je dan zo efficiënt als dat kan gereden zou hebben. Dus eigenlijk een rijstrategie is het eigenlijk van je moet gas geven tot dit punt, dan moet je coasten of je snelheid vasthouden en dan vanaf hier laat je je gas los. En het gas los laten, is gewoon uitrollen op lage weerstand over het spoor. Totdat je dicht bij eindpunt bent dan remmen. Ja, precies. Wat zijn jullie dan aan het doen aan die datapreparatie? Wat moet er dan gebeuren? Waarom is dat nu nog niet klaar? Nou, dat is dus best wel complex. Wat ik vertelde, we zitten heel erg met de GPS bijvoorbeeld. Ik weet niet of je zelf daar ervaring mee hebt, maar ik kom ook uit de voetballen rijden, dan hebben we heel veel met GPS-data gedaan. GPS is super gevoelig. Zo wil het zijn. Supergevoelig op wat? Ja, op meetfout, op verstoringen van buiten op het weer. Overkappingen bij stations, tunnels waar het doorheen rijdt. Dus je hebt heel erg te maken met hoe ga je daar dan mee om, terwijl je wel die GPS-gegevens wilt gebruiken. Dat is echt om dat goed te kunnen begrijpen en goed uit te werken, zeg maar. Daar zijn we nu best wel ver in. En ook om de kwaliteit goed te monitoren. Daar zijn we wel dat we denken van oké, we voelen ons comfortabel om in ieder geval met de gaten die we nu weten wat er niet kan. Weten we ook wat we wel kunnen. En dan kunnen we nu de volgende stap gaan. Ja, precies. En die gaten die dicht je dan? Of wat doe je daarmee? Ja, dat weten we nog niet. Dat hangt ook een beetje af. Maar onze samenwerking met Kickstart AI voor dit project straks ook een beetje mee gaat komen, denk ik. We kunnen wel op dit moment, wat we doen, is bijvoorbeeld als we weten dat er een tunnel is op het traject, dan kunnen we dat markeren. Dus dan zeggen van oké, dit traject heeft een tunnel gehad, dus kun je waarschijnlijk niet meenemen voor de analyse of voor de scores die we willen laten zien, dus het is meer nog het identificeren van je dataset, goede metadata meegeven. Dat is eigenlijk wat we dan vooral nu doen. En die metadata kan je daar ook iets over vertellen. Ja, wat wil je weten over de metadata? Nou, welke voorbereiding je daarvoor doet. Ja, dat is vooral echt de kennis van het spoor weten, zeg maar. Dus een machinist die kan alleen invloed uitoefenen op zijn energieconsumptie, als hij ook kan voldoen aan bijvoorbeeld op tijd vertrekken van het spoor. Of als er onderweg niks geks gebeurt. Als ze bijvoorbeeld een het over het spoor gaat, dan moet je in de ankers. Dan verpest het meteen je hele score. Daarna moet je weer optrekken. Dus met dat soort gegevens proberen we dus de dataset te verrijken om aan te geven van oké, je bent je van A tot B volledig kunnen rijden en je hebt alles zelf in de hand gehad onder de voorwaarden die wij stellen. Of volgens de businesslogica als het ware. En dan ben je geldig genoeg om meegenomen te worden in onze validatie. Dus dus eigenlijk dat soort anomalies, die haal je er dan uit. Ja, precies ja. En dan zijn er zeker nog vast nog wel een paar die we nog niet hebben kunnen identificeren. Of dat we bijvoorbeeld last hebben van een synchronisatieprobleem van de meetbox op de trein zelf voor die de GPS opslaat. Dat soort zijn kleine dingen die we weten die er zijn, maar die we nog niet super goed kunnen identificeren. Dus daar zijn we dan weer. En wie identificeert nu dat van dat hert is wel een heel mooi beeldend voorbeeld. Wie zegt van dat is gebeurd? Probeer jullie proberen jullie dat uit de data te halen, of wordt dat gemarkeerd door de machinist. Laat ik het zo zeggen, weet je, als ik als ik met Flitsmeister rij. Dan krijg ik ook signalen van dier op de weg of file komt er aan. Er staat iemand langs de kant van de weg. En dat wordt gedaan door de mensen die er langskomen. Ik weet niet alle ins en outs, maar wij knopen best wel veel. Kijk, als om het beeld te schetsen, met bij NS werken we met ongeveer 30 datateams. En elk datateam is weer verantwoordelijk voor zijn eigen stukje van de keten, zeg maar. En wij zitten nu een beetje met ons team aan het einde van de keten en we maken ook gebruik van drie of vier teams van hun data, zeg maar. En van die data nemen wij ook bijvoorbeeld dit soort stukjes informatie af. Dus hoe dat precies gaat, kan ik je niet vertellen, maar wij knopen ook zeg maar die set aan elkaar met de kennis die we van hen krijgen. Dus ja, het is ook heel erg veel samenwerken en ook wij verwachten dat zij dat weten. Als zij zeggen, ja, je moet het hier op letten, en deze zijn deze parameters, die kan je gebruiken en die niet, dan gaan we daarmee aan de gang. En dat is dus best wel die dataset is best wel complex in die zin, omdat je ook veel verschillende elementen hebt echt samen moet werken met de rest. Kan je misschien die complexiteit toch nog wat meer duiden, van waar zit dan de complexiteit. Het zijn veel regels. En ook regels die soms wel of soms niet samenkomen tot een valide rit. We zeggen bijvoorbeeld, je moet op tijd kunnen vertrekken. Je mag niks geks gebeuren onderweg. Het moet een beetje volgens de dienstregeling zijn. En we verwachten dat de GPS goede nauwkeurigheid heeft. Daar proberen we dat dan aan elkaar te knopen. Maar het kan ook zijn dat bijvoorbeeld als we de data binnenkrijgen van de uitvoering, van wat de trein daadwerkelijk heeft gereden, dat het niet meteen in één keer goed is. We zijn dan afhankelijk van degene die ons dat levert. En dat zorgt ervoor dat als wij dan al een score hebben berekend, dat we weer terug moeten naar de tekentafel van we moeten weer hebben rekenen. Dus het hele proces van hoe zorg je ervoor dat je wel iets zinnigs zegt, zeg maar, wat ook valide is. En op je tenen blijven lopen om ervoor te zorgen dat je telkens weer kan anticiperen op dat er de data verbetert, dat maakt het complex als het ware. Omdat je ook al die verschillende bronnen aan elkaar gaat knopen. Als één ding gaat verbeteren of afwijken of gaat veranderen, dan gaat de rest mee. Of ja, die moet mee, want anders zeggen wij iets verkeerds. En dat wil je natuurlijk niet, zonder de juiste dingen blijven zeggen. Gebruiken jullie bij de data-analyse zelf AI. Ik vind definieer AI, kijk, als je het hebt over we gebruiken business rules en rekenregels. En als we dat AI vinden, dan gebruiken we dat. Als je statistiek gebruikt, vind ik ook inderdaad, dan gebruiken we dat ook. Maar op dit moment voor echt het feedback geven aan de teammanagers, dat is echt, dat laten we aan hun, we rapporteren het. We geven geen conclusies of zeggen niks voor, zeg maar, ze mogen zelf het mee aan de gang. Dus in die zin voor die analyse doen we niks, maar voor de analyse van de kwaliteit van de data gebruiken we wel verschillende rekenregels om te kijken van is het valide of is het niet veel. Heb je in de dataanalyse iets gevonden wat heel opmerkelijk was, wat de andere teams niet wisten bijvoorbeeld. Wij nemen de dataset af van het team, wat ontsluit op ons dataplatform. Die gebruiken het vooral voor stilstanden. Die wil weten waar een trein staat op het moment dat die stilstaat, zeg maar. Vooral voor het rangeren van de trein op opstelterreinen. En wij willen het weten voor rijden. Dus je hebt een hele andere wens van dezelfde dataset. Dus kom je ook niet, wij komen achter dingen die zij niet naar kijken. Ja, omdat ze niet nodig hebben. Precies, dus wij kwamen dus opeens van die tunnels kan wij achter van ja, maar wacht eens even, als een trein door een tunnel gaat, hebben we het zijn altijd dezelfde trajecten, die bij ons geen score opleveren. En dan kom je er dus achter van ja, oh ja, wacht even, daar gaan we door een tunnel heen. En dan proberen we, we hebben de meetfrequentie van de GPS is zes keer per minuut, dus één keer per tien seconden. Dus wij zeggen, oké, als je een gap hebt van 20 seconden, dan kunnen we dat nog wel herstellen. Dan kunnen we nog wel redelijk meer omgaan, maar als het groter is, dan vinden we het eigenlijk te onnauwkeurig worden en kunnen we niet zoveel over zeggen. Maar altijd zat er op dezelfde stukje traject, konden we het niet meten. Altijd dezelfde fout. We hebben niet de valide GPS-meting. En dan ga je kijken van oké, maar wat is dat traject nou precies? En dat bleek dus een tunneltrain te zijn. Ik dacht, oh, daar moeten we dus wat mee. Weet je wel, met die tunnels, dat heeft dus invloed op onze scores. Dus nu weten we van oké, daar gaan we wat mee doen. Dus in die zin, en opstelterrein is vaak niet overdekt. Dus of nou weet ik eigenlijk niet trouwens. Maar staan buiten. Als een trein buiten stilstaat, ja, dan heb je nog steeds GPS. Dus daar heb je geen. Dan merk je dat niet. En daar kom je dan dus achter op. Oh ja, wat grappig. Maar weet je dat, zijn er veel stations. Ik bedoel, Schiphol heb je bijvoorbeeld, dat je best wel lang onder een onder een tunnel rijdt. Dus dan wordt het dan straks moeilijk om dat er data op te halen. Ja, dat is best lastig. En gaan jullie daar iets mee doen of zeg je van, nou ja, weet je, voor nu zijn dat gewoon de uitzonderingen, laten we zo richten ons eerst maar eens op waar het allemaal buiten is. Het liefst zeg maar wil je dat straks die treinen allemaal energiemeters hebben. Want dan ben je niet meer afhankelijk van die GPS. En dan zou je op basis van die energiemeters, dan kan je altijd de data zo knippen dat je energie krijgt verbruikt energie. Dus dat zou het ideale scenario zijn. En voor nu is het inderdaad werken met wat je hebt en proberen gewoon transparant te zijn naar de mensen die het gaan gebruiken. Dit is waarom jij met jouw team of als machinist niet de scoren te scoren krijgt. En ja, die boodschap, zeg maar, dat is wel dan denk ik heel belangrijk dat je dat goed doet. Want je wilt dat mensen het gaan gebruiken. En als je afbreukrisico hebt, ja, dat is wel vervelend. Ja, zeker. Zijn jullie alles meegeweest op een rit om te kijken van wat de mensen ervan zouden vinden. Ik heb iemand in mijn team. Die is echt niet zeggen gekker van, maar die is super enthousiast over dit onderwerp. En die zit er helemaal in. Dus die kan je uren over praten. En die gaat ook, die stuurde me gisteren nog een bericht van ja, ik was in Amsterdam bij een teammanager. En uitleg geven over dit rapport. En hij zegt, ja, ik wil dan op de terugweg naar Utrecht wil ik eigenlijk dan op een trein stappen en dan mag ik meerijden met een meerijpas. En dan kan ik ook kijken wat zeg maar de scores zijn. Die gaat er echt letterlijk meekijken in de cockpit. In de cockpit kan je ook zien wat je energieconsumptie is of je verbruikt. En dan gaat hij gewoon erover praten en meekijken en meedoen. En dat vind ik wel heel gaaf. Ik doe dat zelf nog niet, zeg maar. Het is wel heel aanstekelijk, als je het hebt over iemand die ergens op zit, zeg maar, hij zit er echt op. Hij zit zo fanatiek erop. Dat is echt mooi. Het is echt gaaf. Wat ik hoor is dat de praktijk en de theorie bij jullie heel dicht bij elkaar komt. Ja, zeker. Ja, en dan af en toe horen wij ook dingen dat we denken van ja, we snappen dat het in de praktijk gebeurt, maar het is heel lastig om dat dan met de data te koppelen, zeg maar. Hoe gaan we name om ervoor zorgen dat we dat bij maar goed bij elkaar gaan brengen. Dat is wel lastig dat soms. Maar we zorgen wel echt ervoor, en dat vind ik ook wel sterk van ons bedrijf, zeg maar, dat als je een vraag hebt over kan ik ergens meekijken, of wij doen ook iets met circulariteit van producten. Dan kan je gewoon een berichtje sturen naar iemand die daarover gaat. De kans dat je een keertje mag kijken, is eigenlijk bijna 100%. Oh, wat goed. Dus heel erg, we zijn heel erg betrokken bij elkaar. En dat maakt het wel echt sterk, want dan kan je ook goede producten leveren. Ik moet je even inbreken in het gesprek dat je nu volgt, niet omdat er iets mis is, maar omdat we het opgeknipt hebben. Deze week is het bij ons namelijk Data Expo Week. Je luistert de hele week naar sprekers van het evenement, van maandag tot en met vrijdag een aflevering. Data Expo zelf vindt plaats op 9 en 10 september in de Jaarbeurs in Utrecht. Je ticket is gratis. De link om het te bestellen vind je in de shownotes. Je luisterde vandaag naar het eerste deel van het gesprek met Rick Stoop van de Nederlandse Spoorwegen. Morgen gaan we verder met het tweede deel. Tot dan.