← Alle artikels
AI in de praktijkStrategie21 september 20265 min leestijd

Er is nu AI die niet schrijft, maar beslist

Midden september kwam er een AI-model uit dat geen enkele zin schrijft. Het heet Jev, komt van Diogo Almeida (een ex-OpenAI-man die mee aan de basis van ChatGPT lag) en het doet maar één ding: beslissen. Je geeft het context en een vraag met antwoordmogelijkheden en je krijgt een keuze terug. Geen alinea, geen uitleg, geen tekst die je daarna nog helemaal moet lezen.

Benjamin BosmansDoor Benjamin Bosmans

Dat klinkt als minder en ja, op papier is het dat ook. Maar het maakt een paar dingen mogelijk die met een gewoon taalmodel (de LLM's zoals we ze kennen) niet lukken. Een antwoord komt er in 70 tot 500 milliseconden in plaats van in seconden, het kost een fractie van wat een gesprek met een 'klassieke' LLM kost en je kan tien vragen tegelijk stellen over dezelfde context in plaats van ze in een rij te zetten.

So, what's the big deal?

Het echte verschil: het zegt hoe ZEKER het is

Bij elk antwoord zit een cijfer tussen nul en een. Hoe zeker het model is van die keuze. En dat cijfer is gekalibreerd, wat wil zeggen: van alle antwoorden waar 0,8 op staat, klopt er ongeveer 80 procent. Het is een eigenschap over groepen, geen garantie per geval, maar het is genoeg om er beleid op te bouwen.

Vergelijk dat met wat je vandaag hebt. Vraag een AI of een binnenkomende mail voor de boekhouding of voor de techniekers is, en je krijgt een vlot antwoord in een 'zelfverzekerde' manier. Altijd. Ook als het eigenlijk een gokje was. En hoe zou je dat verschil moeten zien? Niet. Je ziet het niet, '91 procent zeker' klinkt precies hetzelfde als '52 procent zeker' en daarom moet je vaak terugduwen op antwoorden of het in twijfel trekken. Kritisch zijn en zelf die kansberekening maken.

Dat is niet toevallig, LLM's zijn getraind op wat mensen graag lezen en mensen lezen graag een antwoord dat zeker klinkt. Dus krijg je soms de zogenaamde vleierij en zelfverzekerde onzin in dezelfde verpakking als het juiste antwoord. Dat is dus allemaal oké als er een mens meeleest en bijstuurt of terugduwt. Het is een probleem zodra je AI iets zelfstandig wil laten doen. Bij Kompas heb ik dus mijn agents zo opgebouwd dat er tweede en derde agents die gewenste kwaliteitscontrole doen maar ook daar krijg je dat 'gewenste gedrag'.

Waarom dat voor jouw werking uitmaakt

De meeste bedrijven die met AI beginnen, lopen vroeg of laat tegen dezelfde muur. Het werkt goed genoeg om indruk te maken en niet goed genoeg om echt los te laten. Dus blijft er altijd iemand nakijken, en de tijdwinst die je zocht verdampt in al dat nakijken, kritisch zijn, in vraag stellen, ... .

Met een zekerheidscijfer kan je eigenlijk die muur omzeilen. Je legt zelf een grens per taak, afhankelijk van wat een fout kost. Zit het model boven die grens, dan gebeurt het automatisch. Zit het eronder, dan komt het in een lijstje voor een mens. Een mail verkeerd doorsturen is ambetant. Een factuur aan de verkeerde klant koppelen kost echt geld en gezichtsverlies. Dus: daar zet je de grens hoger.

Het verschil is dat je niet langer moet kiezen tussen alles automatiseren of niets. Je automatiseert het deel waar het model zeker van is, en dat is in de praktijk meestal het grootste deel. De twijfelgevallen komen bij jou terecht, en net die zijn het bekijken waard.

Maar zoals altijd: kritisch blijven

Hun eigen documentatie is opvallend eerlijk over wat het niet kan en dat is een goed teken. Het kan niet rekenen en niet tellen. Het vergelijkt datums niet betrouwbaar want het leest ze als tekst. Het leest je vraag letterlijk, dus een ontkenning of een impliciete voorwaarde gaat mis. En het wordt minder accuraat naarmate je meer ruis meestuurt, dus je moet eerst zelf filteren wat je voorlegt. Dat redeneren is dus totaal anders.

De belangrijkste waarschuwing is subtieler. Het model kan nooit een antwoord teruggeven dat buiten jouw lijstje valt, en dat voelt als veiligheid. Maar: het kan wel met overtuiging het verkeerde antwoord uit dat lijstje kiezen. Een antwoord dat proper in je systeem past betaalt de verkeerde leverancier dus ook even vlot terug.

En eentje die hier dichtbij komt: Engels is de voornaamste taal waarop het getraind is. Nederlands wordt afgehandeld, maar niet even goed. Wie het op mails of documenten wil loslaten, test dat dus eerst en zet die grens strenger dan hij in het Engels zou staan.

En ikzelf?

Het praatgedeelte van AI is grotendeels opgelost, en het is duur. Het beslisgedeelte was tot nu toe een taalmodel dat je overtuigde om ja te zeggen. Dat wordt nu een aparte bouwsteen die goedkoop is en waarvan je kan meten hoe goed ze werkt.

Dat is niet spectaculair om te demonstreren, en net daarom denk ik dat het blijft. De vraag verschuift van "kan AI dit" naar "vanaf welke zekerheid laat ik AI dit alleen doen". Dat is een veel betere vraag, want die kan je beantwoorden met cijfers in plaats van met een gevoel.

Ik ga er de komende weken mee werken. Als er iets uitkomt dat de moeite is, lees je het hier. Trying to stay up to speed!

↦ Eerstvolgende stap

Benieuwd waar AI bij jou het eerst tijd wint?

De gratis Quick Scan toont in een paar minuten waar de grootste tijdwinst zit. Of schrijf je in op de nieuwsbrief en blijf gewoon mee.

Past hierbijWil je zoiets in je eigen werking laten draaien? Bekijk de Walkthrough