ChatGPT-bedenker bouwt een AI die geen woorden maar beslissingen teruggeeft
Jev, van een van de makers van ChatGPT, geeft software een beslissing met een zekerheidsscore. Wat betekent dat voor de beslisstappen in je AI-workflows?

Diogo Almeida hielp bij OpenAI de techniek ontwikkelen die van een taalmodel ChatGPT maakte. Met zijn nieuwe bedrijf TypeSafe AI lanceerde hij vorige week Jev, een model dat software direct een beslissing teruggeeft, met per antwoord een percentage dat zegt hoe zeker het model is. Voor bedrijven die AI in hun werkprocessen inbouwen is dat relevanter dan de zoveelste slimmere chatbot. Veel AI-stappen in een workflow zijn namelijk beslissingen: labelen, doorsturen, scoren. Jev belooft die stappen tientallen keren sneller en goedkoper te maken, met een ingebouwde maat voor wanneer een mens moet meekijken.
Waarom een van de makers van ChatGPT afstapt van tekst
Almeida werkte bij OpenAI aan reinforcement learning from human feedback (RLHF), de trainingsmethode die taalmodellen leerde instructies op te volgen. Tegen TechCrunch vertelt hij dat hij daarna teleurgesteld raakte. Modellen zijn al jaren uitstekend in menselijke taal, maar computers communiceren anders. Wie een taalmodel in software inbouwt, krijgt een lap tekst terug waar de software eigenlijk een ja, een nee of een categorie nodig heeft.
Twee jaar geleden vertrok hij om TypeSafe AI op te richten. Het resultaat is Jev, volgens TypeSafe de eerste van een nieuwe klasse System One-modellen. Die naam verwijst naar Daniel Kahneman, die snel intuïtief denken (systeem 1) onderscheidt van traag doordacht redeneren (systeem 2).
Je legt vooraf vast welke antwoorden mogelijk zijn, bijvoorbeeld "fraude", "in orde" of "handmatig controleren". Jev geeft per optie een kans terug. Omdat het model alleen uit die vooraf vastgelegde opties kan kiezen, kan het geen tekst verzinnen of een ongeldig antwoord geven. Volgens de aankondiging van TypeSafe duurt een antwoord 70 tot 500 milliseconden. Invoer kost 0,042 dollar per miljoen tokens, uitvoer is gratis. Bij gangbare taalmodellen ligt de invoerprijs tussen 0,20 en 10 dollar per miljoen tokens.
Een groot deel van de AI in workflows neemt beslissingen
Kijk naar een gemiddelde AI-workflow en je ziet vooral kleine beslissingen. Is deze mail een klacht, een vraag of een bestelling? Bij welk onderwerp hoort dit artikel? Is deze aanvraag een serieuze lead? Nu stuur je zo'n vraag naar een taalmodel, wacht je op een geschreven antwoord, haal je daar het label uit en vang je de keren op dat het model iets onverwachts terugstuurt. Elke stap kost wachttijd en extra code om fouten af te vangen.
Voor een deel van die stappen is een taalmodel sowieso te zwaar. Gewone code is dan vaak sneller en goedkoper. Jev mikt op het gebied daartussen: beslissingen die te vaag zijn voor een harde regel, maar te eenvoudig om een model een heel antwoord te laten uitschrijven.
De eerste ontwikkelaars melden forse winst. Vercel verving een model van OpenAI door Jev voor het controleren van opdrachten op veiligheid. Dat leverde resultaten op die vijf tot achttien keer sneller waren, met een hogere nauwkeurigheid. De technisch directeur van Bryo AI vergeleek Jev met Gemini voor het sorteren van zakelijke mails. Gemini was iets nauwkeuriger, maar tien tot twintig keer duurder. Hij was vooral te spreken over de zekerheidsscores.
Een zekerheidsscore bepaalt waar een mens meekijkt
Die scores zijn het interessantste deel van Jev. Een taalmodel dat je om een zekerheidspercentage vraagt, is doorgaans te zelfverzekerd. TypeSafe traint Jev zo dat een score van 95 procent ook in ongeveer 95 procent van de gevallen klopt. Armin Ronacher, technisch directeur van Earendil, legt tegen TechCrunch uit wat dat oplevert: bij 50 procent is het een muntworp die je negeert, bij 95 procent kun je er iets mee.
Daarmee wordt de plek van de mens in een geautomatiseerd proces een instelbare drempel. Boven de 95 procent handelt de workflow het zelf af. Tussen de 60 en 95 procent gaat het naar een medewerker. Daaronder volgt een tweede controle. Die grenzen kies je zelf, per proces en per risico. Een verkeerd gelabeld artikel is minder erg dan een onterecht afgewezen factuur, dus voor het artikel mag de drempel lager liggen.
TypeSafe ziet nog een toepassing: Jev als goedkope controleur op AI-agents. Agents laten meekijken door andere agents wordt snel duur. Een beslismodel dat in een fractie van een seconde beoordeelt of een agent van het pad raakt, kan dat werk wel continu doen.
Goedkopere beslissingen maken nieuw werk haalbaar
Jev is vernoemd naar William Stanley Jevons, de negentiende-eeuwse econoom die zag dat zuinigere stoommachines het kolenverbruik juist lieten stijgen. Almeida verwacht hetzelfde bij AI: als een beslissing bijna niets kost, ga je hem veel vaker nemen.
Voor een uitgever wordt het haalbaar om een volledig archief te labelen, waar je nu uit kostenoverwegingen alleen nieuwe artikelen doet. Voor een salesteam kan elke binnenkomende aanvraag direct een score krijgen. Ronacher noemt nog een toepassing: per taak voorspellen welk taalmodel nodig is, zodat je het dure model alleen inzet waar het verschil maakt.
Hoe stevig zijn de claims van TypeSafe?
De belangstelling is groot: de API van TypeSafe lag kort plat door de drukte. Jev zit nog in early access en de meeste cijfers komen van het bedrijf zelf. TypeSafe is daar opvallend open over. De eigen tests zijn gebouwd door het eigen team. De referentieantwoorden komen van GPT-6 Astra en Fable 5.1. Ook kan het bedrijf nog niet bewijzen dat de lage prijs houdbaar is.
Buitenstaanders vermoeden dat Jev is gebouwd op een bestaand taalmodel met openbare gewichten, iets waar Almeida niet op ingaat. De dienst draait vanaf de Amerikaanse westkust. Stuur je er klantmails of leadgegevens doorheen, dan speelt onder de AVG de vraag waar die persoonsgegevens terechtkomen. Ronacher verwacht snel concurrenten nu het nut duidelijk is. Dat maakt het idee belangrijker dan dit ene product.
Wekelijkse inzichten in je mail.
Dilemma's, doorbraken en blinde vlekken uit onze AI-praktijk.
Ontwerp beslisstappen als losse onderdelen
Je hoeft Jev morgen niet in te zetten om hier iets mee te doen. Loop je bestaande AI-workflows langs en markeer de stappen die eigenlijk een keuze uit een vaste lijst zijn. Maak daar aparte bouwstenen van, met vooraf vastgelegde uitkomsten en een drempel waarboven de workflow zelf doorgaat. Dan kun je per stap wisselen tussen gewone code, een taalmodel of een beslismodel zoals Jev, zonder de hele workflow om te bouwen. Zo word je ook minder afhankelijk van één model.
Welke beslissingen in jouw processen laat je nu nog door mensen nemen, omdat een taalmodel te traag of te duur leek voor dat volume? Wil je uitzoeken waar zo'n beslisstap in jouw workflows past? Plan een kennismaking in.


