OpenAI lanceert twee nieuwe modellen: wat moet je weten?

OpenAI bracht twee nieuwe modellen uit: GPT-5.3 Instant en GPT-5.4. GPT-5.4 presteert beter dan menselijke experts bij 83% van de professionele taken. Niet door slimmer te worden, maar door taken daadwerkelijk uit te voeren. Wat dat betekent, en wat je er met een korrel zout bij moet nemen.

Gert-Jan Lasterie· 5 maart 2026· 4 min· nieuwsflits
Foto: Screenshot OpenAI

Deze week deed OpenAI iets wat ze vaker doen: stilletjes twee nieuwe versies uitrollen die op het eerste gezicht op modelversienummers lijken, maar in de praktijk behoorlijk wat veranderen.

GPT-5.3 Instant: eindelijk een AI die niet meer zo irritant doet

Op 3 maart rolde OpenAI GPT-5.3 Instant uit als het nieuwe standaardmodel in ChatGPT. Niet een revolutie in rekenkracht, maar een gerichte verbetering op iets wat veel gebruikers al tijden irriteerde: de toon en het gedrag van het model in gewone gesprekken.

Wie regelmatig met ChatGPT werkt, herkent het. Je stelt een vraag en krijgt eerst twee alinea's uitleg over wat het model niet gaat doen, gevolgd door een antwoord vol voorbehouden. GPT-5.3 Instant geeft antwoord. Direct. Zonder preamble. Het model is ook feitelijk betrouwbaarder: in tests zijn feitelijke fouten met 26,8% afgenomen bij gebruik van webzoekopdrachten, en met bijna 20% zonder. Voor ondernemers die AI inzetten voor klantcommunicatie, offertes of adviesteksten is dat een concreet verschil.

De update is beschikbaar voor alle ChatGPT-gebruikers, gratis en betaald.

GPT-5.4: niet slimmer, maar capabeler

Op 5 maart volgde GPT-5.4, en dit model vraagt meer aandacht. Niet omdat de redeneervaardigheden spectaculair zijn verbeterd, die stegen slechts incrementeel ten opzichte van GPT-5.2. Wat wél substantieel veranderde is iets anders: het vermogen om professionele taken daadwerkelijk af te ronden.

OpenAI meet dit met een eigen benchmark genaamd GPTval, die kijkt naar economisch waardevolle werkzaamheden verdeeld over 44 beroepen. GPT-5.1 scoorde 38,8% op die test. GPT-5.4 scoort 83%. Drie generaties hebben het aantal verdubbeld. Het stijgingspunt zat niet in redeneren of coderen, maar in professionele taakuitvoering: formulieren invullen, software bedienen, meerstappige workflows zelfstandig doorlopen. Dat segment steeg met 12 procentpunten.

Daar hoort een concrete lijst bij van wat het model nu kan:

  • Computer gebruik: GPT-5.4 kan via de API zelfstandig door software klikken, velden invullen en werkstromen uitvoeren. Geen simulatie, maar daadwerkelijke bediening van digitale omgevingen.

  • Excel en Google Sheets: ChatGPT is direct ingebouwd in beide platforms. Je formules laten schrijven, data laten analyseren of dashboards laten bouwen werkt nu vanuit de spreadsheet zelf.

  • 1 miljoen tokens context: het model verwerkt aanzienlijk langere documenten in één keer. Dikke contracten, uitgebreide dossiers, lange e-mailthreads: zonder dat je de tekst in stukken hoeft te knippen.

  • Betrouwbaarder output: individuele claims zijn 33% minder vaak fout en volledige antwoorden bevatten 18% minder fouten dan GPT-5.2. De hallucinatiewinst is reëel.

Voor bedrijven die het model via de API integreren is er nog één relevant technisch gegeven: OpenAI introduceerde Tool Search, een nieuw systeem voor het aanroepen van externe tools. Dat verlaagde het tokenverbruik met 47% over 250 taken. Minder tokens betekent lagere kosten bij schaalgebruik.

De eigenlijke verschuiving: van chatbot naar goedkopere medewerker

De manier waarop OpenAI GPT-5.4 positioneert is opvallend. De concurrent is niet langer een ander AI-lab, maar een uitzendbureau. Een model dat 83% van de professionele taken in 44 beroepen evenaart of overtreft, en dat kan klikken, formulieren invullen en workflows afhandelen, is niet meer een schrijfhulp. Het is een uitvoerende kracht.

Dat heeft directe implicaties voor beslissers in het MKB. Taken die je nu uitbesteedt aan een freelancer, een bureau of een tijdelijke kracht, worden steeds vaker het domein van modellen als dit. Niet morgen, maar de richting is helder.

Wat je hier met een korrel zout bij moet nemen

De 83%-score is OpenAI's eigen maatstaf, geen onafhankelijke toets. De Mercor APEX-benchmark, een externe test van professionele taakafronding, laat zien dat zelfs de beste modellen minder dan 25% van de professionele taken bij de eerste poging correct afronden. Het verschil zit in de definitie van "correct": OpenAI's GPTval meet of het model de juiste handelingen uitvoert, APEX meet of de einduitkomst volledig klopt.

Beide maten zijn relevant. Wat het samen zegt: het model is significant capabeler dan zijn voorgangers bij het uitvoeren van werkzaamheden, maar van volledig zelfstandige afronding van complexe professionele taken zijn we nog niet.

Wat waard is om in de gaten te houden: hoe snel grote organisaties contractor-workflows vervangen door GPT-5.4. Als dat de komende kwartalen in significante aantallen gebeurt, is de arbeidsmarktthese reëel. Tot die data beschikbaar is, is het een sterke aanwijzing, geen bewezen feit.

Wekelijkse inzichten in je mail.

Dilemma's, doorbraken en blinde vlekken uit onze AI-praktijk.

Wat dit voor jouw organisatie betekent

De meeste ondernemers die wij spreken gebruiken AI nog incidenteel. Deze updates zijn niet bedoeld voor die losse toepassingen, die werkten al. Ze maken AI geschikt voor structurele inzet: klantcommunicatie die consequent de juiste toon treft, analyses die minder handmatige correctie vragen, workflows waarbij AI meerdere stappen achter elkaar afhandelt.

De vraag is niet meer of AI je werk kan raken. De vraag is welke taken in jouw organisatie als eerste in aanmerking komen om slimmer ingericht te worden, met AI als uitvoerende kracht en jij aan het stuur. Heb je daar vragen over? Neem contact op, we denken graag mee.