Hoe leert AI om taken echt af te ronden?
AI-modellen worden niet langer alleen slim gemaakt door ze veel tekst te laten lezen. Steeds vaker leren ze door te doen: taken uitvoeren, fouten maken, verbeteren. Scale AI meldt dat meer dan de helft van hun trainingswerk inmiddels op deze manier werkt. Wat betekent dat voor de AI-tools die jij morgen gaat gebruiken?

Tot voor kort werden AI-modellen primair slim gemaakt via één methode: geef ze enorme hoeveelheden tekst, leer ze patronen herkennen, en laat ze de meest waarschijnlijke volgende zin voorspellen. Dat leverde indrukwekkende resultaten op, maar het heeft een fundamenteel plafond. Een model dat patronen herkent is geen model dat taken afrondt.
Dat plafond is nu het centrale probleem van de AI-industrie, en de verschuiving die eromheen plaatsvindt is groot. Scale AI, het databedrijf dat onder meer DeepMind, Meta en Apple helpt hun modellen te trainen, meldt dat inmiddels meer dan de helft van hun trainingswerk bestaat uit reinforcement learning. Een halfjaar geleden was dat nog geen kwart. Chetan Rane, hoofd product voor agenten en RL-omgevingen bij Scale AI: "Traditional LLM training has hit some limits. Reinforcement learning is where the real promise is."
Wat reinforcement learning anders maakt
Reinforcement learning werkt niet met patronen maar met doelen. Het model krijgt een taak, voert die uit in een gesimuleerde omgeving, en krijgt een beloning als het de taak correct afrondt. Geen beloning als het fout gaat. Zo leert het model niet wat waarschijnlijk is, maar wat werkt.
Een krachtige variant hiervan is Reinforcement Learning with Verifiable Rewards (RLVR): bij taken met een controleerbaar antwoord, zoals code schrijven of een berekening maken, controleert het systeem automatisch of de uitkomst klopt. Dat schrapt de behoefte aan grote groepen menselijke beoordelaars en maakt het trainen op specifieke vaardigheden veel schaalbaarder. DeepSeek gebruikte deze aanpak als kern van zijn trainingsmethode en bewees daarmee dat je met minder compute toch sterke redeneervermogens kunt bouwen.
Een goede vergelijking: het verschil tussen een atleet die conditietraining doet en een atleet die spelvormen traint. Beide zijn fit, maar alleen de tweede weet wat te doen als het erop aankomt.
Wat dit verandert aan de AI-markt
De verschuiving naar reinforcement learning heeft één opvallende bijwerking: modellen worden diverser. Rane: "We're seeing a lot more divergence today. Some labs are going after coding, others after enterprise, others after consumer." Waar taalmodellen ooit veelzijdige alleskunners waren, ontstaan er nu gespecialiseerde modellen die uitblinken in één domein. Een model dat is getraind op administratieve workflows presteert daarin beter dan een generalistisch model, maar omgekeerd ook.
Voor bedrijven die AI inzetten betekent dit dat de keuze van het juiste model steeds meer afhangt van de specifieke taak. De vraag "welke AI gebruik ik?" wordt complexer, maar ook zinvoller: je kunt gaan kiezen op basis van bewezen prestatie in een context die op jouw werk lijkt.
Wekelijkse inzichten in je mail.
Dilemma's, doorbraken en blinde vlekken uit onze AI-praktijk.
Wat dit voor jou betekent
De AI-tools die je nu gebruikt worden getraind met technieken die een jaar geleden nog nauwelijks bestonden. Dat heeft directe gevolgen voor wat je er morgen mee kunt doen.
Voor kenniswerkers en managers: de stap van "AI die antwoorden geeft" naar "AI die taken uitvoert" is in volle gang. Modellen die zijn getraind via reinforcement learning zijn beter in meerstappige taken: een offerte opbouwen op basis van een briefing, een document nalopen op inconsistenties, een planning optimaliseren op basis van constraints. Niet omdat ze slimmer zijn in de abstracte zin, maar omdat ze getraind zijn op het afmaken van taken, niet alleen op het produceren van tekst.
Voor organisaties met gespecialiseerde processen is deze trend goed nieuws.
Voor organisaties met gespecialiseerde processen, zoals redacties, juridische teams of salesprofessionals die tenders schrijven, is de specialisatietrend goed nieuws. De kans dat er binnen twee jaar een model bestaat dat specifiek is getraind op jouw type werk neemt snel toe. De basis daarvoor wordt nu gelegd.
Voor beslissers geldt één praktische les: de snelheid waarmee AI verbetert op taakgericht gebied is hoger dan de meeste organisaties verwachten. Wie nu wacht tot "AI echt goed genoeg is", loopt het risico te laat te starten met het opbouwen van de interne kennis om die tools effectief in te zetten. De technologie rijpt sneller dan de organisaties eromheen.


