Waarom een AI-model soms zijn rol verliest

Anthropic-onderzoek toont hoe taalmodellen tijdens lange of emotionele gesprekken wegdrijven van hun assistent-rol. Wat betekent dat voor jouw inzet?

Pieter de Monchy· 20 januari 2026· 3 min· nieuwsflits

Een AI-model begint elk gesprek als behulpzame assistent, maar die rol ligt minder vast dan we dachten. Nieuw onderzoek van Anthropic laat zien dat taalmodellen tijdens lange of emotioneel geladen gesprekken langzaam wegdrijven van hun standaardgedrag. Ze noemen dat fenomeen persona drift. De onderzoekers identificeerden de zogeheten Assistent-as: een meetbare richting in de neurale activiteit van het model die bepaalt hoe stevig het zijn assistent-rol vasthoudt. Door die activiteit binnen een begrensd bereik te houden, een techniek die ze activation capping noemen, daalde het aantal schadelijke antwoorden met ongeveer de helft. Voor organisaties die AI serieus inzetten is dat niet alleen technisch interessant, maar ook een directe aanwijzing dat gespreksbewaking hoort bij verantwoord gebruik.

Wat de onderzoekers precies vonden

Anthropic voerde samen met onderzoekers van het MATS- en Fellows-programma een serie experimenten uit op meerdere open taalmodellen. Ze brachten de neurale activiteit in kaart en ontdekten dat de assistent-persoonlijkheid niet verspreid in het model zit, maar geconcentreerd langs één specifieke as. Wanneer ze modellen kunstmatig richting die as duwden, werden ze weerbaarder tegen rollenspel en manipulatie. Wanneer ze er juist vanaf stuurden, bleken modellen bereid om alternatieve identiteiten aan te nemen, inclusief gedrag dat tegen hun training in gaat.

De tweede belangrijke bevinding: persoonlijkheidsdrift is voorspelbaar. Gesprekken die vragen om zelfreflectie over het eigen denkproces, of die emotioneel beladen zijn, verhogen de activiteit langs de as en duwen het model soms buiten zijn comfortzone. Niet door kwade opzet van de gebruiker, maar simpelweg door de aard van het gesprek. De onderzoekers werkten samen met Neuronpedia om die drift zichtbaar te maken in een live demo.

Waarom dit ertoe doet voor jouw organisatie

De meeste discussies over AI-veiligheid gaan over wat het model aan het begin van een gesprek kan of mag. Dit onderzoek verplaatst het vraagstuk naar wat er gebeurt tijdens het gesprek. Een chatbot die om tien uur 's ochtends netjes binnen zijn kaders blijft, kan om elf uur onder invloed van een lange, persoonlijke conversatie iets heel anders zeggen. Dat gaat niet om hallucinaties in de klassieke zin, waar het model feiten combineert die niet kloppen. Het gaat om een subtielere afwijking: het model vergeet gaandeweg zijn rol en gaat mee in de toon van het gesprek.

Voor klantenservice, HR-chatbots of interne AI-assistenten is dat een concreet risico. Juist in de contexten waarin je AI inzet omdat hij empathisch en behulpzaam overkomt, wordt de kans op drift groter. Niet omdat de technologie faalt, maar omdat het type gesprek de technologie opzoekt.

Wat activation capping verandert

De oplossing die Anthropic voorstelt is relatief licht. In plaats van het model continu richting de assistent-rol te sturen, meten ze welke activiteit past bij normaal assistent-gedrag en begrenzen ze uitschieters. Alleen wanneer het model dreigt af te wijken, grijpt de techniek in. Dat scheelt rekenkracht en behoudt de capaciteiten van het model op standaardbenchmarks.

Voor leveranciers van AI-diensten is dit een bouwsteen die richting productie kan. Voor afnemers is het vooral een signaal: verantwoord AI-gebruik stopt niet bij de keuze van een model, maar vraagt om monitoring van wat het model in de praktijk doet over de looptijd van een gesprek. De transparantie over hoe leveranciers dat borgen is nog onvoldoende, wat het voor organisaties lastig maakt om vooraf een goede inschatting te maken.

Wekelijkse inzichten in je mail.

Dilemma's, doorbraken en blinde vlekken uit onze AI-praktijk.

Wat dit betekent voor jouw aanpak

Drie praktische consequenties. Eén: bij de selectie van AI-leveranciers hoort de vraag hoe zij persoonlijkheidsdrift monitoren en begrenzen. Twee: in je governance-kaders is het nuttig om onderscheid te maken tussen kortdurende taken, waar drift beperkt speelt, en langdurige of emotionele interacties zoals klantenservice en coaching-toepassingen, waar het risico groter is. Drie: logging van gesprekken krijgt een nieuwe functie. Niet alleen om achteraf te leren, maar om tijdens het gesprek te kunnen ingrijpen als het model buiten zijn rol treedt.

Het onderzoek van Anthropic is een vroeg signaal dat verantwoord AI-gebruik zich verplaatst van het model naar het systeem eromheen. Wil je helder krijgen hoe dit raakt aan jouw inzet van AI? Plan een kennismaking in, we denken graag mee.