Wetenschappers hebben een hardnekkig probleem binnen geavanceerde taalmodellen geïdentificeerd dat bekendstaat als role-capability leakage (RCL). Dit fenomeen houdt in dat een AI-model weliswaar de toon en stijl van een specifieke persona kan imiteren, maar onbedoeld vaardigheden blijft vertonen die ver boven het niveau van die rol liggen. Zo kan een model dat de opdracht krijgt om als kleuter te reageren, toch in staat zijn om complexe wiskundige vraagstukken op te lossen.
In een publicatie van 30 september 2026 wordt uitgelegd dat standaardmethoden voor het toewijzen van rollen, ook wel naive role prompting genoemd, onvoldoende zijn om de onderliggende capaciteiten van een model echt te begrenzen. Volgens de analyse op arxiv.org blijven modellen consistent presteren op een niveau dat niet matcht met de beperkingen van de gekozen persona, ondanks dat de uiterlijke vorm van de reactie wel correct is.
Om dit effect meetbaar te maken, hebben onderzoekers, waaronder Saksorn Ruangtanusak en Pakhapoom Sarapat, een nieuw evaluatiekader ontwikkeld genaamd RoleCapBench. Deze benchmark maakt gebruik van een educatief curriculum met zes verschillende rollen, verdeeld over vier niveaus die reiken van de basisschool tot het A-level. Bij het testen van drie open-weight reasoning-modellen bleek dat de nauwkeurigheid voor taken die boven het niveau van de rol lagen onverwacht hoog bleef, met scores tussen de 0,811 en 0,898. Zoals vermeld via arxivsignals.io, bewijst dit dat er een aanzienlijke kloof bestaat tussen de immitatie van een stem en de feitelijke beperking van cognitieve vermogens.
Het onderzoek toont aan dat zelfs expliciete instructies om het vaardigheidsniveau aan te passen niet voldoende werken. De auteurs stellen daarom een alternatieve methode voor, genaamd 'Injection'. Deze techniek wordt toegepast tijdens de inferentiefase en combineert specifieke richtlijnen over de capaciteiten van de rol met een vooraf ingevuld prefix voor de reactie.
Uit de data in de blijkt dat deze interventie leidt tot een aanzienlijke verbetering in de alignment. De nauwkeurigheid bij taken die boven het toegewezen niveau liggen, kon met maximaal 0,562 worden verlaagd, terwijl de prestaties binnen het eigen niveau van de rol grotendeels intact bleven, met een minimale daling van minder dan 0,058 bij de meeste modellen.
Deze resultaten hebben belangrijke implicaties voor de evaluatie van kunstmatige intelligentie. De bevindingen, zoals samengevat door deeppaper.ai, benadrukken dat het simpelweg geven van een rolinstructie niet volstaat om de redeneerkracht van een model effectief te maskeren. Met de introductie van RoleCapBench is er nu een instrument beschikbaar om te toetsen in hoeverre modellen hun kennisniveau kunnen beheersen. De volledige scripts en evaluatiegegevens zullen worden vrijgegeven na de officiële acceptatie van het onderzoek, dat is ingedeeld onder de categorieën kunstmatige intelligentie, mens-computerinteractie en computationele taalverwerking.