Onderzoekers van de National Taiwan University en CyCraft AI Lab hebben een nieuwe benchmark ontwikkeld die het sociaal redeneringsvermogen van grote taalmodellen (LLM's) nauwkeuriger in kaart brengt. Het nieuwe systeem, Avalon-ToM-Bench, test het 'theory of mind'-vermogen (ToM) van modellen via de asymmetrische spelmechanieken van het bordspel The Resistance: Avalon, zo blijkt uit een arxiv.org dat op 10 augustus verscheen. De resultaten tonen aan dat veel geavanceerde AI-systemen wel beschikken over de benodigde kennis, maar in de praktijk niet in staat zijn om die sociaal correct toe te passen.
Van statische tests naar dynamische situaties
Waar bestaande ToM-evaluaties vaak gebruik maken van statische verhaaltjes of scenario's, kiest het team van onderzoekers voor een dynamische, interactieve spelomgeving. In Avalon hebben spelers ongelijke informatie: de 'goede' spelers weten niet wie de boeven zijn, terwijl de 'slechte' spelers elkaar wel kennen. Die ongelijke startpositie dwingt spelers tot complex sociaal redeneren: iemand die een beschuldiging uit moet niet alleen weten wat iemand denkt, maar ook of diegene liegt uit eigenbelang of oprecht een fout maakt.
De onderzoekers vermijden echter het meten van 'eindbaas'-speelprestaties—iets wat in eerdere varianten zoals AvalonBench wél gedaan wordt. In plaats daarvan hakken ze sociaal redeneren op in een scherpe 2x2-taxonomie: epistemische versus motivationele reasoning (kennis vs. motieven) en inference versus actie (wat denkt weten vs. hoe en gedrag). Voor elke situatie stellen ze meeriperspectivische vragen vast die zijn getagd door menselijke initiatief.
Drie verrassende inzichten
Door 28 verschillende LLM's te testen komen de onderzoekers tot diepgaande conclusies. Ten eerste blijkt dat modellen vooral falen op het sociaal-rendement, niet op gebrek aan kennis: ze weten de spelregels feilloos (regelmaatscore hoog), maar lezen of motieven van anderen veel zwakker. "Regelmeetkunde is niet sociale intelligentie", vatten de onderzoekers samen in hun paper.
Het meest opvallende inzicht is dat modellen in hun interne geheimhouding wél de juiste conclusie trekken, maar die in de uitvoering niet kunnen weergeven. Bij zogenaamde 'gelimiteerde sonde' — een meetanalyse die direct op de tussentijdse verwerkingsstadia kijkt — scoren lin-Sonde er 77 tot 82 procent van de tien in true-vals. Echter, dezelfde modellen die zelf hun denkprocessen in 'chain-of-thought' opleverbreden, komen tot 62 tot 70 procent. "Begrip is aanwezig, maar slaagt niet tot en in de expressie," tagden de onderzoekers in hun samenvatting.
Ten laatste: de techniek die momenteel veelbelovend is voor technisch logisch redeneren – het tonen van overlegstappen ('inference-time') – blijkt sociaal bijna zonder effect. Toegevoegd van extra chain-of-thought-stappen genereert gemiddeld slechts 1,1 punten verbetering in ToM-scores, terwijl een intensievere extra trainfase (bijvoorbeeld gericht op verbaal redeneren) een 11,0 punten-revit oplevert. "Degelijke ToM hangt net van een aangeleerde strategie af, niet van meer deficientie in inferentietijd", concluderen de onderzoekers.
Verband met eerdere vondsten
De resultaten sluiten aan op werk dat eerder dit jaar op de substack.com (11-16 juli in San Diego) in de schijnwerpers stond. Hoewel het artikel niet precies de specifieke prijs van 'diverse papers' aanwijst, bevestigt het een bredere trend: de krachten van de reinforcement learning voor verifieerbare beloningen is de dominante poule. Een in juni gepubliceerde winnende lijst van economische wedstrijd van ACL 2026 rangschikt werken over onder andere evol choice steering en stabilisering van entropie in RL.
Versterking kiezen de motte eerst die 2023 door AvalonBench— een compleet spelomgeving -- ontwikkeld met regel-, niet-Ageantenne modellen— al duidelijk maak: toen haalde zelfs ChatGPT als 'goed' speellid slechts 22,2 procent winst tegen 'eviles'-gegruppering (tegenover 38,2 procent voor een formele bot in dezelfde situ).
Toekomst en impact
Met Avalon-ToM-Bench hopen de auteurs het veld een diagnostisch exact positie-instrument te geven. In vergelijking tot aclanthology.org, die zelf op basis van beleefde taakklassjes man werkt, gaat de draagraket nu direct in op de interactie in een eigen party-game. De dataset en de proefcode zijn echter niet open beschikbaar, hoewel de verbinding naar github.com wordt beloofd. Het doel is duidelijk: dat AI-agenten van sociaal spel misbelastenen belasting in een veilig thema.