Wetenschappers hebben een nieuw framework ontwikkeld om dieper inzicht te krijgen in de interacties tussen grote taalmodellen (LLM's) in multi-agent systemen. Het onderzoek richt zich op de vraag of de samenwerking tussen deze AI-agenten daadwerkelijk gebaseerd is op sociale normen, of dat er sprake is van strategische berekening en imitatie. De centrale stelling is dat het enkel observeren van gedrag onvoldoende is om de vorming van normen vast te stellen.
In de publicatie arxiv.org betogen onderzoekers Rasika Muralidharan, Haewoon Kwak en Jisun An dat gedragsmatige convergentie — waarbij agenten zich op een vergelijkbare, coöperatieve wijze gedragen — vaak onterecht wordt geïnterpreteerd als bewijs voor sociale normen. Volgens de auteurs kan een coöperatief evenwicht namelijk voortkomen uit diverse bronnen, zoals gedeelde verwachtingen, strategische prikkels of simpelweg het kopiëren van anderen. Om dit onderscheid te kunnen maken, meet het nieuwe kader niet alleen de acties van de agenten, maar ook hun empirische en normatieve verwachtingen.
Dit onderzoek raakt aan bredere concepten van britannica.com, waarbij de interactie tussen individuen en de sociale omgeving centraal staat. In de context van AI-systemen hebben de onderzoekers specifiek gekeken naar twee collectieve mechanismen: sociaal leren via interactie en sociale selectie via de vorming van groepen binnen een netwerk. Door middel van gecontroleerde experimenten en ablaties werd onderzocht hoe deze processen de stabiliteit van de samenwerking beïnvloeden.
De resultaten van de studie tonen aan dat het expliciet bevragen van de verwachtingen van de agenten leidde tot een toename in coöperatieve bijdragen. Terwijl sociaal leren hielp om het gedrag van de agenten te stabiliseren, bleek sociale selectie effectief bij het identificeren van coöperatieve partners, maar bood het minder versterking voor het feitelijke gedrag zelf. Om de robuustheid van deze dynamieken te testen, werden vier verschillende families van taalmodellen blootgesteld aan bewuste verstoringen. Hieruit bleek dat het herstel van coördinatie en normatieve verwachtingen per model verschilt.
De conclusie van de onderzoekers is dat vergelijkbare coöperatieve resultaten kunnen voortkomen uit fundamenteel verschillende sociale processen. Door verwachtingen observeerbaar te maken, kunnen systeemontwerpers beter bepalen welk mechanisme de samenwerking drijft. Volgens de details in de biedt dit een essentieel kader voor het waarborgen van duurzame samenwerking in complexe AI-systemen.
Het onderzoek, dat op 22 september 2026 is gepubliceerd, is ingediend bij de AAAI 2027 in de speciale track voor AI Alignment. De studie raakt aan thema's als speltheorie, computationele linguïstiek en sociale netwerken. Door het onderscheid te maken tussen de acties van een agent en de verwachtingen die deze agent heeft van anderen, hopen de wetenschappers de ontwikkeling van betrouwbaardere en voorspelbaardere AI-samenlevingen te stimuleren. De volledige methodologie is terug te vinden in het artikel .