Een team van wetenschappers, waaronder Yejin Choi en Liwei Jiang, heeft een zorgwekkende trend vastgesteld in de manier waarop moderne taalmodellen informatie genereren. In een studie die is voorbereid voor NeurIPS 2025, beschrijven de auteurs het fenomeen van de zogenaamde 'Artificial Hivemind'. Dit effect houdt in dat verschillende AI-systemen, ondanks hun uiteenlopende opbouw, vaak nagenoeg identieke reacties geven op open vragen. Volgens de publicatie op arxiv.org zou deze eenvormigheid op lange termijn een negatieve invloed kunnen hebben op de menselijke cognitie, zeker wanneer mensen AI als primaire bron voor inspiratie en informatie gaan gebruiken.
Het concept van de 'Artificial Hivemind' manifesteert zich op twee verschillende niveaus. Enerzijds is er sprake van repetitie binnen één enkel model, waarbij de AI consequent dezelfde soort antwoorden formuleert. Anderzijds is er sprake van homogeniteit tussen verschillende modellen; diverse systemen produceren resultaten die sterk op elkaar lijken. De term 'artificial' wordt in deze context gebruikt om het niet-natuurlijke karakter van deze intelligentie aan te duiden, een begrip dat in algemene zin vaak vertaald wordt als 'kunstmatig' of 'artificieel' volgens linguee.nl.
Om dit gedrag wetenschappelijk te onderbouwen, hebben de onderzoekers de 'Infinity-Chat' dataset ontwikkeld. Deze verzameling bevat 26.000 diverse vragen uit de praktijk waarbij geen enkel vaststaand correct antwoord bestaat. Juist bij dit soort open vragen is een breed scala aan reacties mogelijk, maar de AI-modellen vertonen hier een beperkte creatieve spreiding. Om de resultaten te structureren, hanteerden de wetenschappers een taxonomie met zes hoofdcategorieën, waaronder 'brainstorm & ideation', die verder is uitgesplitst in zeventien subcategorieën. De volledige details van deze methodiek zijn terug te vinden in de .
Het onderzoek combineerde de AI-outputs met 31.250 menselijke annotaties. Hierbij werden per voorbeeld 25 onafhankelijke beoordelingen verzameld om te zien hoe AI-antwoorden scoren tegenover menselijke voorkeuren. De data tonen aan dat taalmodellen en AI-beoordelaars moeite hebben om aan te sluiten bij de specifieke, individuele voorkeuren van mensen. Hoewel de algemene kwaliteit van de gegenereerde teksten acceptabel is, ontbreekt het de systemen aan de nuance die nodig is om in te spelen op diverse menselijke smaken.
Deze bevindingen hebben belangrijke implicaties voor de veiligheid van AI. De onderzoekers vrezen dat een dominante stroom van uniforme AI-antwoorden kan leiden tot een verschraling van het menselijke denkproces. Door de beperkte variatie in de output van AI-systemen zou de menselijke creativiteit onbedoeld worden ingeperkt. De auteurs hopen dat hun werk, dat is gearchiveerd via , kan dienen als basis voor het ontwikkelen van nieuwe methoden om AI-systemen werkelijk diverse en mensachtige creativiteit bij te brengen en de zogenaamde 'mode collapse' tegen te gaan.