In de sector van kunstmatige intelligentie heerst een groeiende bezorgdheid over de zogenaamde homogeniteit van grote taalmodellen (LLM's). Wanneer verschillende modellen onafhankelijk van elkaar worden bevraagd, produceren ze vaak antwoorden die nagenoeg identiek zijn. Deze oppervlakkige consensus kan echter misleidend zijn; het kan wijzen op een 'valse pluraliteit' waarbij systemen simpelweg terugvallen op standaardreacties, waardoor de werkelijke nuances en verschillen tussen de modellen onzichtbaar blijven.
Om deze problematiek te analyseren, hebben onderzoekers Ben Wigler en Maria Tsfasman het CHOIR-framework ontwikkeld. De afkorting staat voor Collective Hierarchically-Ordered Inquiry Responses. Volgens een wetenschappelijke publicatie op arxiv.org maakt deze nieuwe benadering gebruik van 'free-list elicitation', een methodiek die haar oorsprong vindt in de cognitieve antropologie.
In plaats van genoegen te nemen met een enkelvoudig antwoord, dwingt het CHOIR-framework de AI-modellen om herhaaldelijk lijsten met antwoorden te genereren die in een specifieke rangorde staan. Deze verzamelde data worden vervolgens op prompt-niveau geclusterd in verschillende concepten. Op deze manier kunnen wetenschappers nauwkeurig vaststellen hoe prominent bepaalde concepten aanwezig zijn over diverse modellen, verschillende varianten van prompts en specifieke persona-instellingen. De technische details over deze implementatie en de gebruikte prompt-banken zijn terug te vinden in het volledige rapport via .
De effectiviteit van het framework is getoetst aan de hand van twee datasets: een diagnostische set van 27 vragen en de 'Infinity-Chat 100' promptbank. De resultaten bevestigen dat er sprake is van een hoge mate van oppervlakkige overeenstemming; bij 93 van de 100 prompts in de Infinity-Chat set was de consensus hoger dan op basis van kansberekening verwacht zou worden. Desondanks slaagt CHOIR erin om de dieperliggende verschillen tussen de systemen te ontsluiten.
Een cruciale conclusie uit het onderzoek is dat de identiteit van het basismodel de meest dominante en herkenbare signatuur blijft. Hoewel het toevoegen van persona-prompts de focus van de concepten kan verschuiven, gebeurt dit nog steeds binnen de kaders van de kenmerkende signatuur van het onderliggende basismodel. Daarnaast beschikt het systeem over een module voor bron-blinde rangschikking, die specifiek zeldzame maar stabiele kandidaten prioriteert voor verdere wetenschappelijke analyse.
Het onderzoek is gepresenteerd tijdens de Third Conference on Language Modeling (COLM 2026). De auteurs betogen dat CHOIR de homogeniteit van open-ended antwoorden omzet in een meetbaar diagnostisch vraagstuk. Door gestructureerd te onderzoeken waar modellen convergeren en waarom dit gebeurt, kan worden vastgesteld welke informatie onder de oppervlakte bereikbaar blijft. De volledige publicatie van 23 pagina's is beschikbaar via .
In de context van dit onderzoek wordt in de titel verwezen naar het 'bereiken' (reach) van diepere responsstructuren van AI-modellen. Dit is een geheel andere betekenis dan de bekende europa.eu van de Europese Commissie. Die laatste regelgeving is namelijk specifiek gericht op het beschermen van het milieu en de menselijke gezondheid door het reguleren van chemische stoffen.