← Terug
Collectieve intelligentie van AI: Onderzoek naar de 'Wisdom of Crowds' bij taalmodellen

Collectieve intelligentie van AI: Onderzoek naar de 'Wisdom of Crowds' bij taalmodellen

Onderzoekers hebben onderzocht of het fenomeen van de 'wijsheid van de massa' — waarbij de geaggregeerde schattingen van een groep mensen vaak nauwkeuriger zijn dan die van het beste individu — ook van toepassing is op grote taalmodellen (LLM's). Uit een recente studie blijkt dat ensembles van AI-modellen inderdaad betere voorspellingen kunnen doen dan individuele modellen, mits er gebruik wordt gemaakt van geavanceerde aggregatiemethoden.

De kracht van geaggregeerde AI-oordelen

In een wetenschappelijk artikel getiteld "Wisdom of LLM Crowds: Aggregation and Contamination in Language Model Ensembles", gepubliceerd op arxiv.org, analyseerde onderzoeker Igor Douven de prestaties van 15 verschillende taalmodellen. De modellen kregen de opdracht om waarschijnlijkheden te schatten voor 254 binaire vragen uit voorspellingsmarkten.

De resultaten tonen aan dat 'geleerde aggregatoren' — specifiek een logistische regressie en een multilayer perceptron — superieur waren aan zowel de individuele modellen als aan klassieke aggregatiemethoden. Opvallend is dat de logistische regressie vergelijkbare resultaten behaalde als het neurale netwerk. Dit suggereert dat de verbetering voortkomt uit het leren van een lineaire combinatie van diverse modeluitvoer, in plaats van uit complexe, niet-lineaire interacties tussen de modellen.

Het probleem van databesmetting

Een cruciaal onderdeel van het onderzoek richtte zich op 'training cutoff contamination'. Dit verwijst naar het risico dat modellen antwoorden geven op basis van informatie die al in hun trainingsdata zat, in plaats van door middel van actuele redenering.

Volgens de bevindingen op was deze besmetting een wijdverbreid probleem. Wanneer er alleen gekeken werd naar een 'schone' subset van vragen die pas werden beantwoord na de trainingsdeadline van alle gebruikte modellen, kromp het prestatieverschil tussen geavanceerde cloudmodellen en kleinere lokale modellen aanzienlijk: van 35,8% naar slechts 8,9%. Dit wijst erop dat de schijnbare superioriteit van sommige topmodellen gedeeltelijk berust op toegang tot historische data in plaats van superieure analytische vermogens.

Context van Large Language Models

Om de resultaten te begrijpen, is kennis van de onderliggende technologie essentieel. Zoals beschreven door geeksforgeeks.org, zijn LLM's geavanceerde systemen gebaseerd op diepe neurale netwerken die patronen en context leren uit enorme datasets. De meeste moderne modellen maken gebruik van de Transformer-architectuur, die in staat is om lange-afstandsrelaties in tekst te begrijpen via mechanismen zoals 'self-attention'.

De huidige markt wordt gedomineerd door diverse architecturen. Volgens google.com zijn deze modellen statistische systemen die getraind zijn op miljarden teksten om natuurlijke taal te genereren en te vertalen. Voorbeelden van dergelijke modellen zijn Gemini van Google, GPT-serie van OpenAI en Claude van Anthropic.

Vergelijking en benchmarks

De dynamiek van AI-prestaties is zeer volatiel. Recente data van benchlai uit juli 2026 tonen aan dat modellen zoals Claude Mythos 5 en GPT-5.6 Sol hoog scoren op diverse benchmarks, waarbij de focus steeds vaker verschuift naar een balans tussen kwaliteit, kosten en de grootte van het contextvenster.

Ondanks deze technologische vooruitgang concludeert het onderzoek van Douven dat LLM-ensembles, zelfs wanneer ze worden geëvalueerd op hun eigen trainingsdeadline, aanzienlijk minder accuraat blijven in het aggregeren van collectieve informatie dan menselijke experts. Dit suggereert dat er een fundamenteel gat bestaat in hoe AI-modellen informatie synthetiseren in vergelijking met menselijke collectieven.

Conclusie voor de praktijk

De studie benadrukt dat hoewel de 'wijsheid van de massa' kan worden nagebootst met AI-ensembles, een strikte evaluatie zonder databesmetting essentieel is voor een betrouwbare beoordeling. Voor organisaties die AI inzetten voor voorspellingen, betekent dit dat het combineren van diverse modellen via geleerde methoden effectiever is dan het vertrouwen op één enkel 'frontier' model. De integratie van verschillende perspectieven van diverse modellen kan leiden tot een robuuster en nauwkeuriger eindresultaat, mits de data-integriteit gewaarborgd blijft.

Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!