⚠️ KMI: Hitte in België De waarschuwingsfase van het hitteplan blijft geactiveerd vanwege hoge temperaturen, met maxima die kunnen oplopen tot … 29/07 00u – 03/08 00u KMI ↗ Kaart ↗ Artikel →
← Terug
LivingArena: Nieuwe evaluatiemethode laat AI-modellen elkaars zwaktes opsporen

LivingArena: Nieuwe evaluatiemethode laat AI-modellen elkaars zwaktes opsporen

De evaluatie van geavanceerde kunstmatige intelligentie staat voor een fundamentele uitdaging. Traditionele methoden om de prestaties van taalmodellen te meten, maken vaak gebruik van statische benchmarks. Deze vaste testsets zijn echter gevoelig voor 'contaminatie', waarbij modellen tijdens hun trainingsproces onbedoeld al toegang hebben gekregen tot de vragen die later gebruikt worden voor de evaluatie. Hierdoor ontstaat een vertekend beeld van de werkelijke capaciteiten van de AI.

Om dit probleem op te lossen, hebben Xingyu Chen en een team van onderzoekers LivingArena ontwikkeld. Volgens een wetenschappelijke publicatie op arxiv.org introduceert dit framework het concept van 'peer-probing'. In plaats van een vaste lijst met vragen, treden taalmodellen in een dynamische strijd tegen elkaar aan. In dit proces wisselen de modellen voortdurend van rol: de ene fungeert als vragensteller, terwijl de andere probeert het juiste antwoord te formuleren.

Het doel van de vragensteller is om specifiek die vragen te formuleren die de tegenstander niet correct kan beantwoorden. Om te garanderen dat de vragen eerlijk en objectief verifieerbaar zijn, wordt er gebruikgemaakt van een jury bestaande uit krachtige modellen. Wanneer een vragensteller een onmogelijke of willekeurige vraag stelt, wordt dit bestraft. Omgekeerd wordt de vragensteller beloond wanneer de opponent faalt, terwijl de beantwoorder punten scoort bij een correct antwoord. Deze competitieve opzet dwingt modellen om strategisch te zoeken naar de cognitieve grenzen en zwakke punten van hun gelijken.

De resultaten van dit onderzoek, waarbij tien vooraanstaande modellen werden getest, leidden tot een stabiel Elo-klassement. Dit systeem, dat bekend is uit de schaakwereld, biedt een relatieve rangschikking van de sterkte van de modellen. De onderzoekers stellen vast dat peer-probing een unieke vorm van evaluatie biedt die nauwelijks correleert met subjectieve menselijke voorkeuren, maar wel een schaalbare en kostenefficiënte manier is om de feitelijke strengheid van AI te monitoren.

Om de context van dit onderzoek te begrijpen, is het belangrijk om de aard van de gebruikte technologie te definiëren. Large Language Models (LLM's) zijn in essentie statistische modellen die zijn getraind op gigantische hoeveelheden tekstdata. Zoals uitgelegd door google.com, maken deze systemen vaak gebruik van de Transformer-architectuur om complexe taken uit te voeren, variërend van tekstgeneratie tot het vertalen van talen.

Deze technologie is onderdeel van een breder veld binnen de informatica. Volgens informatie van ibcom vallen LLM's onder de paraplu van machine learning en deep learning, waarbij neurale netwerken en 'attention'-mechanismen worden ingezet om patronen in menselijke taal te herkennen. De verschuiving naar generatieve AI, waarbij modellen zelfstandig nieuwe content creëren, heeft de noodzaak voor innovatieve testmethoden zoals LivingArena vergroot. Omdat de output van moderne AI steeds complexer wordt, volstaan eenvoudige vraag-antwoordlijsten niet langer om de werkelijke intelligentie en betrouwbaarheid van een systeem vast te stellen.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!