← Terug
Gebrek aan metacognitieve loop belemmert autonome AI-onderzoekers

Gebrek aan metacognitieve loop belemmert autonome AI-onderzoekers

De ambitie om volledige wetenschappelijke trajecten te automatiseren via zogenaamde 'AutoResearch' stuit op fundamentele hindernissen. Hoewel de combinatie van grote taalmodellen en agentische structuren in theorie in staat is om een proces van hypothesevorming tot het schrijven van een artikel autonoom te doorlopen, wijst recent wetenschappelijk bewijs op aanzienlijke beperkingen in de uitvoering hiervan.

Volgens een publicatie op arxiv.org schieten huidige evaluatiemethoden vaak tekort omdat zij zich primair richten op het eindresultaat in plaats van op het traject dat tot dat resultaat leidde. Hierdoor blijft onduidelijk waar in de redenering van een AI-agent precies fouten ontstaan. Om dit inzicht te vergroten, hebben onderzoekers AutoResearchEval ontwikkeld, een kader met 100 taken gebaseerd op baanbrekend wetenschappelijk werk binnen zeven verschillende domeinen. Dit kader bestrijkt de volledige cyclus van onderzoek, van de initiële ideevorming en data-analyse tot het uiteindelijke reviewproces.

In het kader van deze studie werden 800 onderzoekstrajecten geanalyseerd, voortvloeiend uit acht verschillende combinaties van modellen en frameworks. Deze data vormden de basis voor de AutoResearch Failure Taxonomy (ARFT), een systeem dat 45 specifieke foutpatronen identificeert. Om deze fouten accuraat te kunnen diagnosticeren, maakten de onderzoekers gebruik van een door mensen gekalibreerde 'agent-as-a-judge'-pijplijn, waarmee zowel de tussenstappen als de definitieve artefacten konden worden gecontroleerd.

De centrale conclusie van de analyse is dat de diverse fouten terug te voeren zijn op een gebrek aan metacognitie. Dit betekent dat AI-agenten niet in staat zijn om hun eigen output te controleren aan de hand van feiten, hun koers bij te sturen wanneer resultaten afwijken van de data, of kritisch te reflecteren op de gekozen methodologie. Deze tekortkomingen waren consistent aanwezig in alle geteste combinaties, ongeacht de kracht van het gebruikte model. In de wordt daarom gesteld dat het probleem waarschijnlijk op modelniveau ligt en niet enkel voortkomt uit een gebrekkige orchestratie van het framework.

Terwijl de academische wereld deze beperkingen blootlegt, zet de commerciële sector de ontwikkeling van autonome systemen voort. Zo biedt claude.com oplossingen aan voor het bouwen van AI-agenten die effectiever kunnen plannen en samenwerken. De focus van dergelijke commerciële toepassingen kan liggen op sectoren zoals cybersecurity, juridische diensten en de levenswetenschappen.

Om de vooruitgang in autonome wetenschappelijke ontdekkingen te stimuleren, hebben de makers van AutoResearchEval zowel de evaluatieset als de ARFT-taxonomie openbaar gemaakt. Hiermee kunnen ontwikkelaars preciezer bepalen waar huidige systemen falen en hoe de metacognitieve loop in toekomstige versies kan worden geïmplementeerd. De vraag of interventies op het niveau van de orchestratie dit deficit kunnen oplossen, blijft volgens de vooralsnog onbeantwoord.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!