⚠️ KMI waarschuwing: Onweer in België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
Nieuwe WANDR-benchmark test vermogen van AI-agenten voor grootschalig onderzoek

Nieuwe WANDR-benchmark test vermogen van AI-agenten voor grootschalig onderzoek

Wetenschappers hebben een nieuwe evaluatiemethode ontwikkeld om de effectiviteit van AI-onderzoeksagenten te meten bij complexe informatieverzameling. De benchmark, genaamd WANDR (Wide ANd Deep Research), richt zich specifiek op taken die een combinatie vereisen van een brede zoektocht naar relevante entiteiten en een grondige verificatie van elk individueel resultaat.

In tegenstelling tot gangbare tests die vaak zoeken naar één specifiek antwoord, simuleert WANDR professioneel kenniswerk. Volgens een publicatie op arxiv.org bestaat de benchmark uit 500 realistische opdrachten. Hierbij wordt onderscheid gemaakt tussen 'breedte' — het vermogen om een volledige set kwalificerende objecten of personen te vinden — en 'diepte' — het vermogen om deze entiteiten via gecoördineerde zoekopdrachten uitvoerig te onderzoeken.

De complexiteit van de benchmark wordt gewaarborgd door een hiërarchische structuur van kwalificatiesleutels. Een AI-agent moet bijvoorbeeld eerst een lijst met bedrijven samenstellen, vervolgens voor elk bedrijf de juiste medewerkers identificeren en tot slot voor elke medewerker bewijsstukken aanleveren. Dit proces kan leiden tot een exponentiële groei van benodigde gegevens, variërend van enkele tientallen tot duizenden onafhankelijk te verifiëren records.

Deze opzet is direct toepasbaar op diverse zakelijke workflows. Zo wordt de benchmark ingezet voor het evalueren van taken zoals literatuuronderzoek, productvergelijkingen, due diligence-onderzoeken, talent sourcing en marktanalyse. In een artikel van perplexity.ai wordt WANDR gepresenteerd als de brede tegenhanger van de DRACO-benchmark. Waar DRACO focust op het schrijven van een accuraat rapport, test WANDR of een agent een omvangrijke collectie gegevens kan opbouwen waarbij elk onderdeel is onderbouwd met specifiek bewijs.

De eerste testresultaten schetsen een uitdagend beeld voor de huidige stand van de techniek. Zes verschillende productie-onderzoekssystemen werden onderworpen aan de test, maar geen enkel systeem slaagde erin de benchmark volledig te beheersen. Zelfs bij een instelling met een hoge inspanning behaalde het best presterende systeem een soft F1-score van 0,363 en een hard F1-score van 0,133, zoals beschreven in de .

Uit de data blijkt dat de prestaties van AI-agenten significant afnemen wanneer het volume van de gevraagde informatie toeneemt of wanneer de hiërarchische diepte van de taak groter wordt. De grootste problemen ontstaan bij het onvolledig ontdekken van entiteiten, het missen van aanvullende details en het onvermogen om een sluitende bewijsvoering op te bouwen.

Om te voorkomen dat de benchmark veroudert door statische antwoorden, hanteert WANDR een innovatieve evaluatiemethode met taakspecifieke 'judges'. Deze beoordelaars halen de geciteerde webpagina's opnieuw op om elk record te controleren tegen het aangeleverde bewijs. Hierdoor blijft de evaluatie actueel, aangezien internetinformatie voortdurend verandert. De taken zijn ontwikkeld via een semi-geautomatiseerde pijplijn op basis van geanonimiseerde gebruikerslogs en zijn gecontroleerd via menselijke audits. De volledige benchmark en de bijbehorende instrumenten zijn openbaar gemaakt om de ontwikkeling van betere AI-onderzoeksagenten te stimuleren, zoals verder toegelicht door .

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!