← Terug
Nieuwe methode vermindert 'inertia bias' bij AI-onderzoeksagenten

Nieuwe methode vermindert 'inertia bias' bij AI-onderzoeksagenten

Wetenschappers hebben een methode ontwikkeld om de objectiviteit van AI-agenten te verhogen tijdens het uitvoeren van complexe zoekopdrachten op het internet. Het nieuwe framework is ontworpen om te voorkomen dat systemen beïnvloed worden door hun eigen eerdere acties, waardoor informatie effectiever gefilterd en gevalideerd kan worden.

Volgens een publicatie op arxiv.org hebben websearch-agenten die gebruikmaken van Large Language Models (LLM's) de neiging om minder objectief te zijn zodra zij zelf een plan of tussenconclusie hebben opgesteld. Dit betekent dat wanneer een AI de resultaten van een eigen zoekopdracht beoordeelt, het systeem vaak geneigd is de eigen eerdere keuzes te bevestigen, zelfs wanneer de feitelijke data een andere richting uitwijzen.

De impact van 'Inertia Bias'

Dit specifieke probleem wordt door onderzoekers, waaronder Xiangxin Zhang, aangeduid als 'inertia bias'. Om dit fenomeen in kaart te brengen, is de IBIS-benchmark ontwikkeld. Deze tool meet hoe observaties uit zoekopdrachten worden verwerkt door te variëren tussen scenario's waarin het model zijn eigen acties evalueert versus scenario's waarin externe bronnen worden beoordeeld.

Uit de data blijkt dat de prestaties van modellen aanzienlijk dalen wanneer zij de voorgaande stap in het zoekproces zelf hebben uitgevoerd. De geschiedenis van eigen acties zorgt voor een systematische vervorming van het oordeel. Dit resulteert in twee soorten degradatie: zoekruis bij de uitvoerende agent (de 'worker') en contextuele ruis bij de sturende agent (de 'manager').

Introductie van de NIS-Agent

Als oplossing voor deze bias stellen de onderzoekers de NIS-Agent voor. Dit systeem maakt gebruik van context-isolatie op de meest kwetsbare momenten: bij de triage van webpagina's en de uiteindelijke validatie van het antwoord. Door de informatie die tot een besluit leidt strikt te scheiden van de actie die deze informatie heeft opgehaald, kan de objectiviteit van het systeem worden hersteld.

De effectiviteit van deze aanpak is getest via diverse benchmarks, waaronder WebWalkerQA, GAIA en BrowseComp. In de documentatie op wordt vermeld dat de NIS-Agent concurrerende resultaten behaalt, terwijl de tokenkosten met 33% dalen in vergelijking met de standaardinstellingen.

Optimalisatie van kleinere modellen

Naast het framework hebben de onderzoekers een model met 8 miljard parameters getraind dat van nature beter bestand is tegen inertia bias. Wanneer dit specifieke model wordt geïntegreerd in het NIS-Agent-framework, worden prestaties behaald die vergelijkbaar zijn met die van GPT-4o op benchmarks voor diepgaand onderzoek. Dit suggereert dat een kleiner model door specifieke training vergelijkbare prestaties kan leveren op deze benchmarks.

Hoewel de ontwikkeling van dergelijke AI-systemen vaak gebruikmaakt van softwaretools en versiebeheer, zoals de mogelijkheden die github.com biedt voor ontwikkelaars, ligt de focus van dit onderzoek specifiek op de cognitieve verwerking binnen de LLM's.

Het onderzoek, dat is ingediend voor EMNLP 2026, onderstreept het belang van objectiviteit bij autonome systemen die onbeheerde informatieverzameling uitvoeren. Meer technische details over de methodologie en de gebruikte benchmarks zijn beschikbaar via de volledige tekst op .

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!