⚠️ KMI waarschuwing: Onweer in België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
Nieuwe onderzoeksmethode legt tekortkomingen bloot in tool-gebruik van AI-agenten

Nieuwe onderzoeksmethode legt tekortkomingen bloot in tool-gebruik van AI-agenten

Wetenschappers hebben een kritische analyse gepubliceerd over de manier waarop de effectiviteit van AI-agenten wordt gemeten. Uit het onderzoek blijkt dat grote taalmodellen (LLM's) vaak minder bekwaam zijn in het toepassen van externe vaardigheden dan huidige meetmethoden doen vermoeden. Er is sprake van een zogenaamde 'evaluatieparadox', waarbij de inzet van externe tools de prestaties op specifieke taken in werkelijkheid kan verslechteren, terwijl de algemene cijfers een verbetering suggereren.

Volgens een publicatie op arxiv.org van Seonghyeon Cho en collega's is de huidige praktijk van het beoordelen van AI-agenten problematisch. Veel systemen worden nu geëvalueerd op basis van geaggregeerde statistieken. Hierbij wordt het resultaat van taken met tool-gebruik simpelweg vergeleken met taken zonder dat gebruik. De onderzoekers stellen dat deze aanpak een misleidend beeld geeft door een aanzienlijke selectiebias te introduceren. Het is namelijk onduidelijk of het succes voortkomt uit het effectieve gebruik van de tool, of dat de agent simpelweg makkelijkere taken selecteert voor bepaalde acties.

Om een accurater beeld te krijgen, hebben de auteurs het concept 'Skill Following' (SF) geformaliseerd. Zij introduceerden hiervoor de Retrieval-Invoked Actual-Use Effect (RAE). Deze nieuwe maatstaf kijkt niet naar algemene gemiddelden, maar berekent het verschil in uitkomst voor exact dezelfde taak. Hierbij wordt specifiek geanalyseerd wat er gebeurt wanneer een agent actief besluit een tool op te halen en deze vervolgens toepast op die specifieke opdracht.

De resultaten van de tests, waarbij 17 verschillende taalmodellen werden onderzocht in de domeinen wiskunde en programmeren, zijn opvallend. De data tonen aan dat modellen vaak een positieve stijging laten zien in de algemene statistieken, maar tegelijkertijd een negatieve score behalen op de RAE. Dit betekent dat de modellen op systeemniveau lijken te verbeteren, maar op de concrete taken waarvoor de tool werd ingezet, juist slechter presteren. Dit effect was duidelijk zichtbaar bij tests op MBPP+, waar meerdere modellen schade aanrichtten aan de uitkomst van taken ondanks de inzet van retrieval.

Het onderzoek is geaccepteerd voor de 'Findings of EMNLP 2026' en werd op 1 september 2026 gedeeld via . De conclusie is dat de huidige 'retrieval-to-answer' pijplijn in veel gevallen contraproductief werkt, ook al lijken de benchmarks optimistisch.

Terwijl de academische discussie zich richt op het verbeteren van meetmethoden, gaat de praktische ontwikkeling van externe vaardigheden voor AI door. Op platforms zoals GitHub wordt geëxperimenteerd met het structureren van specifieke productiviteitstools. Zo beschrijft een github.com hoe specifieke instructies en vaardigheden kunnen worden ingezet om de output van een model te sturen. Deze praktijkvoorbeelden onderstrepen de groeiende behoefte aan externe ondersteuning voor LLM's, ondanks de inefficiënties die het onderzoek aan het licht brengt.

De onderzoekers pleiten ervoor om de focus te verschuiven van algemene gemiddelden naar directe metingen van het effect van een ingezette vaardigheid op een specifieke taak. Alleen via deze methode kan worden vastgesteld of een AI-model daadwerkelijk in staat is om externe informatie correct te integreren in een uiteindelijke oplossing. De volledige details van deze methodiek zijn terug te vinden in de over de evaluatie van AI-vaardigheden.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!