← Terug
AgentDebugX: Nieuwe open-source toolkit voor het debuggen van LLM-agenten

AgentDebugX: Nieuwe open-source toolkit voor het debuggen van LLM-agenten

Een team van onderzoekers heeft AgentDebugX ontwikkeld, een open-source framework dat specifiek is ontworpen om fouten in Large Language Model (LLM) agenten te detecteren, te analyseren en te herstellen.

Het debuggen van autonome AI-agenten vormt een aanzienlijke technische uitdaging. Een kernprobleem is dat de stap waar een fout zichtbaar wordt, vaak niet de stap is waar de fout daadwerkelijk is ontstaan. Volgens een recent onderzoekspublicatie op arxiv.org schieten bestaande tools voor observabiliteit tekort omdat ze weliswaar executiepaden kunnen afspelen, maar weinig ondersteuning bieden bij het identificeren van de werkelijke bronoorzaak of het vertalen van een diagnose naar een concrete oplossing.

Een gesloten lus voor foutcorrectie

Om dit probleem aan te pakken, introduceert AgentDebugX een gestructureerde workflow die debugging benadert als een gesloten lus. Dit proces bestaat uit vier opeenvolgende fasen: detectie, attributie, herstel en het opnieuw uitvoeren van de taak (Detect, Attribute, Recover, and Rerun).

Het hart van dit systeem is een component genaamd DeepDebug. Deze technologie voert een diagnose van de bronoorzaak uit over meerdere beurten. Dit gebeurt door middel van een globale analyse van de trajecten, onderzoek gestuurd door de structuur van de taak en een proces van kruisverhoor om de fout precies te lokaliseren. Zoals beschreven in de , stelt dit framework ontwikkelaars in staat om niet alleen te zien dat er iets misging, maar ook waarom en waar de fout precies ontstond.

Prestaties en benchmarks

De effectiviteit van AgentDebugX is getest op verschillende benchmarks, waarbij het systeem superieure resultaten behaalde vergeleken met bestaande methoden. In de "Who and When"-benchmark, die specifiek kijkt naar de nauwkeurigheid van attributie, behaalde DeepDebug de beste resultaten op geteste open-weight modellen. Zo bereikte het systeem een nauwkeurigheid van 28,8 procent bij het exact aanwijzen van de agent en de specifieke stap bij het gebruik van qwen3.5-9b, terwijl de sterkste baseline-methode slechts op 21,7 procent uitkwam.

Ook op de GAIA-benchmark, die complexe taken voor AI-agenten bevat, toonde de toolkit sterke resultaten. Uit de blijkt dat DeepDebug in staat was om 13 van de 73 mislukte taken te herstellen tijdens een enkele nieuwe poging. Ter vergelijking: drie andere baselines voor zelfcorrectie slaagden er slechts in om 4 tot 6 taken te herstellen. Dit leidde tot een stijging van de algehele nauwkeurigheid van 55,8 procent naar 63,6 procent.

Toegankelijkheid en samenwerking

AgentDebugX is ontwikkeld om breed toegankelijk te zijn voor de developer-community. De functionaliteiten van het framework zijn beschikbaar via verschillende interfaces:
* Een Python-bibliotheek voor directe integratie in code.
* Een Command Line Interface (CLI) voor snelle interacties.
* Een webconsole voor visuele analyse.
* Een installeerbare "agentic skill" waarmee de agent zelf debugging-capaciteiten krijgt.

Een innovatief aspect van het project is de introductie van de "Error Hub". Dit is een opt-in platform waar gebruikers geanonimiseerde pakketten van fouten, diagnoses en reparaties kunnen delen. Volgens de kunnen deze gedeelde ervaringen worden hergebruikt als een vorm van "debugging-geheugen", waardoor andere agenten sneller kunnen leren van eerdere fouten.

Het project is een samenwerking tussen een breed team van academici, waaronder Kunlun Zhu, Xuyan Ye en James Zou, en is ingediend onder de categorieën Artificiële Intelligentie en Computation and Language op .

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!