De transitie van statische taalmodellen naar actieve AI-agents, die zelfstandig acties kunnen ondernemen via externe tools, zorgt voor een nieuwe categorie technische complicaties. Een recent wetenschappelijk onderzoek heeft voor het eerst systematisch geanalyseerd waar het misgaat bij de ontwikkeling van deze systemen. De studie, getiteld "When Agents Fail: A Comprehensive Study of Bugs in LLM Agents with Automated Labeling", wijst uit dat het opsporen en verhelpen van fouten in agent-gebaseerde software momenteel een kostbaar en complex proces is.
Analyse van softwarefouten
Om een accuraat beeld te krijgen van de meest voorkomende bugs, hebben onderzoekers onder leiding van Niful Islam een dataset samengesteld van 1.268 codefragmenten en foutmeldingen. Deze gegevens zijn verzameld via platforms zoals Stack Overflow, Hugging Face en GitHub. De analyse richtte zich op agents die zijn ontwikkeld met zeven populaire LLM-frameworks, alsofmede op diverse eigen implementaties.
De onderzoekers keken specifiek naar de interactie tussen de gebruikte programmeertaal, het gekozen framework en de componenten van de agent waar de fouten ontstonden. Volgens de publicatie op arxiv.org is het doel om inzicht te krijgen in de oorzaken en de uiteindelijke impact van deze bugs op de softwareprestaties. De bevindingen van dit onderzoek zijn geselecteerd voor presentatie op de ISSRE 2026.
Automatisering via BugReAct
Een belangrijk onderdeel van de studie was de ontwikkeling van 'BugReAct', een gespecialiseerde agent die is ontworpen om bugs in datasets automatisch te detecteren en te labelen. Door gebruik te maken van externe tools en de aansturing van Gemini 2.5 Flash, bleek BugReAct zeer effectief in het annoteren van bug-kenmerken.
De efficiëntie van deze methode is opvallend: de kosten voor het annoteren van een enkel codefragment of bericht bedroegen gemiddeld slechts 0,01 USD. Deze geautomatiseerde aanpak biedt een schaalbaar alternatief voor het tijdrovende handmatige debugproces, wat essentieel is nu de complexiteit van AI-systemen toeneemt.
Commerciële implementatie en uitdagingen
Terwijl de wetenschap zich richt op de stabiliteit, versnellen commerciële partijen de uitrol van agent-technologie. Bedrijven zoals Anthropic stellen via claude.com mogelijkheden beschikbaar voor het bouwen van systemen die kunnen plannen en samenwerken, met specifieke toepassingen in de gezondheidszorg, juridische sector en cybersecurity.
Ook andere marktleiders bieden uitgebreide ondersteuning voor de transitie naar autonome systemen. Zo stelt OpenAI in een openai.com stappenplannen voor om AI-agents te bouwen die verder gaan dan eenvoudige tekstgeneratie.
Ondanks deze commerciële vooruitgang blijft de technische robuustheid een kritiek punt. De overgang van een Large Language Model (LLM) naar een actieve agent introduceert nieuwe vormen van softwarefouten die traditionele methoden voor foutdetectie uitdagen. Door het systematisch in kaart brengen van deze gebreken en het testen van tools zoals BugReAct, hopen de onderzoekers de weg vrij te maken voor betrouwbaardere intelligente applicaties.