Wetenschappers hebben een ernstig beveiligingslek blootgelegd in de infrastructuur van AI-agenten. De kwetsbaarheid bevindt zich in zogenaamde 'AI agent harnesses', systemen die autonome agenten in staat stellen om acties op een besturingssysteem uit te voeren. Door misbruik te maken van specifieke configuratiebestanden kunnen kwaadwillenden volledige controle over het host-systeem overnemen.
Het probleem draait om het gebruik van lifecycle hooks. Dit zijn mechanismen die shell-commando's koppelen aan gebeurtenissen tijdens de runtime, zoals het starten van een sessie of het bewerken van bestanden. Volgens een publicatie op arxiv.org worden deze commando's uitgevoerd met de privileges van de host, terwijl ze simpelweg als configuratiegegevens worden verzonden. Hierdoor ontstaat een gevaarlijke situatie waarbij het systeem blind vertrouwt op het updatepad van deze hooks.
In een scenario van een supply-chain aanval kan een actor die enkel toegang heeft tot de metadata en configuratie van een plugin, een veilige tool transformeren in een 'trojan'. Omdat deze updates op de achtergrond plaatsvinden, blijft het Large Language Model (LLM) onwetend over de kwaadaardige activiteiten. Dit opent de deur naar privilege-escalatie, waarbij de aanvaller ongeautoriseerde, hogere toegangsrechten op de machine verkrijgt.
Om de ernst van deze zwakheid aan te tonen, hebben onderzoekers Pengxun Li en Litian Zhang het framework HookPry ontwikkeld. Dit open-source instrument automatiseert aanvallen op diverse AI-agent-omgevingen. Zoals beschreven via arxivtldr.org, is HookPry in staat om tien verschillende aanvalsdoelstellingen succesvol te realiseren.
De testresultaten schetsen een zorgwekkend beeld. Tijdens 1.000 end-to-end runs over 25 combinaties van harnesses en backends werden alle zeven geëvalueerde systemen gecompromitteerd. De succesrate per harness bereikte in sommige gevallen zelfs 92,5%, wat aantoont dat de aanval breed effectief is over verschillende architecturen heen.
Bovendien blijkt de huidige beveiligingssoftware onvoldoende bestand tegen deze methode. Uit gegevens van het wetenschappelijke artikel op acadeus blijkt dat Microsoft Defender een 'recall' van 0% scoorde, wat betekent dat geen enkele kwaadaardige poging werd gedetecteerd. Zelfs bij het combineren van drie verschillende statische verdedigingsmethoden bleef bijna de helft (47,5%) van de kwaadaardige artefacten onopgemerkt.
Deze bevindingen onderstrepen de noodzaak voor een strengere controle van de toeleveringsketens bij AI-agenten. Terwijl platforms zoals lmmarketcap.com zich vaak richten op de prestaties en benchmarks van nieuwe modellen, waarschuwen deze onderzoekers dat de fundamentele infrastructuur van agent-harnesses momenteel een onaanvaardbaar risico vormt. De overgang van passieve chatbots naar actieve, autonome agenten vereist een fundamentele herziening van hoe configuratiebestanden worden gevalideerd om systeemovernames via legitieme plugins te voorkomen.