← Terug
NEXUS: Nieuw veiligheidssysteem voor LLM-agents met tool-gebruik

NEXUS: Nieuw veiligheidssysteem voor LLM-agents met tool-gebruik

Onderzoekers hebben NEXUS ontwikkeld, een geavanceerde monitor die in realtime de acties van Large Language Model (LLM) agents controleert om risicovolle handelingen te voorkomen of te matigen.

Nu AI-agents steeds vaker autonome tools gebruiken om acties met een grote impact uit te voeren, groeit de noodzaak voor robuuste veiligheidsmechanismen tijdens de uitvoering. In een recent gepubliceerd onderzoek op arxiv.org presenteren Elias Hossain en collega's NEXUS (Neural EXecution Utility and Safety). Dit systeem fungeert als een veiligheidslaag die het gestructureerde plan van een agent onderschept voordat een tool daadwerkelijk wordt geactiveerd.

Een gelaagde interventiestrategie

In tegenstelling tot traditionele veiligheidsfilters die vaak een binaire keuze maken (toestaan of blokkeren), hanteert NEXUS een genuanceerde aanpak. Volgens berichtgeving van theaicronicle.com maakt het systeem gebruik van een vierdelige interventiepolicy. Afhankelijk van het risicoprofiel van een actie kan NEXUS kiezen uit de volgende opties:
* Allow: De actie wordt direct toegestaan.
* Block: De actie wordt volledig tegengehouden.
* Confirm: Er wordt om bevestiging gevraagd aan de gebruiker.
* Revise: Er wordt verzocht om het plan aan te passen.

Technische werking en componenten

De kracht van NEXUS ligt in de combinatie van deterministische regels en machine learning. Zoals beschreven op de officiële projectpagina op github.io, bestaat het systeem uit vier complementaire componenten:

  1. Deterministische regels: Negen specifieke regels die controleren op zaken als budgetlimieten, onomkeerbare acties, netwerkuitgangen en ongeautoriseerde toegang.
  2. Argument Inspector: Deze scant de argumenten van een tool-aanroep op gevoelige gegevens, zoals inloggegevens, verdachte URL's of toegang tot beveiligde tabellen.
  3. Calibrated Risk Score: Een logistische regressie die een risicoscore tussen 0 en 1 toekent op basis van een 9-dimensionale feature-vector.
  4. Session Manager: Deze houdt de staat over meerdere interacties bij om escalaties in risico over verschillende stappen heen te detecteren.

De risicoscore wordt specifiek geoptimaliseerd via Platt-scaling om de betrouwbaarheid van de voorspellingen te verhogen. Details over dit model, waaronder de risk_scorer.pkl, zijn publiekelijk beschikbaar gesteld via huggingface.co.

Prestaties en efficiëntie

De effectiviteit van NEXUS is getest op diverse benchmarks. Op een synthetische dataset behaalde het systeem een F1-score van 0,949. Opvallend is dat de nauwkeurigheid van de interventies met 27,3 procentpunten steeg ten opzichte van systemen die enkel op regels vertrouwen. Ook op de externe R-Judge benchmark presteerde NEXUS beter (F1 = 0,861 tegenover 0,849 voor regel-gebaseerde systemen).

Een cruciaal aspect voor praktische implementatie is de snelheid. De mediane latentie van NEXUS bedraagt slechts 0,205 milliseconden, wat betekent dat de overhead op de totale loop van een AI-agent minder dan 0,1% bedraagt.

Open Source en beschikbaarheid

Om verdere ontwikkeling in de AI-veiligheidsgemeenschap te stimuleren, hebben de auteurs de volledige code, de benchmarks en de gekalibreerde risicoscorer open source gemaakt. De broncode is toegankelijk via de github.com, waar ook documentatie over de implementatie en de gebruikte datasets te vinden is.

Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!