Onderzoekers hebben SENTINEL ontwikkeld, een nieuw systeem dat de fysieke veiligheid van robots die worden aangestuurd door grote taalmodellen (Foundation Models) op meerdere niveaus formeel kan evalueren.
De integratie van zogenaamde foundation models (FM) in fysieke agenten, zoals robots, biedt enorme mogelijkheden voor autonomie, maar brengt ook aanzienlijke risico's met zich mee op het gebied van fysieke veiligheid. Om deze risico's te beheersen, is een team van wetenschappers onder leiding van Simon Sinong Zhan een framework genaamd SENTINEL ontwikkeld. Dit systeem is ontworpen om de veiligheid van deze agenten systematisch te toetsen in gesimuleerde fysieke omgevingen.
Een breuk met heuristiek en subjectiviteit
Traditionele methoden om de veiligheid van AI-agenten te beoordelen leunen vaak op subjectieve oordelen van andere AI-modellen of op eenvoudige heuristieke regels. Volgens de publicatie op arxiv.org wijkt SENTINEL hiervan af door gebruik te maken van formele temporele logica (TL).
Door veiligheidseisen te vertalen naar TL-semantiek, kan het systeem met wiskundige precisie specificaties vastleggen. Dit omvat onder andere state-invarianten, tijdsafhankelijke relaties en strikte timingbeperkingen. Hierdoor is het mogelijk om objectief vast te stellen of een robot zich aan de veiligheidsvoorschriften houdt, in plaats van te vertrouwen op een interpretatie van een taalmodel.
Drielaagse verificatiepijplijn
Het SENTINEL-framework hanteert een gelaagde aanpak om veiligheidslekken in verschillende fasen van de actiecyclus te detecteren. Deze pijplijn bestaat uit drie specifieke niveaus:
- Het semantische niveau: In deze eerste fase worden intuïtieve veiligheidseisen in natuurlijke taal omgezet in formele TL-formules. Het systeem controleert vervolgens of het begrip van de AI-agent overeenstemt met deze formele definities.
- Het planningsniveau: Voordat een actie wordt uitgevoerd, worden de gegenereerde plannen en subdoelen van de agent getoetst aan de TL-formules. Dit stelt het systeem in staat om onveilige plannen te identificeren en te blokkeren voordat ze in de fysieke wereld worden omgezet.
- Het trajectniveau: Tijdens de uitvoering worden meerdere trajecten samengevoegd in een zogenaamde computation tree. Deze wordt vervolgens gecontroleerd tegen gedetailleerde fysieke TL-specificaties voor een definitieve veiligheidscheck.
Testresultaten in virtuele omgevingen
Om de effectiviteit van het framework aan te tonen, hebben de onderzoekers SENTINEL toegepast in de simulatieomgevingen VirtualHome en AI2-THOR. In deze omgevingen werden diverse FM-gebaseerde agenten getest tegen een breed scala aan veiligheidseisen.
De resultaten, zoals beschreven in de , tonen aan dat de methode effectief is in het blootleggen van veiligheidsschendingen. Deze fouten traden op tijdens het interpreteren van instructies, het plannen van acties en de uiteindelijke uitvoering van taken.
Context van systeemmonitoring
Hoewel SENTINEL zich richt op de logische en fysieke veiligheid van autonome agenten, is het bredere veld van systeemmonitoring essentieel voor de betrouwbaarheid van hardware. Zo richt software zoals hdsentinel.com zich op een ander type veiligheid: het monitoren van de gezondheid van opslagmedia zoals SSD's en HDD's om dataverlies te voorkomen. Waar SENTINEL zich bezighoudt met de correctheid van acties van een AI, focussen tools zoals die van op de integriteit van de hardware waarop dergelijke systemen draaien.
De ontwikkeling van SENTINEL markeert een stap richting een rigoureuzere standaard voor de inzet van AI in de fysieke wereld, waarbij formele verificatie de overhand krijgt boven probabilistische schattingen. De volledige details van het onderzoek zijn terug te vinden in de versie v3 van de publicatie op .