Binnen de wereld van digitale beveiliging vormen enorme hoeveelheden diverse data een groeiende uitdaging voor analisten. De constante stroom aan informatie leidt vaak tot een overvloed aan meldingen, wat resulteert in mentale vermoeidheid en een hoge tijdsdruk bij het nemen van cruciale beslissingen. Hoewel grote taalmodellen (LLM's) potentieel kunnen bieden bij het beantwoorden van technische vragen, kampen deze systemen vaak met een gebrek aan specifieke domeinkennis en de neiging om onjuiste feiten te genereren.
Om deze tekortkomingen aan te pakken, hebben onderzoekers Ali Habibzadeh, Farid Feyzi en Reza Ebrahimi Atani een nieuw framework ontwikkeld genaamd MITRE-SAGE. Volgens een wetenschappelijke publicatie op arxiv.org maakt dit systeem gebruik van een geavanceerde aanpak waarbij meerdere agenten samenwerken via 'retrieval-augmented generation' (RAG). In plaats van te vertrouwen op één enkel model, verdeelt MITRE-SAGE complexe vraagstukken over drie verschillende fasen: de interpretatie van de vraag, het verzamelen van bewijslast en de uiteindelijke samenvoeging van het antwoord.
Het systeem is specifiek ontworpen om zowel structurele als semantische kennis over cybersecurity te integreren. Dit proces verhoogt de betrouwbaarheid van de output en maakt de antwoorden beter interpreteerbaar. De onderzoekers stellen in hun rapport op dat het model bijzonder effectief is bij het analyseren van dreigingsprofielen, het evalueren van kwetsbaarheden en het in kaart brengen van verbanden.
Om de prestaties van MITRE-SAGE objectief te kunnen meten, hebben de auteurs daarnaast de MITRE-QA benchmark ontwikkeld. Deze dataset bevat 3.000 specifieke vraag-antwoordparen die bedoeld zijn om LLM's te testen op diverse taken binnen het domein van cybersecurity. Door het model te vergelijken met standaard LLM's en traditionele RAG-methoden, konden de onderzoekers de meerwaarde van hun architectuur aantonen.
Een opvallende bevinding uit de tests is dat de structuur van het systeem belangrijker blijkt dan de pure rekenkracht of omvang van het model. Een configuratie met relatief kleine sub-agenten (Qwen2.5-7B) en een orchestrator (Qwen2.5-14B) presteerde namelijk beter op vijf van de acht geteste taken dan zwaardere, traditionele benaderingen. Dit wijst erop dat een slimme verdeling van taken over gespecialiseerde agenten effectiever is voor de nauwkeurigheid dan het simpelweg vergroten van het taalmodel.
De implementatie van dergelijke systemen sluit aan bij bredere inspanningen om de digitale weerbaarheid te vergroten. Organisaties zoals mitre.org richten zich in hun expertisegebieden op het verbeteren van de cybersecurity-infrastructuur, waarbij gestructureerde kennis essentieel is voor het detecteren van dreigingen. De integratie van deze kennisstructuren in MITRE-SAGE helpt om de druk op menselijke experts te verlagen door informatie efficiënter te filteren.
Met de introductie van zowel het MITRE-SAGE framework als de MITRE-QA benchmark is er nu een gestandaardiseerde basis voor verder onderzoek naar AI-gestuurde beveiligingsoplossingen. De volledige technische details en de resultaten van de experimenten zijn terug te vinden in de documentatie op , wat bijdraagt aan de transparantie en reproduceerbaarheid van dit onderzoek naar betrouwbare vraag-beantwoording in de sector.