Onderzoekers hebben CS-Guard ontwikkeld, de eerste systematische benchmark om de effectiviteit van beveiligingsfilters (guardrails) bij het genereren van computercode door grote taalmodellen (LLM's) te evalueren. De resultaten tonen aan dat huidige beveiligingsmaatregelen vaak onvoldoende bescherming bieden tegen het genereren van malware.
De risico's van kunstmatige intelligentie bij het schrijven van software staan centraal in een nieuw onderzoek dat op 9 september 2026 is gepubliceerd. In de publicatie arxiv.org leggen Jinyang Li, Mingyu Guo en Hung X. Nguyen van de Adelaide University bloot hoe kwetsbaar huidige taalmodellen zijn voor kwaadaardige instructies, ondanks de aanwezigheid van beveiligingsmechanismen.
Systematische evaluatie van beveiligingsfilters
Het doel van CS-Guard is om een gestandaardiseerde methode te bieden voor het testen van zogenaamde 'guardrails'. Dit zijn de filters die bedoeld zijn om te voorkomen dat een AI-model schadelijke content produceert. Volgens de beschrijving op aipapers.ai helpt dit raamwerk organisaties en ontwikkelaars om de veiligheidsrisico's van AI-gestuurde codegeneratie beter in te schatten en de juiste mitigatietechnieken te selecteren.
De benchmark is opgedeeld in twee hoofdcategorieën:
1. Text-to-code generatie: Hierbij worden 1.000 prompts van hoge kwaliteit gebruikt die gericht zijn op het genereren van malware. De onderzoekers testten zeven verschillende 'jailbreak'-aanvallen en introduceerden een nieuwe methode: de Fictional Scenario Attack (FSA). Bij deze aanval wordt de kwaadaardige intentie verborgen in een schijnbaar legitiem scenario van softwareontwikkeling.
2. Code-to-code generatie: Deze test omvat 331 prompts die gericht zijn op code-aanvulling (completion), het invullen van ontbrekende delen (infilling) en codevertaling.
Alarmerende resultaten
De empirische evaluatie van negen verschillende guardrails over zeven LLM's laat een zorgwekkend beeld zien. Zo blijkt uit de data op papers.cool dat de gemiddelde Attack Success Rate (ASR) bij text-to-code generatie na jailbreak-pogingen voor veel guardrails rond de 50% ligt.
Nog kritieker zijn de resultaten voor code-to-code generatie. Bij basismodellen zonder extra beveiliging nadert de ASR de 100%. Zelfs met actieve guardrails blijft het succespercentage van aanvallen hoog, variërend van 14,4% tot bijna 100%. Vooral de nieuwe FSA-methode bleek zeer effectief, met een succespercentage dat bij veel beveiligingsfilters dicht bij de 100% ligt. De auteurs stellen dat dit grote betrouwbaarheidsproblemen veroorzaakt voor softwareontwikkeling in de praktijk.
Structuur en toekomstperspectief
Om toekomstig onderzoek te faciliteren, maakt CS-Guard gebruik van een modulaire taxonomie van beveiligingsfilters bestaande uit drie lagen. Hierdoor kunnen ontwikkelaars hun eigen guardrails registreren en laten evalueren binnen het systeem. De volledige benchmark en de bijbehorende data zijn publiekelijk vrijgegeven om verdere evaluatie door de gemeenschap mogelijk te maken.
Hoewel er eerder frameworks zijn voorgesteld om codebeveiliging te verbeteren, zoals arxiv.org uit 2024 dat statische code-analyzers combineert met LLM's, richt CS-Guard zich specifiek op het systematisch benchmarken van de filters zelf. De resultaten onderstrepen de noodzaak voor robuustere beveiligingsmechanismen nu AI-modellen steeds vaker worden geïntegreerd in professionele ontwikkelomgevingen.