Een nieuwe analyse van twee leden van de OWASP-werkgroep laat zien dat de rangschikking van beveiligingsrisico's voor Large Language Models (LLM), gebaseerd op expert-opinies, slechts beperkt overeenstemt met de feitelijke data uit geregistreerde incidenten.
In een recent gepubliceerd onderzoek op arxiv.org hebben Kyriakos "Rock" Lambros en Steve Wilson de robuustheid van de OWASP Top 10 voor LLM-applicaties (editie 2026) onderzocht. Het doel van de studie was om te bepalen of de risico's die door een gemeenschap van beveiligingsexperts als het meest kritiek worden beschouwd, ook daadwerkelijk het meest voorkomen in de praktijk.
Analyse van incidentdata
Om deze vraag te beantwoorden, stelden de onderzoekers een grootschalig corpus samen van LLM-beveiligingsincidenten. Dit corpus bestond uit 7.714 snapshots, waarvan 6.639 werden gelabeld aan de hand van een taxonomie met 20 categorieën. De data voor dit onderzoek werden verzameld uit verschillende bronnen, waaronder CVE, GHSA, OSV en AIAAIC, zoals beschreven in de .
Om een nauwkeurige rangschikking op basis van incidenten te verkrijgen, maakten de auteurs gebruik van een Bayesiaans meetfoutmodel. Dit model corrigeert de aantallen per categorie op basis van de precisie en recall van de gebruikte classifiers.
Beperkte overeenstemming
De resultaten van de analyse tonen een zwakke overeenstemming tussen de ranglijst van de experts en de feitelijke incidentdata. De onderzoekers rapporteerden een Cohen's $\kappa$ van ongeveer 0,20, waarbij het 90%-interval zelfs de nul passeert. Ondanks deze zwakke correlatie concluderen de auteurs dat de expert-rangschikking desondanks robuust blijft.
Voor de kandidaatlijst van 2026 is gekozen voor een gewogen benadering: 75% van de score is gebaseerd op de stemmen van experts en 25% op de incidentdata. Op deze manier kan de data de consensus van de experts corrigeren zonder deze volledig omver te werpen.
Context van OWASP en AI-beveiliging
De Open Web Application Security Project (OWASP) is een wereldwijde non-profit gemeenschap die zich richt op het verbeteren van de beveiliging van softwareapplicaties. Volgens informatie van geeksforgeeks.org publiceert de organisatie doorgaans elke drie tot vier jaar een lijst met de belangrijkste webapplicatierisico's op basis van ernst, impact en frequentie.
Naast de algemene Top 10 richt OWASP zich steeds meer op specifieke AI-risico's. Zo is er via het OWASP Gen AI Security Project een Top 10 voor Agentic Applications voor 2026 ontwikkeld. Dit raamwerk is bedoeld voor autonome AI-systemen die beslissingen nemen in complexe workflows en is ontwikkeld in samenwerking met meer dan 100 experts en onderzoekers.
Status van het onderzoek
De auteurs benadrukken dat hun analyse een exploratief onderzoek is door twee leden van de werkgroep en geen officiële publicatie van OWASP betreft. De analyse vond plaats vóór de officiële publicatie van de OWASP GenAI LLM Top 10 2026 in augustus 2026. Het onderzoek is daarom niet bedoeld om de officiële lijst of het vastgestelde proces van de organisatie te vervangen, zoals vermeld in de .
In de bredere context van AI-beveiliging blijft OWASP diverse middelen aanbieden, waaronder een Red Teaming Taxonomy en rapporten over de staat van agentische AI-beveiliging en governance, die beschikbaar zijn via de officiële OWASP-website.