Er is een aanzienlijk verschil vastgesteld tussen de instructies in natuurlijke taal die ontwikkelaars gebruiken om AI-agenten aan te sturen en de technische mechanismen die deze acties daadwerkelijk kunnen blokkeren. Uit recent onderzoek blijkt dat beveiligingsregels die in de vorm van "do not"-instructies worden geformuleerd, vaak geen ondersteuning vinden in de ingebouwde beveiligingssystemen van de software.
Interpretatie versus technische handhaving
In een studie die op 24 augustus 2026 werd gepubliceerd via arxiv.org, wordt het onderscheid geanalyseerd tussen instructies die door een model moeten worden geïnterpreteerd en harde controles. Wanneer een ontwikkelaar in een CLAUDE.md-bestand specificeert dat een AI bepaalde handelingen niet mag verrichten, vertrouwt dit proces op de naleving door het taalmodel. Dit verschilt fundamenteel van de 'deny'-functie binnen Claude Code, waarbij een technische barrière een actie blokkeert voordat de agent deze kan uitvoeren.
Hoewel beide methoden hetzelfde doel dienen, is de effectiviteit verschillend: de ene methode is afhankelijk van de interpretatie van de AI, terwijl de andere een harde technische blokkade opwerpt.
Beperkte effectiviteit in de praktijk
De onderzoeker Ting Yan heeft dit fenomeen onderzocht door 481 openbare CLAUDE.md-bestanden te analyseren. De regels uit deze bestanden werden vergeleken met de gedocumenteerde controles van Claude Code. Om de validiteit van de resultaten te waarborgen, hebben twee onafhankelijke beveiligingsexperts een steekproef gecontroleerd zonder voorafgaande kennis van de antwoorden van het model, zoals beschreven in de .
De resultaten wijzen op een zorgwekkende kloof. Afhankelijk van de gehanteerde striktheid bleek dat slechts 4% tot 16% van de beveiligingsregels een bijbehorende technische controle had. Bij de meest strikte norm lag dit percentage zelfs op 4,4%, met een betrouwbaarheidsinterval tussen 2,6% en 6,7%. De annotatoren waren het overigens consistent eens over welke regels daadwerkelijk overeenkwamen met de technische controles.
Het risico van een 'write-only' kanaal
Het onderzoek concludeert dat er sprake is van een substantieel beveiligingsprobleem. De auteur bestempelt CLAUDE.md als een "write-only channel". Dit houdt in dat ontwikkelaars wel regels kunnen vastleggen, maar geen feedback ontvangen over de vraag of een technische controle deze regels ook daadwerkelijk afdwingt.
Dit creëert een risicovolle situatie waarin twee verschillende soorten regels in dezelfde tekstvorm voorkomen: regels die via een permissieregel, specifieke modus of sandbox kunnen worden afgedwongen, en regels die volledig afhankelijk zijn van de interpretatie van het taalmodel. Volgens de is het vertrouwen op natuurlijke taal voor kritieke beperkingen daarom riskant.
Context en implementatie
Terwijl gebruikers via het claude.com informatie kunnen vinden over algemene accountfuncties en sessiebeheer, tonen deze specifieke bevindingen aan dat de configuratie van beveiliging in lokale bestanden risico's met zich meebrengt. De handmatige review in het onderzoek bevestigde dat de extractiemethode ongeveer 66,3% van de relevante regels wist te identificeren, wat aantoont dat de lage percentages van matching controls representatief zijn voor de onderzochte data.