Wetenschappers hebben een nieuwe methode ontdekt waarmee systemen voor Retrieval-Augmented Generation (RAG) doelgericht kunnen worden misleid. De aanval, die bekendstaat als RAG-NAROK, maakt gebruik van specifieke weerleggingen van bronnen om taalmodellen naar onjuiste conclusies te sturen. In een publicatie van 21 september 2026 op arxiv.org leggen Abdullahil Kafi en Alvi Ataur Khalil uit hoe deze vorm van 'knowledge corpus poisoning' werkt.
Om de impact van deze ontdekking te begrijpen, is het essentieel om te weten hoe RAG-systemen functioneren. In plaats van enkel te vertrouwen op de data waarmee een model is getraind, koppelt deze techniek een groot taalmodel aan externe informatiebronnen. Volgens geeksforgeeks.org is het hoofddoel van deze aanpak het verhogen van de feitelijke juistheid en het beperken van hallucinaties door actuele data uit externe databases te integreren.
Het technische proces verloopt in verschillende stappen. Een gebruikersvraag wordt eerst omgezet in een numerieke vector, waarna een retriever de meest relevante tekstfragmenten uit een database selecteert. Deze informatie wordt vervolgens aan het taalmodel gevoerd om een antwoord te formuleren. Zoals uiteengezet in de documentatie van langchain.com, stelt dit AI-systemen in staat om gebruik te maken van gespecialiseerde of private data zonder dat er een tijdrovend hertrainingsproces van het model nodig is.
De RAG-NAROK-methode wijkt af van traditionele aanvallen op kennisbanken. Waar oudere methoden vaak bestonden uit het simpelweg toevoegen van foutieve documenten in de hoop dat deze worden opgehaald, is RAG-NAROK dynamisch. De aanval identificeert eerst welke legitieme bronnen het systeem raadpleegt. Vervolgens worden er zogenaamde 'Anchor-Specific Refutation'-documenten gecreëerd. Dit zijn teksten die expliciet betrouwbare bronnen bij naam noemen en hun geloofwaardigheid ondermijnen. Door in te spelen op algoritmische voorkeuren, zoals de prioriteit voor recente informatie, dwingt de aanval het model om correcte data te negeren ten gunste van de door de aanvaller gewenste informatie.
De kwetsbaarheid ligt in de manier waarop de retrieval- en generatieve componenten met elkaar communiceren. In een standaard geeksforgeeks.org worden relevante tekstpassages verzameld en samengevoegd in de decoder of encoder van het model. RAG-NAROK vervuilt dit proces door de contextwindow van de generator te vullen met tegenstrijdige informatie die strategisch is opgebouwd om de legitieme feiten te overstemmen.
Uit het onderzoek blijkt dat deze dynamische aanpak aanzienlijk effectiever is dan statische methoden in diverse domeinen. Dit brengt een kritiek risico aan het licht voor sectoren zoals de medische of juridische wereld, waar RAG juist wordt ingezet om fouten te minimaliseren. De externe bronnen die bedoeld zijn als waarborg voor betrouwbaarheid, kunnen hiermee doelgericht worden gesaboteerd.