Wetenschappers hebben een innovatieve methode ontwikkeld om de privacy van gebruikers te waarborgen wanneer zij gebruikmaken van Retrieval-Augmented Generation (RAG) via externe Large Language Models (LLM's). De nieuwe techniek voorkomt dat gevoelige informatie direct toegankelijk is voor de partijen die de taalmodellen beheren.
In een publicatie van 13 augustus 2026, beschikbaar via arxiv.org, leggen onderzoekers uit dat er een aanzienlijk privacyrisico bestaat bij huidige RAG-architecturen. Hoewel veel aandacht uitgaat naar het beveiligen van de toegang tot data voor onbevoegden, wordt de rol van de externe generator vaak over het hoofd gezien. Wanneer een systeem relevante documenten ophaalt om een vraag te beantwoorden, krijgt de externe LLM volledige inzage in zowel de query als de bijbehorende documenten. Dit betekent dat private gegevens onbedoeld worden gedeeld met externe providers.
Om dit lek te dichten, hebben Saleh Almohaimeed en zijn collega's het Sensitive Entity Alias Generator (SEAG) framework geïntroduceerd. Volgens de beschrijving in de stelt dit systeem gebruikers in staat om de rekenkracht van externe generatoren te benutten zonder hun vertrouwelijke data prijs te geven.
Het SEAG-framework werkt via een lichtgewicht model dat een proces van drie stappen doorloopt. Allereerst vindt er lokalisatie plaats, waarbij gevoelige entiteiten in de vraag en de documenten worden geïdentificeerd. Vervolgens genereert het systeem voor elke entiteit een alias, een vervangende term. Ten slotte wordt een vervangingstabel opgesteld waarin de oorspronkelijke woorden en hun aliassen worden gekoppeld. De externe generator ontvangt enkel de geanonimiseerde tekst.
De effectiviteit van deze methode is getest met behulp van twee speciaal geconstrueerde datasets. De resultaten tonen aan dat de 'User metric' — de maatstaf voor het leveren van een correct antwoord terwijl de data verborgen blijft — bij alle geteste SEAG-modellen een nauwkeurigheid van boven de 80% behaalde. Specifieke modellen vertoonden verschillende prestaties bij het maskeren van entiteiten: Qwen-3 scoorde 77,83%, LLaMA-3.2 behaalde 76,73% en Phi-4 kwam uit op 74,91%, zoals vermeld in de .
Deze technische oplossing biedt een extra beveiligingslaag die onafhankelijk is van juridische afspraken. Hoewel grote technologiebedrijven in hun beleid vaak nadruk leggen op gegevensbescherming en gebruikerscontrole, zoals beschreven in de google.com, zorgt SEAG ervoor dat data simpelweg onherkenbaar is voordat deze de lokale omgeving verlaat.
Het onderzoek naar het SEAG-framework is ingediend bij het Knowledge-Based Systems Journal en is gecategoriseerd onder Artificiële Intelligentie en Cryptografie & Beveiliging.