⚠️ KMI waarschuwing: Onweer in Noordwest-België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
Risico op informatielekken via logits in vision-language modellen

Risico op informatielekken via logits in vision-language modellen

Onderzoekers hebben een potentieel beveiligingslek in kunstmatige intelligentie-modellen geïdentificeerd waarbij gevoelige data kan ontsnappen via de interne processen van het systeem. Hoewel de uiteindelijke antwoorden van een AI-model vaak gefilterd worden, blijkt dat de zogenaamde 'logits' — de ruwe scores die voorafgaan aan de definitieve output — informatie kunnen bevatten die niet direct zichtbaar is voor de gebruiker.

In een wetenschappelijke publicatie getiteld arxiv.org waarschuwen auteurs voor de risico's van onbedoelde informatielekken. Door middel van een techniek die bekendstaat als 'probing' kunnen kwaadwillenden interne representaties analyseren om gegevens te achterhalen die door de eigenaar van het model als ontoegankelijk werden beschouwd. Dit proces maakt het mogelijk om informatie te extraheren die het model intern wel verwerkt, maar die niet expliciet in de tekstuele reactie wordt geformuleerd.

Analyse van bottlenecks en datastromen

Het onderzoek, uitgevoerd door een team bestaande uit Masha Fedzechkina, Eleonora Gualdoni, Rita Ramos en Sinead Williamson, richtte zich specifiek op vision-language modellen. De wetenschappers bestudeerden hoe informatie wordt gecomprimeerd terwijl deze door het model stroomt. Hierbij werden twee specifieke 'bottlenecks' of knelpunten onderzocht: de laag-dimensionale projecties van de residual stream (verkregen via een 'tuned lens') en de uiteindelijke top-k logits.

De kern van de problematiek is dat informatie die niet relevant is voor de specifieke taak van het model, toch bewaard blijft in deze lagen. Volgens de bevindingen op kunnen zelfs de meest toegankelijke bottlenecks, zoals de top logit-waarden, taak-irrelevantie informatie lekken uit een query die is gebaseerd op een afbeelding. Dit betekent dat de beveiliging van AI-modellen complexer is dan enkel het bewaken van de uiteindelijke tekstuele output.

Privacyrisico's en eigenaarschap

De resultaten suggereren dat de informatie die via logits lekt, in sommige gevallen net zo uitgebreid kan zijn als de data die uit de volledige residual stream wordt geprojecteerd. Dit vormt een aanzienlijk risico voor de privacy, aangezien gevoelige data potentieel kan worden geëxtraheerd zonder dat het model dit expliciet communiceert. De publicatie, waarvan de laatste revisie op 5 oktober 2026 verscheen, benadrukt dat inzicht in wat deze interne lagen 'weten' cruciaal is voor het waarborgen van de gegevensprivacy bij publiek toegankelijke modellen.

Naast de technische aspecten roept dit onderzoek vragen op over de controle over informatie. Terwijl de output van een model strikt wordt beheerd, blijven de onderliggende logits vaak minder streng bewaakt. Dit raakt aan het concept van bezit en toegang. In een bredere context wordt het bezit van iets, zoals beschreven in de definitions.net, doorgaans gekoppeld aan een specifieke eigenaar. In de wereld van AI rijst echter de vraag in hoeverre een eigenaar de interne 'kennis' van een model effectief kan afschermen tegen externe toegang.

Het rapport, dat is gecategoriseerd onder Artificial Intelligence (cs.AI) op , biedt een systematische vergelijking van informatiebehoud op verschillende representatieniveaus. De conclusies dwingen ontwikkelaars van vision-language modellen om kritischer te kijken naar de manier waarop interne data wordt blootgesteld aan eindgebruikers om toekomstige lekken te voorkomen.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!