← Terug
Kwetsbaarheid ontdekt in gedeelde representaties van Graph Foundation Models

Kwetsbaarheid ontdekt in gedeelde representaties van Graph Foundation Models

Onderzoekers hebben een significante zwakke plek blootgelegd in Graph Foundation Models (GFM's), waarbij de zogenaamde 'alignment layer' een nieuw doelwit vormt voor cyberaanvallen. Door specifieke verstoringen aan te brengen in de gedeelde representatieruimte, kunnen deze modellen effectief worden uitgeschakeld.

In een recent wetenschappelijk onderzoek, gepubliceerd op het preprint-platform arxiv.org, beschrijven auteurs Pankaj Kumar en Subhankar Mishra hoe Graph Foundation Models kunnen worden aangevallen tijdens de inferentiefase. De kern van het probleem ligt in de manier waarop deze modellen generaliseren over verschillende grafiekdomeinen. Om dit te bereiken, maken GFM's gebruik van een gedeelde representatie, waarbij elke input via een specifieke laag — de alignment layer — wordt omgezet voordat er sprake is van taakgerichte redenering.

De alignment layer als aanvalsoppervlak

Volgens de publicatie op is deze alignment layer het cruciale onderdeel dat een foundation model onderscheidt van een traditioneel Graph Neural Network (GNN). De onderzoekers stellen dat deze laag een uniek aanvalsoppervlak vormt dat in eerder onderzoek tot nu toe is genegeerd.

Tijdens hun experimenten richtten de onderzoekers zich op zes publiek beschikbare modellen. Deze modellen maken gebruik van uiteenlopende technieken, waaronder spectrale tokenizers, tekst-embeddingruimtes en discrete codebooks. De resultaten tonen aan dat een gerichte verstoring in de representatieruimte in staat is om elk van deze modellen te laten instorten.

Specifieke fragiliteit van OpenGraph

Een opvallende bevinding in het onderzoek is de extreme gevoeligheid van het model OpenGraph. Terwijl de meeste modellen een budget voor verstoringen nodig hebben dat vergelijkbaar is met dat van een standaard grafieknetwerk, stort de spectrale tokenizer van OpenGraph al in bij een budget dat slechts een vijfde van dat bedrag bedraagt.

De auteurs van het artikel op concluderen dat deze specifieke fragiliteit direct gekoppeld is aan de alignment layer en niet aanwezig is in eenvoudige netwerken. Door gebruik te maken van een controlemechanisme met dezelfde representatie, konden de onderzoekers herleiden dat de zwakte in de tokenizer ligt en niet in de decoder.

Impact op de praktijk: Input-space aanvallen

Naast theoretische verstoringen in de representatieruimte, hebben Kumar en Mishra ook gekeken naar realiseerbare aanvallen in de inputruimte. Hierbij worden concrete wijzigingen aangebracht in de randen (edges), kenmerken (features) of de tekst van de grafieken.

De resultaten van deze praktijktesten zijn zorgwekkend: bij drie van de zes geteste modellen ging minstens de helft van de correcte voorspellingen verloren op het piekpunt van de aanval. Het onderzoek benadrukt dat de mate waarin een aanvaller deze fragiliteit kan exploiteren, afhangt van hoe direct de decoder de representatie uitleest. De onderzoekers meten dit via de lokale Lipschitz-gevoeligheid van de decoder.

Conclusie en wetenschappelijke context

Het onderzoek is ingediend onder de categorieën Artificiële Intelligentie, Cryptografie en Beveiliging, en Machine Learning op . De bevindingen suggereren dat de huidige focus op 'clean accuracy' (de nauwkeurigheid bij schone data) als maatstaf voor robuustheid misleidend is, aangezien deze heuristiek niet standhoudt bij realiseerbare aanvallen.

Door aan te tonen dat de gedeelde representatie van GFM's een zwak punt is, dwingen de onderzoekers de AI-gemeenschap om kritischer te kijken naar de architectuur van alignment layers. De publicatie, die op 20 juli 2026 werd ingediend via , dient als waarschuwing voor ontwikkelaars van foundation models die streven naar domein-overstijgende generalisatie zonder gelijktijdige beveiliging van de representatielaag.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!