← Terug
Populaire kennis in taalmodellen blijkt kwetsbaar voor fouten bij updates

Populaire kennis in taalmodellen blijkt kwetsbaar voor fouten bij updates

Onderzoekers hebben ontdekt dat veelvoorkomende feiten in grote taalmodellen (LLM's) paradoxaal genoeg gevoeliger zijn voor corruptie wanneer het model wordt bijgewerkt. Terwijl minder bekende feiten vaak moeilijker aan te leren zijn, blijken juist de meest verbonden feiten sneller foutief te worden na nieuwe trainingen.

Het up-to-date houden van de kennis van een taalmodel via fine-tuning is een essentieel proces om de output relevant te houden. Dit proces brengt echter risico's met zich mee, zoals het vergeten van bestaande feiten of het ontstaan van nieuwe hallucinaties. In een recent onderzoek, gepubliceerd op arxiv.org, is specifiek gekeken naar welke feiten het meest kwetsbaar zijn voor deze zogenaamde 'collateral corruption' wanneer een model al over de juiste informatie beschikt.

De rol van structurele populariteit

In tegenstelling tot eerdere studies die zich richtten op 'long-tail knowledge' — zeldzame feiten die moeilijk te verwerven en te behouden zijn — richt dit nieuwe onderzoek zich op de feiten die een model al correct beheerst. De onderzoekers, waaronder Yuji Zhang en Weibing Wang, hebben hiervoor een grootschalige graaf genaamd FACTPROP ontwikkeld. Deze graaf is gebaseerd op geverifieerde feiten uit Wikipedia, waarbij triples zijn gekoppeld die dezelfde hoofd- of staartentiteiten delen.

Uit de resultaten blijkt dat feiten die geassocieerd zijn met entiteiten met veel verbindingen (hoge structurele populariteit) een grotere kans hebben om corrupt te raken door updates aan naburige feiten. Bovendien zorgt een update aan dergelijke populaire feiten ervoor dat fouten zich breder verspreiden over het kennisnetwerk van het model. De populariteit van een feit voorspelt dus zowel de kwetsbaarheid van het feit zelf als de omvang van de schade die ontstaat bij een foutieve update.

PopAnchor als oplossing

Om dit probleem van kennisverlies en foutpropagatie aan te pakken, stellen de auteurs van het onderzoek een nieuwe methode voor: Popularity-based Anchoring, kortweg PopAnchor. Dit is een lichtgewicht 'rehearsal'-strategie. In plaats van het gehele geheugen van het model te proberen te beschermen, behoudt PopAnchor een kleine set van populaire feiten tijdens het updateproces. Door deze ankerpunten te bewaken, kan het model het vergeten van cruciale, centraal gelegen informatie aanzienlijk verminderen.

Context van kennisverwerking

De dynamiek van hoe taalmodellen informatie opslaan en overschrijven, blijft een complex onderzoeksveld. Terwijl termen als 'popular' in algemene zin duiden op zaken die door velen worden gewaardeerd of ondersteund, zoals beschreven in het cambridge.org, krijgt het begrip in deze technische context een structurele betekenis. Het gaat hier niet om sociale populariteit, maar om de mate van connectiviteit binnen de datastructuur van het model.

Het onderzoek, dat op 8 september 2026 werd ingediend bij , benadrukt dat de architectuur van kennis in LLM's niet uniform is. De ontdekking dat juist de meest centrale kennispunten een zwakke plek vormen, biedt nieuwe inzichten voor het stabieler maken van AI-systemen die continu moeten leren.

De volledige details van de methodologie, inclusief de gebruikte tabellen en figuren, zijn terug te vinden in de publicatie op , waar het werk is gecategoriseerd onder Computation and Language.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!