Wetenschappers hebben een innovatieve methode ontwikkeld om Large Language Models (LLM's) effectiever te laten 'vergeten'. Het nieuwe framework, genaamd CONfession-to-Forget-Set (CONFS), is ontworpen om specifieke informatie uit een getraind model te wissen zonder dat de algehele functionaliteit van de AI in gevaar komt. Deze ontwikkeling is ingediend bij de EMNLP 2026 conferentie en richt zich op de problematiek rondom machine unlearning.
Het proces van machine unlearning is essentieel voor de privacy en veiligheid van kunstmatige intelligentie, omdat het toelaat om gericht gegevens te verwijderen. Volgens een publicatie op arxiv.org kampen huidige methoden echter vaak met een zogenaamde 'forget-set misalignment'. Dit fenomeen treedt vooral op wanneer de oorspronkelijke trainingsdata niet meer beschikbaar is, waardoor er een kloof ontstaat tussen de data die men wil wissen en wat het model daadwerkelijk heeft onthouden.
Onderzoekers, waaronder Georu Lee en Miso Kim, onderscheiden hierbij twee kritieke scenario's. Enerzijds is er sprake van 'under unlearning', waarbij gevoelige informatie in het model blijft hangen omdat de wislijst onvolledig is. Anderzijds is er 'out-of-knowledge unlearning', waarbij het algoritme probeert informatie te verwijderen die het model nooit heeft geleerd. Dit laatste kan de parameters van het model verstoren, wat resulteert in een lagere kwaliteit van de antwoorden. De analyse wijst uit dat deze problemen voortvloeien uit onjuiste doelstellingen bij het wissen, in plaats van gebrekkige optimalisatietechnieken.
Om deze uitdagingen aan te pakken, introduceert het CONFS-framework een 'data-blind' systeem. In plaats van te vertrouwen op externe lijsten, dwingt CONFS het model om zelf aan te geven welke kennis het bezit. Door deze interne kennis te formaliseren, kan een verzameling worden gecreëerd die nauwkeurig is afgestemd op de huidige staat van het model. De resultaten laten zien dat CONFS een sterke balans vindt tussen het effectief wissen van data en het behouden van de algemene prestaties op diverse benchmarks.
Deze technologische vooruitgang is van groot belang gezien de architectuur van moderne AI. Zoals uitgelegd door freeacademy.ai, zijn LLM's systemen die op gigantische hoeveelheden tekst zijn getraind om het volgende woord in een reeks te voorspellen. Ze werken niet als een traditionele database, maar genereren tekst op basis van patronen die tijdens de trainingsfase zijn herkend.
De technische basis van deze modellen is vaak complex. Volgens google.com maken veel hedendaagse LLM's gebruik van de Transformer-architectuur, een innovatie uit 2017. Deze modellen kunnen miljarden teksten verwerken en worden ingezet voor uiteenlopende taken, van het schrijven van samenvattingen tot het aansturen van geavanceerde chatbots.
De maatschappelijke impact van deze technologie is breed zichtbaar in consumententoepassingen. co.uk beschrijft bijvoorbeeld hoe ChatGPT, ontwikkeld door OpenAI, in staat is om scripts, essays en computercode te produceren door mensachtige reacties te genereren op basis van internetinformatie. Omdat deze modellen patronen uit enorme datasets absorberen, is het vermogen om ongewenste of private informatie achteraf te verwijderen een noodzakelijke voorwaarde voor de veilige integratie van AI in de samenleving.