← Terug
Onderzoek toont aan dat Transformers in staat zijn tot generatieve data-sampling

Onderzoek toont aan dat Transformers in staat zijn tot generatieve data-sampling

Wetenschappers hebben aangetoond dat Transformer-modellen, de technologische basis van moderne grote taalmodellen, veel meer kunnen dan enkel informatie opslaan. Uit nieuw onderzoek blijkt dat deze architectuur in staat is om complexe generatieve processen te simuleren zonder dat de interne parameters van het model tijdens dit proces gewijzigd hoeven te worden.

In een wetenschappelijk rapport dat is gepubliceerd op de preprint-server arXiv, beschrijven onderzoekers Arman Adibi, Alireza Jafari, Mohammad Ghavamzadeh en Hadi Daneshmand een nieuwe dimensie van zogenaamd in-context learning. Waar eerdere studies al hadden aangetoond dat deze modellen conclusies kunnen trekken op basis van voorbeelden in een prompt, zoals bij lineaire regressie, bewijst dit nieuwe onderzoek dat deze capaciteit zich ook uitstrekt tot het genereren van data. Volgens de publicatie arxiv.org fungeren deze "bevroren" Transformers in feite als simulatoren voor iteratieve generatieve samplers.

Dit houdt in dat het model nieuwe data kan produceren op basis van voorbeelden die in de context van de prompt worden aangeleverd. De onderzoekers analyseren hoe specifieke onderdelen van de architectuur dit mogelijk maken. Zo wordt de softmax attention ingezet voor het berekenen van gewogen empirische gemiddelden en verantwoordelijkheidsgewichten. Daarnaast implementeren de feedforward layers zogenaamde Euler-updates, wat cruciaal is voor het realiseren van diffusie-samplers. Deze technische details zijn uitgebreid beschreven in de .

Om deze theoretische bevindingen te toetsen aan de praktijk, hebben de auteurs onderzoek gedaan naar semantic-topic sampling. Hierbij maakten zij gebruik van prompts met woorden uit specifieke categorieën, zoals dieren, voedingsmiddelen of steden. De resultaten tonen aan dat de genormaliseerde verborgen toestanden (hidden states) een specifiek geometrisch patroon volgen terwijl ze door de lagen van de Transformer bewegen. In de tussenliggende lagen verschuiven deze toestanden richting een uniforme sferische referentie, om vervolgens bij de output weer terug te keren naar gestructureerde representaties die passen bij het gekozen onderwerp.

Daarnaast hebben de onderzoekers de interactie-energie van deze verborgen toestanden gemeten, waarbij een kenmerkend U-vormig patroon over de verschillende lagen van het model werd waargenomen. Op basis van deze data konden de auteurs bewijzen dat Transformers een energiegebaseerde sampler kunnen benaderen door exact dit U-vormige energiepatroon over de lagen heen te construeren. Het onderzoek, dat op 8 september 2026 werd ingediend en op 11 september 2026 in een herziene versie verscheen via , suggereert dat de functionele reikwijdte van Transformers aanzienlijk breder is dan enkel het voorspellen van het volgende token in een reeks.

Hoewel de term "Transformers" in de populaire cultuur vaak wordt geassocieerd met entertainment en sciencefiction, zoals te zien is in de netflix.com, verwijst de term in deze context strikt naar de computationele architectuur van AI-systemen. De focus van dit specifieke onderzoek ligt op de wiskundige en structurele eigenschappen van deze modellen, in plaats van op commerciële toepassingen.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!