⚠️ KMI waarschuwing: Onweer in België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
Diffusion LLM's gebruiken 'onzichtbare' tokens voor complexe redeneringen

Diffusion LLM's gebruiken 'onzichtbare' tokens voor complexe redeneringen

Wetenschappers hebben een opmerkelijk mechanisme ontdekt bij taalmodellen die gebruikmaken van diffusie. In plaats van direct een antwoord te formuleren, blijken deze modellen in staat te zijn om complexe redeneringen uit te voeren via zogenaamde end-of-sequence (EoS) tokens. Deze tokens, die normaal gesproken enkel het einde van een tekstreeks markeren, fungeren in deze specifieke architectuur als een vorm van verborgen rekencapaciteit.

In een studie uitgevoerd door Sarah Breckner en Sebastian Schuster wordt beschreven hoe masked diffusion Large Language Models (LLM's) reageren wanneer de beschikbare generatielengte ruimer is dan de feitelijke lengte van het correcte antwoord. Volgens de publicatie op arxiv.org presteren deze modellen aanzienlijk beter wanneer zij extra ruimte krijgen om tokens te genereren die voor de eindgebruiker onzichtbaar of betekenisloos lijken. De auteurs typeren dit fenomeen als "denken in EoS-tokens", waarbij de representaties van deze tokens dienen als een virtueel kladblok voor interne berekeningen.

Om deze theorie te staven, voerden de onderzoekers tests uit met verschillende modellen, waaronder LLaDA1.5, LLaDA2.0-mini en Dream-v0. De modellen werden geconfronteerd met diverse logische uitdagingen, variërend van optelsommen en Sudoku's tot entity tracking. De resultaten lieten zien dat het bewust toevoegen van extra EoS-tokens de accuraatheid van de antwoorden direct verhoogde.

Een cruciaal onderdeel van het bewijs was een causale interventie waarbij de verborgen toestanden (hidden states) van de EoS-tokens werden gemanipuleerd. Zoals uiteengezet in de publicatielijst van de ac.at, leidde het overplaatsen van deze toestanden van de ene generatie naar de andere tot 'tegenfeitelijke' antwoorden. Dit bevestigt dat de EoS-tokens geen lege vulling zijn, maar daadwerkelijk essentiële informatie bevatten die nodig is om tot de juiste conclusie te komen.

De impact van dit mechanisme strekt zich verder uit dan eenvoudige oefeningen. De onderzoekers merkten dat de prestaties ook verbeterden bij complexere vraagstukken, zoals bij de GSM8K-benchmark en bij zogenaamde 'two-hop reasoning', waarbij meerdere logische stappen achter elkaar gezet moeten worden. Deze bevindingen, die verder worden geanalyseerd op deeppaper.ai, tonen een fundamenteel verschil aan met traditionele autoregressieve modellen. Waar die laatste lineair tekst genereren, kunnen bidirectionele masked diffusion LLM's latente redeneringen uitvoeren binnen de representaties van hun afsluitende tokens.

Deze ontdekking biedt een nieuw perspectief op het optimaliseren van computationele capaciteit. Terwijl sommige technieken zich richten op het versnellen van processen door berekeningen vroegtijdig te stoppen, zoals besproken op emergentmind.com, suggereert dit onderzoek dat het juist uitbreiden van de sequentie met schijnbaar overbodige tokens de cognitieve kracht van een model kan versterken. De studie concludeert dat dit vermogen tot verborgen redenering een intrinsiek onderdeel is van de informatieverwerking in deze modellen, wat mogelijkheden opent om de logische vaardigheden van AI te verbeteren zonder de basisarchitectuur aan te passen.

Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!