← Terug
MUX: Nieuwe methode voor efficiëntere AI-redenering via 'multiplexed tokens'

MUX: Nieuwe methode voor efficiëntere AI-redenering via 'multiplexed tokens'

Onderzoekers hebben een nieuwe techniek genaamd MUX ontwikkeld die taalmodellen in staat stelt om complexere redeneerprocessen sneller en compacter uit te voeren door discrete tekststappen om te zetten in continue latente tokens.

Huidige grote taalmodellen (LLM's) lossen complexe problemen vaak op door tussenstappen van hun redenering expliciet uit te schrijven in natuurlijke taal. Hoewel deze methode effectief is, vormt het een computationele flessenhals. Elke stap in het redeneerproces brengt namelijk slechts één subwoord over, waardoor veel rekenkracht wordt verspild aan het formuleren van gedachten in plaats van aan de daadwerkelijke berekening.

Om dit probleem aan te pakken, stellen Ayhan Suleymanzade en zijn collega's een methode voor die bekend staat als MUX. Volgens de publicatie op arxiv.org is MUX gebaseerd op de distillatie van discrete redeneringen naar zogenaamde 'multiplexed tokens' in een latente ruimte. In plaats van elk woord afzonderlijk te verwerken, wordt elk latent token getraind om een gewogen lineaire superpositie te representeren van een reeks discrete subwoorden.

Doorbreken van de computationele flessenhals

De kern van de MUX-technologie is het vermogen om informatie te 'multiplexen'. Dit betekent dat een reeks woorden wordt samengevoegd in één enkel token zonder dat er informatie verloren gaat. De onderzoekers bewijzen dat door gebruik te maken van positie-afhankelijke wegingen, zoals een geometrische afname, deze superpositie verliesvrij blijft. Hierdoor kan de oorspronkelijke reeks subwoorden volledig worden hersteld, een proces dat 'demultiplexing' wordt genoemd.

Een belangrijk voordeel van deze aanpak is dat het 'latent collapse' voorkomt, een fenomeen waarbij modellen shortcuts nemen en essentiële redeneerstappen overslaan. Door de constructie van de verliesvrije superpositie wordt het model gedwongen om de volledige logische keten te behouden, maar dan in een veel compacter formaat.

Prestaties en parallelle exploratie

In het onderzoek, dat is ingediend bij de sectie van arXiv, is MUX getest in 32 verschillende evaluatiescenario's over vier verschillende taalmodellen. De resultaten tonen aan dat MUX superieur presteert ten opzichte van sterke baselines voor latent redeneren.

Een opvallend aspect van de resultaten is dat multiplexed reasoning in staat is tot parallelle exploratie. Dit is vooral waardevol bij problemen die een zoekproces vereisen, waarbij het model meerdere mogelijke oplossingsrichtingen tegelijkertijd kan overwegen in de latente ruimte, in plaats van deze één voor één lineair uit te schrijven.

Interpretatie en betrouwbaarheid

Naast de snelheid en efficiëntie hebben de auteurs van het artikel ook geanalyseerd of de interne processen van het model nog steeds begrijpelijk zijn. Via probing-analyses en ablatieonderzoeken is vastgesteld dat de geleerde latente tokens een getrouwe en interpreteerbare weergave blijven van de redenering.

De conclusie van de onderzoekers is dat verliesvrije superpositie als lokaal leertarget een voldoende voorwaarde is om sterke en efficiënte continue redenering te bereiken. Hiermee wordt een belangrijke stap gezet richting AI-systemen die niet alleen sneller zijn, maar ook minder rekenbronnen verbruiken om tot complexe conclusies te komen.

Het volledige wetenschappelijke rapport is beschikbaar via de , waar de technische details over de implementatie van de geometrische wegingen en de specifieke modelarchitecturen verder worden toegelicht.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!