⚠️ KMI waarschuwing: Onweer in België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
Dual-Flow Transformers: Nieuwe architectuur scheidt prompt-verwerking van tekstgeneratie

Dual-Flow Transformers: Nieuwe architectuur scheidt prompt-verwerking van tekstgeneratie

Wetenschappers hebben een innovatieve methode ontwikkeld om de operationele efficiëntie van grote taalmodellen te verbeteren. Door de rekenkracht tijdens de initiële verwerking van een prompt los te koppelen van de daaropvolgende fase waarin tekst wordt gegenereerd, kan de totale belasting van de hardware worden verminderd.

In een technisch rapport beschrijven Liming Liu, Mingze Wang en Tuo Zhao de werking van de zogenaamde 'Dual-Flow Transformer'. De auteurs stellen dat de cumulatieve kosten van inferentie steeds belangrijker worden in vergelijking met de initiële investering in het trainen van modellen. Volgens de publicatie op arxiv.org is de huidige architectuur van taalmodellen problematisch omdat de twee fasen van inferentie verschillende eisen stellen aan de hardware.

De eerste fase, de 'prompt prefill', is een parallel proces dat voornamelijk wordt beperkt door de beschikbare rekenkracht. De tweede fase, de autoregressieve 'decode'-fase, waarbij het model sequentieel tokens genereert, wordt daarentegen vaak gehinderd door de bandbreedte van het geheugen. Traditionele manieren om modellen te schalen, zoals het toevoegen van lagen in breedte of diepte, verhogen de kosten in beide fasen omdat elke laag in beide processen moet worden doorlopen, zoals uiteengezet in de .

De Dual-Flow Transformer lost dit op door twee gescheiden rekenpaden te implementeren. De primaire stroom fungeert als een volledig causaal taalmodel dat de prompt verwerkt en de key-value (KV) cache beheert. Daarnaast is er een hulpstroom die tijdens de prompt-verwerking volledig wordt overgeslagen. Deze hulpstroom wordt pas geactiveerd vanaf de laatste positie van de prompt om extra rekenkracht toe te voegen aan de voorspelling van de tekst. De hulpstroom heeft geen invloed op de primaire stroom en schrijft geen persistente status, hoewel beide stromen gebruikmaken van gedeelde matrices voor MLP, output en attention.

De resultaten van het onderzoek tonen aan dat deze architectuur een lager validatieverlies behaalt over diverse dataconfiguraties en architecturen wanneer men kijkt naar een gelijk aantal tokens. Er zijn specifieke voordelen bij het gebruik van Mixture-of-Experts (MoE) modellen, waarbij de 'fan-outs' van de primaire en hulp-experts onafhankelijk van elkaar kunnen worden beheerd. Dit stelt ontwikkelaars in staat om een precieze afweging te maken tussen de kosten van de prompt, de kosten van de generatie en de uiteindelijke kwaliteit van de output. In de werd specifiek onderzocht hoe een vast budget voor decode-experts verdeeld kan worden tussen de twee stromen.

Het onderzoek, dat op 31 juli 2026 is ingediend, biedt een uitgebreide technische analyse van 18 pagina's. De volledige details over de experimenten en de implementatie zijn terug te vinden via de .

Het is belangrijk om op te merken dat deze technologische ontwikkeling puur gericht is op de computationele efficiëntie van kunstmatige intelligentie. Er is geen enkel verband tussen deze architectuur en andere toepassingen die de term 'Dual' gebruiken, zoals bepaalde software voor multiplayer-games die beschikbaar zijn via de google.com.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!