← Terug
LISA: Nieuwe techniek versnelt AI-redenering bij lange contexten

LISA: Nieuwe techniek versnelt AI-redenering bij lange contexten

Onderzoekers hebben LISA ontwikkeld, een innovatieve aandachtsmodule die de rekenkosten van taalmodellen bij complexe redeneringen drastisch verlaagt zonder dat volledige hertraining nodig is.

De recente ontwikkeling van modellen die gebruikmaken van een uitgebreide 'chain-of-thought' (CoT), zoals DeepSeek-R1, heeft geleid tot een sterke toename van de contextlengte tijdens het genereren van antwoorden. Hoewel dit de redeneerkracht verbetert, zorgt de standaard 'self-attention' mechaniek voor een kwadratische toename van de rekencomplexiteit. Dit betekent dat de kosten en de benodigde tijd voor inferentie exponentieel stijgen naarmate de tekst langer wordt, wat de inzet van dergelijke modellen in productieomgevingen bemoeilijkt.

Om dit probleem op te lossen, stellen onderzoekers in een recent artikel op arxiv.org de Linear-Indexed Sparse Attention (LISA) voor. LISA is ontworpen als een 'plug-and-play' vervangingsmodule, wat betekent dat het in bestaande modellen kan worden geïntegreerd zonder dat het model vanaf nul opnieuw getraind hoeft te worden.

Hybride architectuur voor efficiëntie

De kern van LISA bestaat uit twee parallelle componenten die samenwerken om de rekenlast te verminderen. Ten eerste bevat het systeem een Linear Attention-module. Deze module biedt een langetermijngeheugen met een lineaire tijdcomplexiteit, waardoor het model grote hoeveelheden informatie kan onthouden zonder dat de rekenkracht explodeert.

Ten tweede maakt LISA gebruik van een zogenaamde 'Lightning Indexer'. Deze indexeerder selecteert dynamisch de meest relevante tokens uit de volledige context om deze vervolgens aan een Sparse Self-Attention module te voeden. Door deze twee takken via een gating-mechanisme te fuseren, wordt de complexiteit van de inferentie teruggebracht van een kwadratische groei ($O(n^2)$) naar een veel beheersbaardere vorm ($O(nM)$), waarbij $M$ aanzienlijk kleiner is dan de totale contextlengte $n$.

Trainingsproces in twee fasen

Het implementatieproces van LISA verloopt via een specifieke tweestaps-pijplijn. In de eerste fase wordt de Linear Attention geïntegreerd om lange-afstandsafhankelijkheden vast te leggen. Dit wordt ondersteund door een sliding-window mechanisme, dat via kennisdistillatie wordt geoptimaliseerd om de distributie van een bevroren 'teacher'-model te benaderen.

In de tweede fase wordt de statische sliding-window vervangen door de dynamische Indexer. Deze indexeerder wordt getraind met een nieuw type KL-divergentieverlies per attention-head, waardoor de selectie van tokens nauwkeurig wordt afgestemd op de patronen van het oorspronkelijke teacher-model. Volgens de publicatie op stelt dit het model in staat om flexibel belangrijke informatie uit een brede context te filteren.

Resultaten en prestaties

De effectiviteit van LISA is getest op DeepSeek-distilled-Qwen modellen. De resultaten tonen een significante verbetering in zowel snelheid als nauwkeurigheid. Bij een context van 16.000 tokens realiseerde LISA een versnelling van de inferentie met 50%. Tegelijkertijd steeg de gemiddelde prestatie op redeneringsbenchmarks, waaronder AIME en MATH-500, met 5,6%.

Deze resultaten worden ondersteund door analyses over de synergie tussen lineaire en sparse attention, waarbij bleek dat de Indexer in staat is om de dynamiek van volledige self-attention effectief te herstellen. De impact van deze technologie wordt verder benadrukt in korte verslagen op platforms zoals lumeric.app, waar wordt gesteld dat de inferentiekosten voor long-context reasoning door deze methode gehalveerd kunnen worden.

Context binnen het AI-landschap

De zoektocht naar efficiëntere contextmodellering is een breed onderzoekt thema in de AI-gemeenschap. Op github.com worden diverse methoden voor long-context modeling verzameld, wat onderstreept dat de industrie worstelt met de balans tussen geheugencapaciteit en rekensnelheid.

Het is belangrijk om LISA te onderscheiden van andere projecten met dezelfde naam. Zo bestaat er een andere LISA-implementatie op github.com die zich richt op aanbevelingssystemen via codeword histogrammen, en een visueel georiënteerde LISA-methode die werd gepresenteerd op de CVPR 2024, gericht op 'reasoning segmentation' in afbeeldingen. De huidige doorbraak in Linear-Indexed Sparse Attention is specifiek gericht op de tekstuele redeneerkracht van grote taalmodellen.

Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!