← Terug
Spectral-LSH: Nieuwe methode voor efficiënte compressie van lange prompts in AI-modellen

Spectral-LSH: Nieuwe methode voor efficiënte compressie van lange prompts in AI-modellen

Onderzoekers hebben een nieuwe techniek ontwikkeld genaamd Spectral-LSH, die bedoeld is om de kosten en rekentijd van grote taalmodellen (LLM's) te verminderen bij het verwerken van zeer lange teksten. De methode richt zich op het comprimeren van prompts voordat deze het model binnenkomen, waardoor de rekenlast van de zogenaamde 'prefill attention' — die normaal gesproken kwadratisch toeneemt met de lengte van de sequentie — wordt beperkt.

De problematiek van lange prompts

Het gebruik van uitgebreide prompts, zoals lange instructies, retrieved documenten of uitgebreide chatgeschiedenissen, is essentieel voor complexe taken in AI. Echter, zoals beschreven door analyticsvidhya.com, leidt dit tot een hogere tokenconsumptie, stijgende kosten en langere responstijden. Bovendien kan een overdaad aan informatie het voor een model moeilijker maken om cruciale details te identificeren.

Om dit tegen te gaan is er een groeiende interesse in promptcompressie. In een breder overzicht van deze technieken legt arxiv.org uit dat compressiemethoden grofweg worden onderverdeeld in 'hard prompt'- en 'soft prompt'-methoden, waarbij vaak wordt gezocht naar een balans tussen de reductie van tokens en het behoud van de betekenis.

Werking van Spectral-LSH

De nieuw geïntroduceerde Spectral-LSH methode, ontwikkeld door onderzoekers van onder meer de Islamic Azad University, de Iran University of Science and Technology en Meta, is een 'training-free' benadering. Dit betekent dat de methode direct kan worden toegepast zonder dat het taalmodel opnieuw getraind hoeft te worden. Volgens de publicatie op arxiv.org maakt de techniek gebruik van een Krylov-subruimtemethode in combinatie met random features om de dominante componenten van een impliciete attention-kernel operator te benaderen.

Door deze aanpak wordt voorkomen dat het systeem de volledige, rekenintensieve $O(N^2)$ attention-kernel moet materialiseren. Vervolgens wordt SimHash toegepast in de resulterende attention-eigenruimte. Hiermee kunnen vergelijkbare tokens worden gegroepeerd en samengevoegd tot zogenaamde 'macro-tokens', waarbij causale positionele toewijzingen behouden blijven. Deze techniek bouwt voort op de principes van Locality Sensitive Hashing (LSH), een methode die volgens een survey op arxiv.org veelvuldig wordt gebruikt voor het efficiënt vinden van nabijgelegen buren in hoog-dimensionale ruimtes.

Resultaten en prestaties

De effectiviteit van Spectral-LSH is getest op verschillende modellen, waaronder Mistral-7B-Instruct-v0.3, Qwen2.5-7B-Instruct en Qwen2.5-14B-Instruct. Uit de experimenten blijkt dat er een 'faseovergang' plaatsvindt bij de compressieratio ($\rho$):

  • Lage compressie ($\rho < 4\times$): Eenvoudige 'chunking' (het opdelen in blokken) biedt hier vaak de beste balans tussen latentie en kwaliteit, omdat de lokale redundantie van tokens laag is.
  • Hoge compressie ($\rho > 8\times$): De spectrale benadering van Spectral-LSH presteert aanzienlijk beter dan chunking en behoudt de kwaliteit van de output.

Bij een compressieratio van $16\times$ zag men bij het Qwen2.5-7B model een reductie van de PPL-ratio (perplexity) van 353,409 naar 196,963. Voor het grotere Qwen2.5-14B model daalde deze ratio van 9,533 naar 3,427. Daarnaast bleek de methode superieur bij gestructureerde stress-tests met JSON-achtige data, code en tabellen.

Context binnen de AI-sector

De zoektocht naar efficiëntere inferentie voor lange contexten is een actueel thema binnen de AI-gemeenschap. Zo worden op platforms zoals paperlist.ai andere benaderingen besproken, zoals SpecPC, dat gebruikmaakt van kleine 'draft'-modellen om minder belangrijke tokens te identificeren en te verwijderen.

Spectral-LSH onderscheidt zich door een adaptieve backend te gebruiken. Deze schakelt automatisch tussen de chunk-methode bij lage compressie en spectrale clustering bij hoge compressie. Hoewel chunking in absolute termen de laagste latentie behoudt, biedt de spectrale route een superieure kwaliteitsbehoud bij extreme compressie.

Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!