Onderzoekers hebben SlimKV ontwikkeld, een nieuwe methode om het geheugengebruik van Large Language Models (LLM's) bij lange contexten drastisch te verminderen zonder aanzienlijk verlies van prestaties.
Het verwerken van lange teksten in taalmodellen wordt steeds vaker belemmerd door de beperkte capaciteit van het KV-cache geheugen. Dit probleem is vooral merkbaar in scenario's waar de beschikbare hardwarebronnen beperkt zijn. In een recent onderzoek, gepubliceerd op arxiv.org, presenteren Zihan Teng en collega's een oplossing genaamd SlimKV. Deze methode combineert token- en feature-compressie om de efficiëntie van het model te verhogen.
Beperkingen van bestaande strategieën
Volgens de auteurs van het onderzoek kampen huidige compressiestrategieën met specifieke tekortkomingen. Token-gebaseerde methoden verminderen het aantal opgeslagen toestanden, maar lopen het risico op informatieverlies doordat belangrijke gegevens worden verwijderd of samengevoegd. Feature-gebaseerde methoden verkleinen daarentegen de dimensies per token, maar vereisen vaak een volledige reconstructie om positionele embeddings toe te passen. Dit proces vertraagt de uiteindelijke decodering van het model, wat het voordeel van de compressie tenietdoet.
SlimKV probeert deze problemen op te lossen door een "question-agnostic" benadering te hanteren. De methode maakt gebruik van training die rekening houdt met lage rangen (low-rank-aware training) om lange contexten om te zetten in zogenaamde 'beacon memory states'. Hierbij worden latente KV-representaties gebruikt in combinatie met een rank-allocatie die per laag wordt aangepast.
Innovatie in positionele asymmetrie
Een cruciaal onderdeel van SlimKV is de ontdekking van een positionele asymmetrie. De onderzoekers stelden vast dat het verwijderen van de Rotary Positional Embedding (RoPE) aan de 'key-zijde' een verschillend effect heeft op normale tokens en de nieuwe beacon-tokens. Voor de beacon-tokens is de kwaliteitsvermindering veel kleiner.
Door deze eigenschap te benutten, traint SlimKV de projecties van de beacon KV onder een restrictie waarbij K-RoPE wordt weggelaten. Dit maakt het mogelijk om aandachtsberekeningen (attention) direct in de latente ruimte uit te voeren tijdens het decoderen. Hierdoor wordt de vertraging die normaal gesproken optreedt bij de reconstructie van data voorkomen.
Prestaties en snelheidswinst
De effectiviteit van SlimKV is getest op LongBench, waarbij het systeem superieur bleek aan andere baselines bij compressiefactoren van 16x en 32x. Zelfs bij een lagere compressie van 4x of 8x behield het model meer dan 96% van de score van het niet-gecomprimeerde model, aldus de details op .
Daarnaast is de robuustheid van de methode bevestigd via de 'Needle-in-a-Haystack' test, die aantoont dat informatie overal in de context consistent kan worden teruggevonden. Op het gebied van snelheid rapporteert de studie significante verbeteringen bij een contextlengte van 128K:
* Een versnelling van de attention-fase tot wel 7,34x.
* Een totale versnelling van de end-to-end decodering tot 3,38x vergeleken met het standaardmodel.
Het onderzoek naar SlimKV is officieel geaccepteerd voor de hoofdconferentie van EMNLP 2026, waar het als een 'Oral' presentatie zal worden behandeld, zoals vermeld in de documentatie van . De volledige technische details en de implementatie van de latent-space attention zijn beschikbaar via de .