De efficiëntie van grote taalmodellen (LLM's) wordt steeds vaker verhoogd door het gebruik van Mixture-of-Experts (MoE) architecturen. Hoewel deze systemen rekenkracht besparen door slechts een deel van het model per token te activeren, vormen de enorme hoeveelheden parameters een logistieke uitdaging. Omdat deze parameters vaak de capaciteit van het GPU-geheugen overschrijden, moeten data via de PCIe-bus vanuit het systeemgeheugen (CPU) worden overgebracht, wat leidt tot aanzienlijke vertragingen tijdens de inferentie.
Om dit probleem op te lossen, hebben onderzoekers Yongxiang Lyu, Ning Li en Bonian Jia het SPICE-framework ontwikkeld. Volgens een publicatie op arxiv.org combineert dit systeem een lichtgewicht voorspellingsmechanisme voor experts met een orchestratie tussen de CPU en GPU die werkt op basis van betrouwbaarheidsintervallen. Het doel is om de tijd die verloren gaat aan het laden van data te minimaliseren door experts al op te halen voordat ze daadwerkelijk nodig zijn.
Het hart van SPICE bestaat uit een compact 'draft model' dat is afgestemd op de architectuur van het hoofdmodel. Door gebruik te maken van een adaptief lookahead-algoritme kan het systeem experts met een hoge betrouwbaarheidsscore vooraf laden (prefetching). Wanneer een voorspelling echter onjuist blijkt, hanteert het framework een gelaagde strategie om de impact op de snelheid te beperken. Bij een lage betrouwbaarheidsscore maakt het systeem gebruik van 'low rank expert' (LoRE) surrogaten, die worden uitgevoerd door een resident shared expert. Voor berekeningen die een exacte uitvoering vereisen en niet benaderd kunnen worden, wordt de taak asynchroon naar de CPU verplaatst, zodat dit parallel kan lopen met de activiteiten op de GPU.
De effectiviteit van deze aanpak is getest op verschillende GPU-platformen met modellen zoals Qwen2-57B-A14B en DeepSeek-V2-Lite. Zoals beschreven in de documentatie op acadeus, resulteerde SPICE in een versnelling tot 3,12 keer in de 'Time Per Output Token' (TPOT), terwijl de kwaliteit van de output nauwelijks werd beïnvloed. Dit onderstreept dat een hybride benadering van offloading en voorspelling effectiever is dan enkel vertrouwen op brute overdrachtssnelheden.
De ontwikkeling van SPICE past in een bredere trend van optimalisaties voor MoE-inferentie. Andere benaderingen richten zich bijvoorbeeld op het gebruik van interne modelrepresentaties om toekomstige experts te speculeren, wat volgens een analyse op alphaxiv.org kan leiden tot een reductie van maximaal 14% in de TPOT vergeleken met on-demand loading.
Naast academische frameworks zijn er diverse open-source initiatieven die MoE-modellen toegankelijker maken voor hardware met beperkte middelen. Een voorbeeld hiervan is een project op github.com dat een expert-cache en predictieve prefetching implementeert voor llama.cpp. Door hoge cache-hit rates te maximaliseren, kunnen zeer grote modellen theoretisch draaien op consumentenhardware die normaal gesproken onvoldoende GPU-geheugen zou hebben.