← Terug
Nieuwe Edge0-technologie maakt grote AI-modellen toegankelijk op consumentenhardware

Nieuwe Edge0-technologie maakt grote AI-modellen toegankelijk op consumentenhardware

Het draaien van krachtige taalmodellen op standaard consumentencomputers wordt vaak belemmerd door de beperkte capaciteit van het videogeheugen, een probleem dat in de sector bekendstaat als de 'memory wall'. Vooral bij Mixture-of-Experts (MoE) modellen vormt de enorme hoeveelheid data voor de modelgewichten een hindernis. Een model uit de 35B-categorie dat gebruikmaakt van 4-bit kwantisatie vereist bijvoorbeeld ongeveer 19,5 GB aan geheugen. Hoewel MoE-architecturen de rekenlast per token verlagen door slechts specifieke delen van het model te activeren, blijft de totale hoeveelheid data die in het geheugen moet worden opgeslagen onverminderd hoog.

Om deze beperking te omzeilen, wordt vaak gebruikgemaakt van 'offloading', waarbij delen van het model naar de SSD worden verplaatst. Echter, volgens een technisch rapport op arxiv.org is een eenvoudige aanpak van offloading niet effectief. De reden hiervoor is dat de keuze voor de experts in een volgende laag pas kan worden gemaakt nadat de output van de huidige laag is vastgesteld. Hierdoor kunnen leesacties vanaf de SSD niet tijdig worden gestart om de rekentijd te maskeren, wat resulteert in aanzienlijke vertragingen in de verwerking.

Ter oplossing voor dit probleem hebben Yu Lin en een team van collega's de Edge0-engine ontwikkeld. Het centrale mechanisme van dit systeem is de zogenaamde 'prerouter'. Dit onderdeel voorspelt per laag de routing voor de volgende laag één token vooruit. Omdat deze voorspelling direct wordt gehanteerd als de feitelijke routing, kan het systeem de benodigde experts preventief klaarzetten. Hierdoor sluit de set van geladen experts naadloos aan op de gerouteerde experts, wat dataverlies voorkomt en de latentie minimaliseert. Deze innovatieve aanpak wordt verder toegelicht in de publicatie .

Om het kwaliteitsverlies dat optreedt door de 4-bit kwantisatie en de gewijzigde routing te compenseren, implementeert Edge0 een niet-samengevoegde recovery LoRA. Deze is specifiek getraind op het student-pad om de prestaties zo dicht mogelijk bij het oorspronkelijke model te houden. De resultaten van deze implementatie tonen een aanzienlijke winst in efficiëntie. Op een systeem met 24 GB geheugen kan de engine een 35B MoE-model aansturen met een snelheid van 20 tokens per seconde, terwijl het piekactieve geheugengebruik beperkt blijft tot slechts 3 GiB.

Wat betreft de nauwkeurigheid scoort het systeem over vijf publieke benchmarks gemiddeld slechts enkele punten lager dan de fp16-teacherversie van het model. Naast de 35B-variant kan het framework ook worden toegepast op een 8B-tier. De onderzoekers hebben aangegeven dat zowel het framework als de bijbehorende checkpoints en adapters open source beschikbaar zijn gesteld, zoals vermeld in de documentatie op . Hiermee wordt beoogd dat een breder publiek toegang krijgt tot geavanceerde AI-modellen zonder dat daarvoor kostbare enterprise-hardware vereist is.

Terwijl technische doorbraken zoals deze de toegankelijkheid van AI vergroten, blijven nieuwe ontwikkelingen in de sector elkaar snel opvolgen. Voor meer algemene updates over nieuwe technologieën en innovaties kan men terecht op platforms zoals stories.com, waar regelmatig nieuwe trends in de tech-wereld worden belicht.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!