← Terug
BRIM-accelerator optimaliseert AI-inferentie door workload-imbalans op te lossen

BRIM-accelerator optimaliseert AI-inferentie door workload-imbalans op te lossen

Onderzoekers hebben BRIM ontwikkeld, een nieuwe hardware-software co-design accelerator die de efficiëntie van deep neural networks (DNN's) aanzienlijk verhoogt door bit-level sparsity aan beide zijden van de berekening te benutten.

De toenemende complexiteit en omvang van moderne AI-modellen, zoals Large Language Models (LLM's) en Vision Transformers (ViTs), zorgen voor een enorme druk op de rekenkracht en het energieverbruik tijdens de inferentiefase. Om dit aan te pakken, maken bit-seriële accelerators gebruik van zogenaamde 'sparsity' (ijjlheid): het overslaan van nulwaarden in berekeningen om kosten te verlagen. Volgens een publicatie op arxiv.org beperken bestaande ontwerpen zich echter vaak tot het exploiteren van sparsity op slechts één operand, wat de potentiële snelheidswinst beperkt.

Het probleem van workload-imbalans

Wanneer men probeert sparsity op beide operanden tegelijkertijd te benutten (dual-sided sparsity), ontstaan er weliswaar minder deelproducten, maar ontstaat er een nieuw kritiek probleem: workload-imbalans. Omdat de rekentijd van elk gewicht-activatiepaar afhangt van het aantal niet-nul bits in beide operanden, variëren de uitvoeringstijden sterk.

In huidige dual-sided ontwerpen werken de Processing Elements (PE's) in lockstep. Dit betekent dat snellere berekeningen moeten wachten op tragere paren, waardoor een groot deel van de hardware onbenut blijft. Uit onderzoek blijkt dat dit de PE-benutting in bestaande systemen beperkt tot slechts 56% tot 64%, zoals beschreven op alphaxiv.org.

De BRIM-oplossing: Een hybride aanpak

Om dit knelpunt te doorbreken, introduceren Varun Manjunath en zijn collega's BRIM. Dit systeem combineert twee specifieke mechanismen om de rekenlast gelijkmatiger te verdelen:

  1. Cyclic-Balanced Pruning (CBP): Dit is een softwarematige optimalisatie die na de training wordt toegepast. CBP herschikt de representatie van gewichten op basis van geanalyseerde activatiestatistieken. Het doel is om de verwachte werklast over de gelijktijdig verwerkte paren offline te egaliseren.
  2. Pairwise Slot Donation: Dit is een lichtgewicht hardwaremechanisme dat is ontworpen om de resterende onbalans tijdens de runtime op te vangen. Dit gebeurt met een minimale toename van het chipoppervlak.

Deze gecombineerde aanpak zorgt ervoor dat de hardware veel efficiënter wordt ingezet zonder dat er enorme hoeveelheden extra silicium nodig zijn, een probleem waar puur hardware-gecentreerde oplossingen vaak tegenaan lopen, meldt papers.cool.

Prestaties en resultaten

De effectiviteit van BRIM is getest op diverse architecturen, waaronder Convolutional Neural Networks (CNN's), Vision Transformers (ViTs) en LLM's. Onder iso-area constraints — waarbij de hardware-oppervlakte gelijk blijft aan die van concurrerende ontwerpen — behaalt BRIM indrukwekkende resultaten.

De PE-benutting stijgt naar meer dan 90%. In termen van snelheid realiseert het systeem een versnelling tot 2,37x ten opzichte van eerdere dual-sided ontwerpen. Daarnaast is er een verbetering in energie-efficiëntie tot 1,63x gerealiseerd, zoals vermeld in de technische details op .

Context binnen de AI-hardwaresector

De ontwikkeling van BRIM past in een bredere trend van gespecialiseerde ASIC-architecturen voor AI-computing. Terwijl andere onderzoekers zich richten op zaken als 3D sparse convolution of LLM-quantisatie, zoals te zien is in het werk van onderzoekers aan de Shanghai Jiao Tong University, richt BRIM zich specifiek op het optimaliseren van de interactie tussen bit-seriële verwerking en sparsity. Door de synergie tussen softwarematige pruning en hardwarematige slot-donatie slaagt het team erin de theoretische voordelen van dual-sided sparsity daadwerkelijk om te zetten in meetbare prestatiewinst.

Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!