← Terug
Nieuwe HybridInfer-methode voorkomt oververhitting bij AI-gebruik op smartphones

Nieuwe HybridInfer-methode voorkomt oververhitting bij AI-gebruik op smartphones

Het draaien van grote taalmodellen (LLM's) direct op smartphones biedt grote voordelen op het gebied van privacy, offline beschikbaarheid en kostenbesparing. Echter, de fysieke beperkingen van mobiele hardware vormen een aanzienlijke hindernis. Uit recent onderzoek blijkt dat intensieve lokale AI-verwerking kan leiden tot instabiliteit van de GPU-runtime, wat in extreme gevallen resulteert in systeemcrashes.

Volgens een publicatie op arxiv.org leiden aanhoudende lokale generaties op high-end toestellen tot thermische problemen die verder gaan dan enkel een vertraging van het systeem. Tijdens tests met een Samsung Galaxy S25+, uitgerust met een Snapdragon 8 Elite-chip, werd vastgesteld dat de GPU-inference runtime kan vastlopen of volledig kan crashen na een reeks opeenvolgende vragen. Deze fouten worden toegeschreven aan de huidige toolchain, met name de OpenCL-kernelcompilatie en de verwerking van lange prompts op de mobiele GPU. Opvallend is dat deze instabiliteit zich ook kan voordoen wanneer het toestel nog niet volledig is opgewarmd, waarbij vooral lange generaties een hoog risico vormen.

Een kernprobleem bij huidige systemen is dat de routers, die bepalen waar een taak wordt uitgevoerd, vaak 'thermisch blind' zijn. Ze worden meestal getest in gesimuleerde omgevingen in plaats van op werkelijke hardware, waardoor ze geen rekening houden met de actuele temperatuur van het toestel. Om dit op te lossen, is ontwikkeld, een router die gebruikmaakt van reinforcement learning om dynamisch te kiezen tussen drie verschillende niveaus van uitvoering.

Het systeem werkt met een hiërarchische structuur. Voor eenvoudige lokale verwerking wordt Llama 3.2 3B ingezet op het toestel zelf. Voor complexere taken is er een 'edge'-niveau met Llama 3.1 8B en retrieval-ondersteuning, terwijl de meest veeleisende queries worden doorgestuurd naar de cloud via GPT-4o. De router hanteert een offline getrainde Q-learning policy, waarbij zowel de beschikbare thermische ruimte van de smartphone als de geschatte complexiteit van de vraag als input dienen. De beloningsfunctie van dit systeem weegt de kwaliteit van het antwoord af tegen de latentie, de kosten en een specifieke thermische straf. Om te voorkomen dat het systeem uit angst voor hitte elke query naar de cloud stuurt, is er een zogenaamde 'locality bonus' toegevoegd die lokale uitvoering stimuleert.

De prestaties van HybridInfer zijn getest via een Android-benchmark met 210 prompts. De resultaten tonen aan dat de geleerde router een aanzienlijk hogere kwaliteit levert dan twee handmatig ingestelde heuristieken. Hoewel een volledig lokale aanpak voor korte queries een vergelijkbare kwaliteit kan bieden, is deze methode in de praktijk drie tot zes keer trager. Bovendien blijken volledig lokale systemen onbetrouwbaar bij het verwerken van lange queries.

De routing-methode van HybridInfer blinkt daarom vooral uit in betrouwbaarheid, latentie en dekking. Zoals beschreven in de , is dit naar bekendzijn de eerste keer dat de thermische ruimte van een apparaat direct wordt gebruikt om te kiezen tussen verschillende LLM-inferentieniveaus op echte hardware. Om verdere replicatie van dit onderzoek mogelijk te maken, zijn de volledige evaluatiepipeline en de Android-meetinstrumenten door de auteur vrijgegeven via .

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!