⚠️ KMI waarschuwing: Onweer in België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
Nieuw raamwerk A-PACK versnelt multimodale AI-modellen door audio slim te comprimeren

Nieuw raamwerk A-PACK versnelt multimodale AI-modellen door audio slim te comprimeren

Onderzoekers hebben een nieuw raamwerk ontwikkeld dat de verwerking van multimodale AI-modellen aanzienlijk versnelt door audio en video op een slimme manier te comprimeren. Het systeem, genaamd A-PACK, werd voorgesteld in een arxiv.org en richt zich op een tot nu toe onderbelicht aspect van AI-optimalisatie.

Het probleem: lange multimodale sequenties

Moderne AI-modellen die tegelijkertijd audio, video en tekst verwerken — zogenaamde omni-modale LLM's — kampen met hoge rekenkosten wanneer ze lange multimodale sequenties moeten verwerken. Deze kosten ontstaan vooral tijdens de zogenaamde prefill-fase en door het gebruik van KV-caches, die tijdelijke berekeningen opslaan. Volgens de onderzoekers richten bestaande compressietechnieken zich voornamelijk op het verminderen van tokens vóór de LLM-verwerking, terwijl compressie over de LLM-grens heen nauwelijks is onderzocht.

Twee-fasen-aanpak

A-PACK hanteert een twee-fasenstrategie die audiopruning uitstelt totdat er query-afhankelijke multimodale interacties ontstaan. De onderzoekers ontdekten daarbij dat audio per token een hogere informatiedichtheid en grotere representatieve diversiteit bevat dan video. Daarnaast bleek dat lokale audio-visuele dynamiek een effectievere aanwijzing vormt voor visuele selectie dan het vergelijken van individuele tokens.

Concreet betekent dit dat A-PACK audio behoudt en video comprimeert met behulp van lokale dynamiek vóór de LLM-verwerking. Vervolgens worden binnen de LLM zelf geleidelijk audio- en visuele tokens met een lage relevantie verwijderd, samen met hun bijbehorende KV-cache-items.

Opvallende resultaten

De onderzoekers testten hun aanpak op vier benchmarks met de modellen Qwen2.5-Omni-7B en Qwen2.5-Omni-3B. Daarbij behaalde A-PACK de sterkste gemiddelde prestaties in vergelijking met eerder geëvalueerde methoden. Tegelijkertijd wist het systeem de prefill-FLOPs — het aantal rekenbewerkingen tijdens de prefill-fase — met tot 78 procent te verminderen. De decodeersnelheid verbeterde bovendien met een factor tot 2,21.

Context: wat betekent "deferred"?

De term "deferred" in de titel verwijst naar het uitstellen van een actie naar een later moment. In algemene zin betekent het woord volgens usdictionary.com het uitstellen of vertragen van een actie of gebeurtenis, of het tijdelijk opzijzetten van iets voor toekomstige afhandeling. In de context van A-PACK betekent dit dat het verwijderen van audio-tokens bewust wordt uitgesteld tot een later stadium in het verwerkingsproces, wanneer er meer informatie beschikbaar is over welke tokens daadwerkelijk relevant zijn.

Betekenis voor de praktijk

De resultaten suggereren dat het uitstellen van audiopruning tot na de eerste multimodale interacties efficiënter is dan het eerder in het proces verwijderen van audio-informatie. Dit kan gevolgen hebben voor de ontwikkeling van efficiëntere multimodale AI-systemen, bijvoorbeeld voor toepassingen waarin realtime verwerking van audio en video belangrijk is. De onderzoekers benadrukken dat hun aanpak zich onderscheidt door compressie toe te passen over de LLM-grens heen, in plaats van uitsluitend vóór de LLM.

Het paper is op 9 augustus 2026 ingediend en is geschreven door Kyeongyoon Lee, Hongyeob Kim, Youngeun Kim en Sungeun Hong. De volledige tekst is beschikbaar via de .

Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!