← Terug
Nieuw DAVSS-model combineert efficiëntie van State Space Models met kracht van Transformers

Nieuw DAVSS-model combineert efficiëntie van State Space Models met kracht van Transformers

Onderzoekers hebben het Distilled Audio-visual State-Space (DAVSS) model ontwikkeld, dat door middel van kennisdistillatie aanzienlijk kleiner is dan traditionele transformer-modellen terwijl de prestaties verbeteren.

In een recent wetenschappelijk rapport, gepubliceerd op 20 augustus 2026, presenteren Saurabhchand Bhati en collega's een nieuwe benadering voor multimodale AI. Het voorgestelde model, genaamd DAVSS, is ontworpen om de hoge prestaties van transformer-architecturen te combineren met de computationele efficiëntie van State-space models (SSM's). Volgens de publicatie op arxiv.org wordt dit bereikt door een proces van kennisdistillatie, waarbij een transformer fungeert als 'leraar' voor het SSM-model.

Significante reductie in modelomvang

Een van de meest opvallende kenmerken van het DAVSS-model is de geringe omvang in vergelijking met bestaande technologieën. Met slechts 14 miljoen parameters is het nieuwe model twaalf keer kleiner dan transformer-gebaseerde alternatieven, zoals het CAV-MAE-model. Ondanks deze drastische vermindering in omvang, claimen de auteurs in hun dat DAVSS deze grotere modellen qua prestaties zelfs overtreft.

Innovaties in resolutie en modellering

De verbeterde prestaties van DAVSS worden toegeschreven aan twee specifieke technische aanpassingen. Ten eerste maakt het model gebruik van een fijnere inputresolutie. Door kleinere 'patch sizes' te gebruiken bij het verwerken van de input, kan het model de kleinere omvang compenseren door de lengte van de inputsequenties te verhogen. De onderzoekers merkten op dat een grotere patch size juist leidde tot lagere prestaties, wat de keuze voor deze fijnere resolutie rechtvaardigt, aldus de .

Ten tweede is er gekozen voor een diepere gezamenlijke modellering van audio en visuele data. In het CAV-MAE-model wordt minder dan 5% van het model gebruikt voor de gezamenlijke verwerking van deze modaliteiten. DAVSS breidt dit uit naar 30% van het model. Deze aanpassing maakt een intensievere cross-modale interactie mogelijk zonder dat dit leidt tot een significante stijging van de computationele kosten die normaal gesproken gepaard gaan met het samenvoegen van audio-visuele tokens, zoals beschreven in de .

Context van AI-ontwikkeling

De ontwikkeling van DAVSS past in een bredere trend binnen de kunstmatige intelligentie waarbij gezocht wordt naar modellen die minder rekenkracht vereisen maar toch accuraat blijven. Terwijl grote taalmodellen en multimodale systemen vaak enorme hoeveelheden parameters vereisen, tonen technieken zoals kennisdistillatie aan dat compactere modellen effectief kunnen zijn. Hoewel platforms zoals GitHub diverse AI-modellen ondersteunen voor ontwikkelaars, richt het specifieke onderzoek naar DAVSS zich op de fundamentele architectuur van audio-visuele verwerking.

Het onderzoek is ingediend onder de categorie 'Audio and Speech Processing' en biedt een potentieel kader voor toekomstige multimodale systemen die moeten draaien op hardware met beperkte middelen, zonder in te boeten op de kwaliteit van de analyse. De volledige details over de implementatie en de testresultaten zijn beschikbaar via de .

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!