De inzet van Visual-Language Models (VLMs) op apparaten met beperkte rekenkracht, zoals smartphones en lokale sensoren, wordt momenteel bemoeilijkt door de enorme hoeveelheid data die moet worden verwerkt. Modellen zoals LLaVA kunnen tot wel 729 visuele tokens per afbeelding genereren, wat een zware wissel trekt op de beschikbare hardware. Volgens een wetenschappelijke publicatie op arxiv.org vormt deze computationele druk een aanzienlijke barrière voor de praktische implementatie van deze technologie op 'edge'-apparaten.
Om deze efficiëntieproblemen op te lossen, hebben Baptiste Rossigneux en zijn team het algoritme ClustRS ontwikkeld. Het bijzondere aan deze methode is dat het een 'training-free' benadering is. Dit houdt in dat het algoritme direct kan worden geïntegreerd in bestaande modelarchitecturen zonder dat er sprake hoeft te zijn van een tijdrovend en kostbaar hertrainingsproces.
De werking van ClustRS rust op twee technische pijlers. Ten eerste maakt het gebruik van 'attention-weighted clustering', waarbij representatieve tokens worden geselecteerd uit semantische clusters op basis van hun aandachtsgewichten. Ten tweede wordt er gebruikgemaakt van 'Residual Shrinkage', een proces voor ruisonderdrukking dat in een enkele pass wordt uitgevoerd op de geselecteerde tokens. Deze combinatie zorgt ervoor dat het model niet alleen sneller reageert, maar ook minder vatbaar is voor verstoringen in de beelden. In een analyse via arxiv-troller.com wordt gesteld dat deze aanpak de robuustheid van LLaVA tegen diverse vormen en intensiteiten van beeldruis aanzienlijk verbetert.
De prestaties van het algoritme zijn uitgebreid getest met behulp van de benchmarks ScienceQA-IMG en MM-VET. Hieruit blijkt dat ClustRS effectiever is dan traditionele pruning-methoden, die vaak enkel steunen op diversiteit of specifieke scores. Bij tests met LLaVA 1.5 7b leverde de methode tot 20% betere resultaten op onder extreme omstandigheden, terwijl het aantal tokens met maar liefst 97% werd teruggebracht; er bleven in dat geval slechts 16 tokens over.
Ook bij LLaVA-OneVision waren de resultaten positief. Onder milde ruiscondities slaagde het algoritme erin om de prestaties van de baseline te evenaren, terwijl er minder dan een derde van de oorspronkelijke tokens nodig was. Om de transparantie en reproduceerbaarheid van dit onderzoek te waarborgen, zijn de evaluatiedata van de LLaVA-1.5 tests op MM-VET en ScienceQA-IMG openbaar gemaakt. Deze resultaten zijn onder meer terug te vinden via mendeley.com.
De dataset is daarnaast opgenomen in de catalogus van de National Library of Medicine, wat de toegankelijkheid voor de bredere wetenschappelijke gemeenschap in de machine learning en computer vision vergroot. De onderzoekers concluderen dat ClustRS een krachtig en toegankelijk alternatief biedt voor complexe pruning-regels, waardoor visuele taalmodellen in de toekomst efficiënter en bestendiger kunnen worden ingezet in real-world scenario's. Voor meer informatie over de implementatie en gerelateerde tools kunnen ontwikkelaars terecht bij de github.com.