In de wereld van de robotica vormt de balans tussen de rekenkracht van een model en de uiteindelijke prestaties een constante uitdaging. Hoewel omvangrijke modellen vaak superieure resultaten boeken, is er voor praktische toepassingen een grote behoefte aan compacte systemen die minder hardwarebronnen vereisen. Om dit probleem aan te pakken, hebben Iok Tong Lei en collega-onderzoekers XS-VLA ontwikkeld, een gestructureerd trainingsraamwerk dat specifiek is ontworpen om de controle van kleine modellen te verbeteren.
Volgens een wetenschappelijk rapport op arxiv.org maakt XS-VLA gebruik van een innovatieve tweestapsbenadering om de efficiëntie van Vision-Language-Action (VLA) modellen te verhogen. In de eerste fase wordt gebruikgemaakt van 'Coarse-Grained Spatial Distillation' (CSD). Hierbij wordt de basis van het model geïnitialiseerd via een hulpfunctie die ruimtelijke labels gebruikt, afgeleid van een zogenaamd 'teacher'-model. Dit stelt het systeem in staat om een fundamenteel begrip van de ruimtelijke context te ontwikkelen voordat het overgaat naar het aanleren van complexe acties.
De tweede fase van het proces richt zich op 'Latent Flow Matching' (LFM). In deze stap wordt een snelheidsveld in de actieruimte geconditioneerd op een latentie van een demonstratie. Door de inzet van KL-regularisatie worden de actiemodules en de backbone gelijktijdig geoptimaliseerd. Een essentieel kenmerk van dit ontwerp is dat het model na de training volledig autonoom functioneert; er is tijdens de uitvoering geen toegang meer nodig tot de posterior encoder of het teacher-model. Deze methodiek sluit aan bij bredere educatieve principes waarbij gestructureerde instructies en conditionering helpen bij het beheersen van complexe vaardigheden, zoals beschreven in overzichten over savemyexams.com.
De resultaten van de implementatie tonen een significante stijging in prestaties. Uit de blijkt dat XS-VLA in de LIBERO-benchmark een gemiddeld succespercentage van 90,25% behaalde over twee trainingssessies. Ter vergelijking scoorde een SmolVLA-256M basismodel, dat onder identieke instellingen werd getraind, 86,00%.
Nog sterker zijn de verbeteringen zichtbaar bij het uitvoeren van Mobile ALOHA-taken. In deze scenario's steeg het gemiddelde strikte succespercentage van 21,7% naar 65,0% dankzij de XS-VLA-methode. Deze cijfers bewijzen de effectiviteit van het initialiseren van representaties via hulpfuncties en het gebruik van geregulariseerd leren op basis van demonstraties.
Ondanks deze prestatiewinst blijft de architectuur van het model zeer compact. De uiteindelijke beleidsmodule van XS-VLA bevat 243,99 miljoen parameters, wat het model uitermate geschikt maakt voor omgevingen met strikte hardwarebeperkingen. De onderzoekers, waaronder Wei Huang en Qingchen Xie, hebben via diverse ablatie-analyses bevestigd dat de combinatie van ruimtelijke supervisie en demonstratie-conditionering cruciaal is voor het succes van dit model.
Het volledige onderzoek, waarvan de laatste revisie op 30 september 2026 is geplaatst, is raadpleegbaar via de . De auteurs concluderen dat hun benadering een levensvatbaar pad biedt naar de ontwikkeling van krachtigere, maar kleinere AI-gestuurde robotsystemen.