Wetenschappers hebben een innovatief systeem genaamd ARIES-Mission2 ontwikkeld om de planning van missies voor onbemande luchtvaartuigen (UAV's) te verbeteren. Dit zogenaamde 'zero-shot Vision-Language-Action' (VLA) framework is specifiek ontworpen voor drones die op lage hoogte opereren. Volgens een arxiv.org vertonen huidige multimodale grote taalmodellen vaak tekortkomingen in ruimtelijke optimalisatie en routeplanning wanneer ze direct worden ingezet voor dergelijke missies.
Om deze beperkingen te overbruggen, maakt ARIES-Mission2 een strikt onderscheid tussen de visuele waarneming en de uiteindelijke fysieke route-optimalisatie. Het systeem verwerkt instructies in natuurlijke taal samen met satellietbeelden. Voor de analyse van taken wordt DeepSeek-V3 gebruikt, terwijl Molmo-7B wordt ingezet om doelen vast te stellen zonder dat hiervoor specifieke training nodig is. De resulterende pixelposities op de beelden worden vervolgens via geospatiale interpolatie vertaald naar exacte GPS-coördinaten.
Een kernpunt van het framework is de aanpak van de volgorde waarin doelen worden bezocht. Omdat visuele taalmodellen vaak inefficiënte routes genereren met onnodige terugkeerbewegingen, zet de back-end van ARIES-Mission2 dit proces om in een 'Traveling Salesperson Problem' (TSP). Het systeem evalueert vier verschillende kandidaat-routes om de meest kostenefficiënte gesloten lus te bepalen. Hierbij wordt de initiële volgorde van het taalmodel vergeleken met optimalisaties via methoden zoals Particle Swarm Optimization (PSO), GPSO en IPSO.
De prestaties van het systeem zijn getest op de UAV-VLPA-nano-30 benchmark. Uit het blijkt dat ARIES-Mission2 een totale vliegafstand van 62,43 kilometer behaalde. Dit is 21,6% korter dan de niet-geoptimaliseerde VLA-baseline en zelfs 9,5% korter dan routes die handmatig door menselijke experts waren samengesteld.
Naast de kortere afstanden is de snelheid van het systeem opvallend. De volledige workflow voor 30 taken kostte 575,40 seconden, wat neerkomt op gemiddeld 19,18 seconden per taak. Dit is ongeveer 3,6 keer sneller dan de planning door mensen. Een analyse van de rekentijd laat zien dat de inferentie van het visuele taalmodel de meeste tijd in beslag neemt (19,02 seconden per taak), terwijl de TSP-solver slechts 0,16 seconden per taak vereist. De onderzoekers merken op dat de TSP-module een lage groei in rekentijd vertoont bij een toenemend aantal doelen, wat de schaalbaarheid van het systeem ten goede komt.
Hoewel de naam van het framework is afgeleid van het sterrenbeeld Ram, is er geen technisch verband met astrologie. Waar bronnen over het zodiacsign.com zich richten op persoonlijkheidskenmerken zoals moed en vastberadenheid, is de naamgeving in dit geval puur symbolisch. De technische details van het AI-framework zijn volledig beschreven in de van 13 augustus 2026.