← Terug
Onderzoek naar semantische robotlokalisatie via Vision-Language Models ingetrokken

Onderzoek naar semantische robotlokalisatie via Vision-Language Models ingetrokken

Een ambitieus project om de navigatie van robots in binnenruimtes te verbeteren, is onlangs stopgezet door de auteurs zelf. Het onderzoek richtte zich op het lokaliseren van robots in omgevingen waar GPS-signalen ontbreken, een probleem dat traditioneel wordt aangepakt via geometrische berekeningen. De onderzoekers Suraj Borate, Aarav Shah en Madhu Vadali probeerden dit echter op te lossen door gebruik te maken van semantische redenering.

Bij semantiek draait het in essentie om de betekenis van taal en symbolen, wat in deze context betekent dat de robot objecten in zijn omgeving moet herkennen en deze moet koppelen aan een gelabelde kaart, vergelijkbaar met hoe mensen hun weg vinden. Volgens de definitie van merriam-webster.com heeft dit betrekking op de betekenis van tekens en hun interpretatie. Door deze benadering te gebruiken, hoopten de wetenschappers een intuïtievere vorm van lokalisatie te creëren.

De technische basis van het systeem was een Vision-Language Model (VLM), specifiek het Qwen2.5-VL-7B. Om dit model geschikt te maken voor het voorspellen van exacte coördinaten, werd er gebruikgemaakt van Low-Rank Adaptation (LoRA) en een speciaal ontworpen 'regression head'. Hierdoor kon het model direct de x- en y-positie en de richting (theta) van de robot bepalen. Het systeem putte uit drie verschillende bronnen: beelden van een frontale camera, een polaire LiDAR-scan en een semantische rasterkaart van bovenaf. Zoals beschreven in de publicatie op arxiv.org, werd het model getraind met een dataset uit Gazebo die bestond uit ruim 120.000 monsters verspreid over 527 scenario's.

De aanvankelijke resultaten waren zeer veelbelovend. De onderzoekers rapporteerden een positienauwkeurigheid van 98,23 procent en een algehele pose-nauwkeurigheid van 96,75 procent. De gemiddelde foutmarge in positie was slechts 0,11 meter. Bovendien leek het model robuust te zijn tegen onbekende objecten; bij het testen met zeven nieuwe categorieën daalde de nauwkeurigheid slechts marginaal naar 90,99 procent. Ook bij verouderde kaarten bleef het systeem relatief stabiel, wat suggereerde dat het model daadwerkelijk semantische ruimtelijke verbanden begreep in plaats van enkel beelden uit het hoofd te leren.

De analyse van de sensoren toonde aan dat de combinatie van camera en kaart al een nauwkeurigheid van 95,06 procent bereikte. De LiDAR-sensor bleek echter onmisbaar in situaties waarin de camera geen herkenbare objecten zag, zoals bij een blinde muur. In die specifieke gevallen hield de LiDAR de nauwkeurigheid op 92,33 procent, terwijl deze zonder deze sensor zou zakken naar 70,74 procent. De LiDAR fungeerde dus als een essentieel vangnet wanneer visuele informatie tekortschoot.

Ondanks deze indrukwekkende cijfers is de studie inmiddels officieel ingetrokken. In de documentatie op gaven de auteurs aan dat een deel van de gepresenteerde resultaten niet gereproduceerd kon worden. De onderzoekers hebben toegezegd de data opnieuw te analyseren en betrouwbaardere experimenten uit te voeren voordat ze eventueel nieuwe resultaten publiceren. Deze ontwikkeling onderstreept de uitdagingen bij het implementeren van complexe Vision-Language Models voor precisietaken, waarbij de stap van theoretische modellen naar reproduceerbare praktijkresultaten vaak problematisch blijft. De volledige details over de intrekking zijn terug te vinden via de bron op .

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!