Onderzoekers hebben een nieuw model ontwikkeld, genaamd QueryArt, dat robots in staat stelt om de kinematische parameters van beweegbare objecten te bepalen op basis van een enkele afbeelding. Deze techniek moet de interactie en manipulatie van objecten door robots aanzienlijk verbeteren.
Het vermogen van een robot om te begrijpen hoe een object beweegt — bijvoorbeeld hoe een deur openzwaait of hoe een lade uitschuift — is essentieel voor effectieve manipulatie. In een recent onderzoek, gepubliceerd op 1 oktober 2026, presenteren Abdelrhman Werby en zijn collega's een methode om deze parameters te schatten met minimale visuele informatie. Volgens de publicatie op arxiv.org gebeurt dit doorgaans met slechts één RGB-afbeelding van een object dat de robot nog nooit eerder heeft gezien.
Beperkingen van huidige systemen
Traditionele benaderingen voor het schatten van articulatie koppelen vaak de segmentatie van onderdelen aan de schatting van de beweging. Dit maakt systemen kwetsbaar voor fouten wanneer onderdelen niet correct worden gedetecteerd of verkeerd worden geassocieerd. Daarnaast is het regresseren van 3D-geometrie vanuit een enkel beeld problematisch, omdat de schaal van het object vaak onbekend blijft.
Om deze problemen op te lossen, introduceert het team het model QueryArt. In plaats van het volledige object in één keer te analyseren, maakt QueryArt gebruik van een specifiek 2D-querypunt, een RGB-afbeelding en de intrinsieke eigenschappen van de camera. De term 'query' wordt in algemene zin gebruikt om een vraag of een specifiek verzoek om informatie aan te duiden, zoals beschreven in het cambridge.org. In de context van dit AI-model fungeert het querypunt als het specifieke referentiepunt waarover de robot informatie wil verkrijgen.
Werking en training van QueryArt
Het model is getraind om de 3D-articulatiegeometrie te schatten ten opzichte van het gekozen querypunt. De berekeningen worden uitgevoerd in eenheden van de diepte van dat specifieke punt, waardoor de doelwaarden identificeerbaar blijven vanuit de afbeelding alleen. Zodra er een enkele dieptemeting op het querypunt beschikbaar is, kan het model de schaal bepalen en de werkelijke metrische parameters herstellen.
Voor de training van QueryArt is gebruikgemaakt van een zorgvuldig samengestelde mix van synthetische datasets en gegevens uit de echte wereld. Volgens de auteurs van het presteert QueryArt op de meeste articulatiemetrieken beter dan recente baselines, zelfs wanneer het model wordt geconfronteerd met data die buiten de oorspronkelijke trainingsdistributie vallen.
Resultaten in de praktijk
Om de praktische toepasbaarheid te bewijzen, is QueryArt getest op een mobiele manipulator. Tijdens deze tests werden 57 manipulatiepogingen uitgevoerd, waarbij 16 verschillende objectonderdelen en vijf verschillende camerastandpunten werden gebruikt. De resultaten tonen een succespercentage van 70,2%.
De onderzoekers hebben zowel de code als ondersteunende video's beschikbaar gesteld via de om transparantie en verdere ontwikkeling binnen de robotica-gemeenschap te stimuleren. Deze ontwikkeling markeert een stap voorwaarts in hoe robots onbekende omgevingen kunnen interpreteren en fysiek kunnen beïnvloeden zonder dat daarvoor uitgebreide 3D-scans of vooraf bekende modellen van elk object nodig zijn.