Wetenschappers hebben een innovatief AI-model ontwikkeld dat in staat is om vanuit egocentrische video's — beelden vanuit het perspectief van de drager — de exacte bewegingen van zowel de camera als beide handen in wereldcoördinaten te reconstrueren. Dit nieuwe systeem, genaamd MINT (Minting IN-the-Wild Trajectories), biedt een oplossing voor een complex probleem binnen de computer vision.
Voorheen werden dergelijke trajecten vaak via een gefragmenteerd proces bepaald, waarbij diepteperceptie, camerabeweging en handreconstructie in afzonderlijke fasen werden behandeld. Volgens een wetenschappelijke publicatie op arxiv.org zorgde deze aanpak voor een hoge rekenlast en een gebrek aan integrale modellering van de interactie tussen de gebruiker en de camera. MINT doorbreekt deze trend door als een 'foundation model' direct volledige trajecten van twee handen in de wereldruimte te genereren op basis van standaard RGB-videobeelden.
Het model hanteert een gedeelde spatiotemporele videorepresentatie. Hiermee kan MINT gelijktijdig drie essentiële elementen voorspellen: het traject van de camera, de positie van de handen ten opzichte van het beeldkader en de aanwezigheid van de handen per frame. Door middel van specifieke coördinatietransformaties kan het systeem vervolgens de fysieke bewegingen in de werkelijke ruimte bepalen. Deze methodiek is uitvoerig beschreven in het onderzoek op .
Een significante uitdaging bij de ontwikkeling was het tekort aan kwalitatieve datasets met nauwkeurige annotaties van zowel camera- als handbewegingen. Om dit op te lossen hebben onderzoekers, waaronder Guanqi He en Zijie Zhu, EGOPIPELINE ontwikkeld. Dit open-source labelingsysteem stelt hen in staat om grote hoeveelheden publieke egocentrische video's om te zetten in gestructureerde supervisiedata. Het trainingsproces van MINT verliep in twee stappen: een initiële training op basis van 'pseudo-labels' uit de EGOPIPELINE, gevolgd door een verfijning met een kleinere set hoogwaardige, handmatig geannoteerde gegevens.
De praktische toepassingen van deze technologie zijn divers. Het vermogen om bewegingen in wereldcoördinaten te herstellen is cruciaal voor het analyseren van menselijke activiteiten, het versnellen van robotisch leren door menselijke handelingen te kopiëren en het optimaliseren van interacties binnen Augmented Reality (AR). In de publicatie via wordt gesteld dat MINT superieure resultaten behaalt op publieke benchmarks. Het model is niet alleen nauwkeuriger en sneller dan de oorspronkelijke labelingspijplijn, maar vertoont ook 'zero-shot' generalisatie, wat betekent dat het effectief functioneert op datasets die niet in de trainingsset voorkwamen.
Om verdere innovatie te stimuleren, is het project open-source gemaakt. Dit omvat het MINT-model, de trainings- en inferentiecode, de EGOPIPELINE-pijplijn en een dataset van egocentrische trajecten met een totale duur van 1.021 uur. Hoewel de technologie zich richt op complexe data-analyse, profiteert het indirect van de enorme hoeveelheid visuele data die wereldwijd wordt gegenereerd op platforms zoals google.com, waar point-of-view content in grote mate wordt gedeeld. De integratie van AI-modellen zoals MINT kan deze stroom aan video-informatie in de toekomst transformeren tot bruikbare 3D-data.