Onderzoekers hebben LatentAM ontwikkeld, een innovatief systeem voor 3D Gaussian Splatting dat robots in staat stelt om grootschalige omgevingen in real-time in kaart te brengen met behulp van geavanceerde visuele taalmodellen.
In een recent wetenschappelijk artikel, dat op 14 augustus 2026 in een herziene versie werd gepubliceerd, presenteren Junwoon Lee en Yulun Tian hun framework genaamd LatentAM. Dit systeem is specifiek ontworpen voor 'open-vocabulary robotic perception', wat betekent dat robots objecten in hun omgeving kunnen herkennen en begrijpen zonder dat ze vooraf specifiek voor elk object getraind zijn. Het framework maakt gebruik van streaming RGB-D observaties om schaalbare latente kenismaps op te bouwen.
Innovatie via Dictionary Learning
Een van de belangrijkste technische doorbraken van LatentAM is de manier waarop het omgaat met Vision-Language Model (VLM) embeddings. Traditionele methoden maken vaak gebruik van model-specifieke decoders om hoogdimensionale data te distilleren. LatentAM wijkt hiervan af door een benadering van 'online dictionary learning' te introduceren. Volgens de publicatie op arxiv.org is deze methode zowel model-agnostisch als vrij van pretraining. Dit stelt gebruikers in staat om verschillende VLMs tijdens de testfase eenvoudig te integreren via een plug-and-play systeem.
In de praktijk koppelt het systeem aan elke 'Gaussian primitive' een compacte query-vector. Via een aandachtsmeganisme met een leerbaar woordenboek kunnen deze vectoren worden omgezet in benaderde VLM-embeddings. Dit woordenboek wordt efficiënt geïnitieerd vanuit de binnenkomende datastroom en continu geoptimaliseerd om zich aan te passen aan de veranderende semantiek van de scène, waarbij gebruik wordt gemaakt van trust-region regularisatie.
Schaalbaarheid en Geheugenbeheer
Om te voorkomen dat het systeem vastloopt bij zeer lange trajecten of uitgestrekte omgevingen, hebben de onderzoekers een specifieke strategie voor mapmanagement ontwikkeld. Zoals beschreven door sciencestack.ai, maakt LatentAM gebruik van voxel hashing.
Bij deze methode wordt de optimalisatie beperkt tot een actieve lokale kaart die op de GPU wordt verwerkt. De globale kaart wordt daarentegen opgeslagen en geïndexeerd op de CPU. Deze scheiding zorgt ervoor dat het GPU-geheugengebruik binnen strikte grenzen blijft, waardoor het systeem stabiel blijft tijdens grootschalige operaties.
Prestaties en Resultaten
De effectiviteit van LatentAM is getest op publieke benchmarks en een eigen grootschalige dataset. De resultaten, zoals vermeld op aipapers.ai, tonen aan dat het framework een significant betere getrouwheid in de reconstructie van kenmerken bereikt dan huidige state-of-the-art methoden.
Wat betreft de snelheid presteert het systeem bijna in real-time, met een snelheid die varieert tussen de 12 en 35 frames per seconde (FPS), afhankelijk van de gebruikte dataset. Deze snelheid is cruciaal voor autonome robots die direct moeten reageren op hun omgeving.
Toegankelijkheid en Implementatie
Het onderzoek is geaccepteerd voor publicatie in RA-L (Robotics and Automation Letters). Om de wetenschappelijke gemeenschap te ondersteunen, hebben de auteurs de code en aanvullende informatie beschikbaar gesteld. De implementatie is terug te vinden op de github.com, terwijl verdere details over het project en visuele resultaten kunnen worden geraadpleegd via de projectpagina die wordt geciteerd op app.nz.