Onderzoekers hebben TANGO ontwikkeld, een nieuw framework dat humanoïde robots in staat stelt om door overvolle binnenruimtes te navigeren op basis van natuurlijke taalinstructies. Het systeem maakt gebruik van een 'whole-body' benadering om botsingen te vermijden in complexe driedimensionale omgevingen.
In een recent gepubliceerd wetenschappelijk rapport beschrijven onderzoekers, waaronder Anqi Li en collega's, de ontwikkeling van TANGO. Dit systeem is ontworpen om de beperkingen van traditionele navigatiemethoden te overstijgen. Waar conventionele systemen navigatie vaak benaderen als een tweedimensionaal padplanningsprobleem, erkent TANGO dat een humanoïde robot in een rommelige omgeving voortdurend zijn volledige lichaam moet aanpassen om obstakels te passeren.
Geavanceerde lichaamsaanpassing en sturing
Volgens de publicatie op arxiv.org vereist het doorkruisen van complexe ruimtes een continue, geometrie-bewuste aanpassing van het hele lichaam. Dit omvat niet alleen de loopbewegingen, maar ook de coördinatie van armplaatsing en aanpassingen van de romp. TANGO fungeert als het eerste vision-language navigatieframework dat specifiek is gericht op deze volledige lichaamsbeheersing voor humanoïden.
Het systeem werkt door natuurlijke taalinstructies te combineren met egocentrische RGB-waarnemingen (beelden vanuit het perspectief van de robot). Op basis hiervan voorspelt TANGO direct acties voor 29 verschillende vrijheidsgraden (degrees of freedom) in de gewrichten, die vervolgens worden omgezet in concrete bewegingen voor de besturing van het lichaam.
Training in simulatie en real-world toepassing
De training van TANGO vond volledig plaats in een gesimuleerde omgeving. Om het model te leren hoe het veilig door hindernissen moet manoeuvreren, synthetiseerden de onderzoekers diverse botsingsvrije bewegingen. Dit proces omvatte globale padplanning, kinematische generatie van bewegingen voor het hele lichaam, het bewerken van bewegingen op basis van obstakels en tracking via reinforcement learning (RL).
In uitgebreide simulatie-experimenten presteerde TANGO beter dan sterke modulaire baselines, vooral in scenario's waar actieve onderhandeling met obstakels noodzakelijk was. Een significante mijlpaal was de implementatie op een fysieke robot. De onderzoekers hebben TANGO 'zero-shot' ingezet op een Unitree G1 humanoïde robot. Dit betekent dat de robot in staat was om robuust door overvolle, echte omgevingen te navigeren zonder dat er vooraf training met echte navigatiegegevens was uitgevoerd, zoals vermeld in de .
Context en onderscheid
Hoewel de naam "Tango" in diverse commerciële contexten voorkomt, is er geen enkel verband tussen dit robotische framework en andere diensten of producten met dezelfde naam. Zo is er een platform voor live streaming en videochat dat bekend staat als tango.me, en een webshop gespecialiseerd in schoeisel onder de naam tangoshoes.com. Deze laatste biedt diverse collecties aan, waaronder loafers en sneakers, maar heeft geen relatie met de robotica-onderzoeken van Li en zijn team.
De focus van het TANGO-project ligt puur op de integratie van visuele waarneming, taalbegrip en fysieke actie (Vision-Language-Action) om de autonomie van humanoïde robots in menselijke leefomgevingen te vergroten. Door de overstap van 2D-planning naar 3D-lichaamsbewustzijn kunnen robots effectiever opereren in ruimtes die voorheen te complex waren voor standaard navigatiesystemen.