Het aanleren van complexe, behendige bewegingen aan robots in de fysieke wereld is traditioneel een tijdrovend en risicovol proces. De grootste hindernissen bij het gebruik van reinforcement learning (RL) zijn vaak de inefficiënte beginfase van het verkennen en het gevaar dat hardware beschadigd raakt door foutieve acties. Om deze problemen aan te pakken, is er een nieuwe methode ontwikkeld die gebruikmaakt van een specifieke steunstructuur om het leerproces te versnellen.
Volgens een recent wetenschappelijk rapport op arxiv.org maken onderzoekers gebruik van sampling-based model predictive control (MPC) als een vorm van 'scaffolding'. Deze techniek biedt de robot een gestructureerde basiservaring en taakgerichte begeleiding, waardoor menselijke demonstraties of correcties overbodig worden. Het systeem werkt door eerst een kleine hoeveelheid MPC-trajecten te verzamelen, die vervolgens dienen als basis voor het voorbereiden van het leermodel.
Zodra de robot online begint te leren, fungeert de MPC periodiek als gids bij het verzamelen van nieuwe data. Een zogenaamde off-policy Soft Actor-Critic leerling traint op basis van zowel de historische MPC-gegevens als de actuele fysieke interacties. Naarmate de robot vaardiger wordt, neemt het geleerde beleid geleidelijk de volledige controle over van de MPC-ondersteuning. Deze aanpak is gedetailleerd beschreven in de publicatie via .
Om de effectiviteit van dit framework te bewijzen, voerden de onderzoekers tests uit met een Allegro-hand, een robotisch systeem met 16 vrijheidsgraden. De specifieke opdracht was om een object continu in de hand te laten roteren. De resultaten tonen een opmerkelijke efficiëntie: na een initiële verzamelperiode van 12 minuten en een online trainingssessie van slechts 7 minuten, behaalde de robot een succespercentage van 100% tijdens de evaluaties. Bovendien was de rotatiesnelheid na 20 minuten training meer dan vijf keer hoger dan die van de oorspronkelijke MPC-controller.
De stabiliteit van het systeem werd verder bevestigd door een test waarbij de robot gedurende meer dan 110 minuten 1000 opeenvolgende rotaties uitvoerde zonder het object te laten vallen. De auteurs van het onderzoek, waaronder Emek Barış Küçüktabak, stellen dat het framework bovendien snel kan worden aangepast aan verschillende vormen van objecten en succesvol is in doelgestuurde reoriëntatie.
Uit analyses blijkt dat het succes van deze methode rust op drie pijlers: de initiële pretraining, het bewaren van MPC-ervaringen in het geheugen en de actieve begeleiding tijdens het online leerproces. Zoals vermeld in de documentatie op , maakt dit een efficiënte vorm van real-world RL mogelijk met minimale menselijke tussenkomst. Het onderzoek, dat op 14 september 2026 werd ingediend, biedt een significante verbetering in het verminderen van de tijd en risico's bij het trainen van complexe robotica. Hoewel de focus ligt op technische optimalisatie, kunnen dergelijke systemen in de toekomst mogelijk worden geïntegreerd met geografische data of navigatiediensten zoals google.de voor bredere toepassingen in logistieke omgevingen.