Wetenschappers hebben een innovatieve methode ontwikkeld die robots in staat stelt om gerichte correcties aan te brengen in langdurige processen. In plaats van een volledige herhaling van menselijke demonstraties, richt dit nieuwe systeem zich specifiek op de momenten waarop een robot vastloopt tijdens een complexe reeks handelingen.
Binnen de robotica vormen zogenaamde 'long-horizon' taken een grote uitdaging. Dit zijn processen die uit een lange keten van opeenvolgende acties bestaan. Hoewel veel moderne robots al beschikken over een basismodel dat het grootste deel van het werk kan verrichten, treden er vaak fouten op bij specifieke, kritieke subtaken. Traditionele verbeteringstechnieken, zoals supervised fine-tuning, zijn vaak inefficiënt omdat ze vereisen dat een mens de volledige taak opnieuw voordoet, ook de delen die de robot al correct uitvoert.
Om deze inefficiëntie tegen te gaan, hebben Sichang Su en een team van onderzoekers het framework PARTS geïntroduceerd, wat staat voor Policy Adaptation with RL on Targeted Subtasks. Volgens een wetenschappelijke publicatie op arxiv.org concentreert deze aanpak zich uitsluitend op de knelpunten in een proces. In plaats van het gehele model opnieuw te trainen, wordt de training gericht op de specifieke stappen waar de robot herhaaldelijk faalt.
Het technische proces van PARTS steunt op een bevroren, vooraf getraind model dat de basisacties aanstuurt. Tegelijkertijd worden er selectoren en succesverificateurs ingezet die gebruikmaken van residuele correcties. Dit houdt in dat de robot kleine aanpassingen maakt aan de bestaande acties om fouten te herstellen. De verificateurs geven lokale beloningen zodra een subtak succesvol is afgerond, waardoor de robot kan leren van deelsuccessen, zelfs als het uiteindelijke einddoel nog niet is bereikt. Deze methodiek is beschreven in het onderzoek via .
De praktische effectiviteit van het systeem is getest op diverse robotplatforms met opvallende resultaten. Voor bimanuale YAM-robots steeg het succespercentage van de volledige taak van 32% naar 61%. Bij single-arm Franka-robots was de verbetering nog sterker, waarbij het succespercentage toenam van 50% naar 95%. Deze cijfers zijn opgenomen in de documentatie op .
Een cruciaal aspect van PARTS is de drastische vermindering van de benodigde menselijke interventie. Waar oudere methoden zwaar leunden op uitgebreide handmatige demonstraties, beperkt de menselijke rol zich bij PARTS tot het aanwijzen van de knelpunten aan het begin en het fysiek resetten van de omgeving indien nodig. Bovendien konden deze resultaten worden behaald met een beperkte trainingstijd, waarbij gemiddeld slechts enkele tientallen minuten aan real-world RL-rollouts per taak nodig waren.
In vergelijking met bestaande methoden voor real-world RL-fine-tuning zorgt PARTS voor een stijging van het succespercentage van volledige taken met meer dan 25% binnen hetzelfde budget aan robot-rollouts. Het onderzoek, dat op 18 september 2026 werd ingediend bij , combineert online reinforcement learning met succes-gewogen hertraining. Hierdoor ontstaat een cyclus van continue optimalisatie, waarbij elke verbeterde residuele policy opnieuw wordt ingezet om verdere ervaring op te doen.