← Terug
Nieuwe RARM-methode optimaliseert beloningssystemen voor robotmanipulatie

Nieuwe RARM-methode optimaliseert beloningssystemen voor robotmanipulatie

Onderzoekers hebben een nieuw model ontwikkeld dat robotica-training efficiënter maakt door visuele voortgang nauwkeuriger te vertalen naar beloningen, wat vooral complexe taken met een lange tijdshorizon versnelt.

Het trainen van robots via reinforcement learning (RL) kampt vaak met een fundamenteel probleem: het ontwerp van de beloningsfunctie. Wanneer een robot pas een beloning krijgt na het volledig succesvol afronden van een taak (sparse rewards), is de feedback te zwak om effectief te leren. Handmatige, gedetailleerde beloningen (dense rewards) zijn daarentegen tijdrovend om te ontwerpen en werken vaak niet goed bij verschillende taken. Volgens een publicatie op arxiv.org vormt dit een aanzienlijke flessenhals voor robotmanipulatie.

Introductie van het Reference-Anchored Reward Model

Om dit probleem op te lossen, hebben Pengzhi Yang en collega's het Reference-Anchored Reward Model (RARM) geïntroduceerd. RARM fungeert als een lichtgewicht visuele comparator die in staat is om een enkele succesvolle demonstratie om te zetten in een dichte, voortgangsbewuste beloning.

Een cruciaal kenmerk van dit systeem is dat het model eenmalig wordt getraind op algemene video's met een contrastief temporeel doel. Hierdoor is er geen specifieke data van de robot zelf nodig, noch zijn er taakspecifieke labels of handmatige beloningsengineering vereist per individuele taak, zoals beschreven in de documentatie op alphaxiv.org.

Bestrijding van foutieve beloningen

Een bekend risico bij voortgangsgebaseerde beloningsmodellen is dat ze hoge scores kunnen toekennen aan toestanden die er visueel plausibel uitzien, maar fysiek incorrect zijn. RARM pakt dit aan via een zogenaamd confidence-gating mechanisme. Tijdens de implementatie matcht het model beelden van de huidige acties (rollout clips) met referentiebeelden.

Volgens de analyse op DeepPaper beloont het systeem alleen wanneer er sprake is van een zelfverzekerde voorwaartse progressie. Onzekere matches worden onderdrukt, waardoor het risico op zogenaamde 'false-positive' beloningen aanzienlijk wordt verminderd.

Resultaten in simulatie en praktijk

De effectiviteit van RARM is getest over een breed scala aan scenario's. Het model werd ingezet bij negen gesimuleerde manipulatietaken uit de datasets LIBERO en MetaWorld, evenals bij vier taken in de echte wereld. De resultaten tonen aan dat RARM de beste totale succespercentages behaalt tijdens de daaropvolgende RL-training.

De grootste winst is behaald bij taken met een lange tijdshorizon, zoals het vouwen van doeken. In dergelijke complexe taken zijn onbetrouwbare schattingen van de voortgang vaak zeer schadelijk voor het leerproces, maar RARM slaagt erin deze processen te stabiliseren, zoals vermeld in de .

Toegankelijkheid en open source

Het project is gericht op brede toepasbaarheid binnen de AI-gemeenschap. De broncode en de bijbehorende projectpagina zijn beschikbaar gesteld via github.com, waardoor andere onderzoekers de methode kunnen implementeren en verder kunnen ontwikkelen. Door de onafhankelijkheid van robot-specifieke data biedt RARM een schaalbare oplossing voor het automatiseren van beloningsfuncties in diverse robotica-omgevingen.

Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!