⚠️ KMI waarschuwing: Onweer in België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
Nieuwe methode 'Learning from Hindsight' verhoogt efficiëntie van robotische leersystemen

Nieuwe methode 'Learning from Hindsight' verhoogt efficiëntie van robotische leersystemen

Onderzoekers hebben een nieuwe techniek ontwikkeld genaamd Learning from Hindsight (LfH), die robots in staat stelt om te leren van hun eigen fouten. Deze methode verbetert de efficiëntie van vision-language-action (VLA) modellen aanzienlijk, waardoor minder fysieke interacties nodig zijn om complexe taken te beheersen.

Het trainen van robots via reinforcement learning (versterkingsleren) is een kostbaar en tijdrovend proces. Een groot probleem bij huidige VLA-modellen is de zogenaamde 'sample inefficiency'. Dit houdt in dat het systeem zeer veel pogingen nodig heeft voordat het een taak succesvol uitvoert, vooral wanneer succesvolle resultaten zeldzaam zijn. Volgens een publicatie op arxiv.org worden mislukte pogingen in traditionele systemen vaak als waardeloos beschouwd als de uiteindelijke opdracht niet volledig is voltooid.

Leren van mislukkingen

De kern van de nieuwe methode, Learning from Hindsight (LfH), is het omzetten van fouten in bruikbare leersignalen. In de huidige standaardbenadering krijgt een robot alleen een beloning wanneer de specifieke opdracht is voltooid. Als een robot bijvoorbeeld een object in een kom moet plaatsen maar dit niet lukt, wordt de hele actie als een mislukking geregistreerd.

De onderzoekers, waaronder Iris Xu en Sunshine Jiang, stellen in hun dat een robot die faalt in de hoofttaak, vaak wel gedragingen vertoont die nuttig zijn. Een robot kan een object bijvoorbeeld wel in de richting van de kom bewegen, of per ongeluk een ander object in de kom plaatsen. Hoewel de hoofddoelstelling niet is behaald, zijn deze acties wel relevant. LfH maakt gebruik van een vooraf getraind vision-language model om deze mislukte pogingen achteraf te herlabelen. De robot leert zo welke acties hij daadwerkelijk heeft uitgevoerd, waardoor er 'hulpstaken' ontstaan die als opstap dienen naar de uiteindelijke, complexere taak.

Significante verbeteringen in prestaties

De effectiviteit van LfH is getest op verschillende scenario's, waaronder de LIBERO-PRO manipulatietaken. Uit de resultaten blijkt dat LfH vergelijkbare prestaties levert als de GRPO-methode, maar met aanzienlijk minder data. Volgens de waren er ongeveer vijf keer minder rollouts (pogingen) nodig om hetzelfde resultaat te bereiken.

De impact is nog duidelijker zichtbaar bij tests met een fysieke Franka-robot. In deze setting steeg het succespercentage van 0% naar 56% binnen slechts 160 trainingspogingen. Ter vergelijking: de GRPO-methode behaalde in dezelfde periode een succespercentage van 22%, zoals beschreven in de .

Toepassing en toekomst

Door het jointly trainen op zowel de oorspronkelijke opdracht als de nieuw gecreëerde hulpstaken, kunnen VLA-backbones sneller convergeren naar een werkende oplossing. Dit is cruciaal voor de robotica, aangezien fysieke interacties in de echte wereld duur zijn en slijtage van hardware veroorzaken.

De publicatie, die op 5 oktober 2026 in een herziene versie (v2) werd geplaatst op , markeert een stap voorwaarts in hoe machines omgaan met negatieve resultaten. In plaats van mislukkingen te negeren, worden ze nu ingezet als essentiële bouwstenen voor succes.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!