Onderzoekers hebben een nieuwe methode ontwikkeld, genaamd CARF, waarmee robots effectiever kunnen leren van imperfecte data door specifiek onderscheid te maken tussen succesvolle stappen en kritieke fouten.
Het verzamelen van demonstraties voor robotica gaat vaak gepaard met imperfecties. In de praktijk ontstaan er tijdens het trainen van robots niet alleen succesvolle trajecten, maar ook trajecten die onvolledig zijn of volledig mislukken. Traditionele methoden proberen deze mislukte pogingen vaak te benutten door segmenten te zoeken die, ondanks de uiteindelijke fout, toch vooruitgang richting het doel boekten. Echter, volgens een recent onderzoek gepubliceerd op arxiv.org wordt een cruciaal aspect over het hoofd gezien: het gedrag dat direct tot de fout leidt.
Asymmetrische supervisie
De kern van het nieuwe raamwerk, genaamd Contrastive Attraction-Repulsion of Failure-Guided Flow Matching (CARF), is het inzicht dat verschillende delen van een mislukt traject een fundamenteel verschillende vorm van supervisie bieden. De onderzoekers stellen dat er sprake is van een asymmetrie: segmenten die vooruitgang boeken moeten worden geïmiteerd, terwijl segmenten die kritiek zijn voor het falen expliciet moeten worden vermeden.
Om dit onderscheid mogelijk te maken, introduceert CARF een zogenaamde progress-based importance scorer. Deze scorer wordt uitsluitend getraind op basis van succesvolle expert-demonstraties en de resultaten van perturbaties daarvan. Hiermee kan het systeem per stap inschatten in hoeverre een actie bijdraagt aan het voltooien van de taak. Door deze scores toe te passen op mislukte trajecten, kan het systeem informatieve regio's identificeren.
Werking van het mechanisme
Het CARF-raamwerk maakt gebruik van een geünificeerd flow-matching doel. Dit mechanisme werkt via twee tegengestelde krachten:
1. Attractie: De robot wordt aangetrokken naar gedragingen die progressie boeken.
2. Repulsie: De robot wordt afgestoten van gedragingen die kritiek zijn voor het falen.
Door deze methode worden ambigue segmenten — delen van een traject die noch duidelijk bijdragen aan succes, noch direct tot falen leiden — uitgesloten. Dit voorkomt dat de robot onbetrouwbare instructies krijgt uit vage foutsegmenten, wat de algehele stabiliteit van het leerproces verhoogt.
Resultaten en validatie
De effectiviteit van CARF is getest via uitgebreide experimenten, zowel in gesimuleerde omgevingen als in de echte wereld. Volgens de publicatie op laat het systeem consistente verbeteringen zien ten opzichte van concurrerende baselines in diverse scenario's waarin fouten optreden. Ablatiestudies bevestigen bovendien dat zowel de scoring als het attractie-repulsie mechanisme essentieel zijn voor de behaalde prestaties.
Het onderzoeksteam, bestaande uit onder meer Shuqi Zhao, Bang Du en Masayoshi Tomizuka, heeft het werk op 18 september 2026 ingediend. De volledige details van de methodologie en de experimentele resultaten zijn beschikbaar via de . Hoewel er aanvullende technische data beschikbaar zijn via externe links zoals udy.be, vormt de wetenschappelijke paper de primaire bron voor de technische onderbouwing van dit nieuwe leerproces voor robots.