Onderzoekers hebben een nieuwe variant van Group Relative Policy Optimization (GRPO) ontwikkeld die grote taalmodellen in staat stelt om moeilijke problemen op te lossen waar traditionele reinforcement learning-methoden vastlopen. De methode, genaamd Off-Context GRPO, maakt gebruik van bevoorrechte informatie tijdens de training om het leerproces te versnellen.
Binnen de ontwikkeling van grote taalmodellen (LLM's) wordt vaak gebruikgemaakt van Reinforcement Learning with Verifiable Rewards (RLVR). Deze techniek helpt modellen om hun redeneervermogen te verbeteren door beloningen te koppelen aan correcte antwoorden. Echter, een fundamenteel probleem bij deze aanpak is de zogenaamde 'leercliff'. Wanneer een probleem zo complex is dat het model geen enkele correcte oplossing kan genereren, is er geen sprake van een positieve beloning. Hierdoor ontvangt het model geen enkel signaal om van te leren, waardoor de vooruitgang volledig stagneert.
De doorbraak van Off-Context GRPO
Om dit probleem op te lossen, hebben Priyank Agrawal en zijn collega's een nieuwe benadering geïntroduceerd. In een recent gepubliceerd onderzoek op arxiv.org presenteren zij Off-Context GRPO (OC-GRPO). De kern van deze innovatie is het gebruik van bevoorrechte begeleiding tijdens de trainingsfase.
In plaats van het model blindelings te laten zoeken naar een oplossing, krijgt het model tijdens de training hulp in de vorm van 'solution prefixes' (beginstappen van een oplossing). Deze begeleiding stuurt het model richting een correct antwoord, waardoor er wel een beloning wordt gegenereerd, zelfs bij zeer moeilijke opdrachten. De onderzoekers noemen deze specifieke pogingen 'off-context rollouts', omdat ze worden gegenereerd op basis van een prompt die extra informatie bevat die het model in de uiteindelijke praktijk niet zal hebben.
Voorkomen van instabiliteit
Een risico bij het trainen met extra begeleiding is dat het model afhankelijk wordt van die hulp, wat kan leiden tot een mismatch wanneer de begeleiding wordt weggehaald. Om dit te voorkomen, maakt OC-GRPO gebruik van een 'importance-corrected objective'. Deze wiskundige correctie zorgt ervoor dat de updates van het model worden teruggestuurd naar het oorspronkelijke, onbegeleide doel. Hierdoor leert het model de redeneerstappen te internaliseren zonder dat het tijdens de uiteindelijke uitvoering nog steeds die externe hints nodig heeft.
Volgens de details in de publicatie op is OC-GRPO een minimale aanpassing van de bestaande GRPO-structuur, wat betekent dat de implementatie relatief eenvoudig is.
Concrete resultaten en prestaties
De effectiviteit van de nieuwe methode is getest op diverse standaard benchmarks voor wiskundig redeneren. De resultaten tonen een significante verbetering ten opzichte van de standaard GRPO-methode. De onderzoekers rapporteren een absolute verbetering van 3,9%, wat neerkomt op een relatieve winst van 13,8% in de prestaties van het model.
Opvallend is dat deze prestatiewinst wordt behaald met minimale extra kosten. De computationele overhead is verwaarloosbaar, wat OC-GRPO tot een efficiënt alternatief maakt voor het trainen van modellen op complexe taken.
Context en implicaties
Het onderzoek, dat op 21 juli 2026 is ingediend bij , is onderverdeeld in diverse vakgebieden, waaronder Machine Learning (cs.LG) en Artificial Intelligence (cs.AI). De publicatie van 24 pagina's biedt een gedetailleerd kader voor hoe bevoorrechte informatie kan worden ingezet om de beperkingen van huidige RLVR-systemen te doorbreken.
Door de 'leercliff' te overbruggen, opent OC-GRPO de deur naar het trainen van AI-modellen op problemen die voorheen als onmogelijk werden beschouwd binnen een reinforcement learning-kader. De methode bewijst dat strategische begeleiding tijdens de trainingsfase, mits correct gecorrigeerd, leidt tot robuustere en intelligentere modellen in de uiteindelijke toepassing. Voor meer informatie over de technische implementatie kunnen geïnteresseerden de volledige PDF raadplegen via de .