Onderzoekers hebben een nieuwe techniek ontwikkeld die de nauwkeurigheid van grote taalmodellen bij complexe wiskundige en programmeertaken aanzienlijk verhoogt. Door fragmenten van verschillende redeneerpaden samen te voegen, kan het systeem fouten uit individuele pogingen elimineren.
In een recent onderzoek beschreven in een publicatie op arxiv.org, presenteren Roy Miles en collega's een framework genaamd "Stitching Noisy Diffusion Thoughts". De methode richt zich op het verbeteren van het redeneerproces van AI-modellen tijdens de fase van test-time scaling. Traditioneel maken taalmodellen gebruik van zogenaamde 'chains-of-thought', waarbij meerdere redeneerpaden worden gegenereerd. De huidige strategieën om deze resultaten te aggregeren zijn echter vaak beperkt tot het niveau van de volledige trajecten; er wordt simpelweg gekozen voor het beste pad of er wordt gestemd op het uiteindelijke antwoord.
Beperkingen van traditionele aggregatie
Volgens de auteurs van het onderzoek gaat er bij de huidige methoden veel waardevolle informatie verloren. Wanneer een model een bijna correct antwoord genereert maar in de laatste stap een fout maakt, wordt het gehele traject vaak verworpen. Hierdoor wordt nuttig tussenwerk uit gedeeltelijk correcte pogingen genegeerd.
De nieuwe benadering lost dit op door een modulaire pijplijn te introduceren die exploratie scheidt van evaluatie en synthese. In plaats van te vertrouwen op één enkel lineair pad, creëert het systeem een herbruikbare pool van kandidaten op stapsniveau.
De werking van Reward-Guided Stitching
Het proces van "Stitching Noisy Diffusion Thoughts" verloopt in drie specifieke fasen. Allereerst worden er diverse en goedkope redeneertrajecten gesampled met behulp van een gemaskeerd diffusie-taalmodel. In de tweede fase wordt elke individuele tussenstap gescoord met een bestaand proces-beloningsmodel (Process Reward Model of PRM). Ten slotte worden de stappen met de hoogste kwaliteit uit verschillende trajecten aan elkaar "gestikt" tot één samengestelde rationele onderbouwing.
Deze gecombineerde rationale wordt vervolgens gebruikt om enkel het definitieve antwoord opnieuw te berekenen. Door deze methode te gebruiken, kan het systeem brede zoekopdrachten behouden zonder dat er sprake is van monolithische hybride architecturen.
Significante prestatiewinst en efficiëntie
De resultaten van het onderzoek, dat is ingediend voor , tonen aan dat deze stapsgewijze recombinatie vooral effectief is bij zeer moeilijke problemen. Het framework is bovendien "training-free", wat betekent dat er geen extra training van het model nodig is om deze verbeteringen te realiseren.
De concrete cijfers uit de publicatie op laten een aanzienlijke stijging in prestaties zien:
* De gemiddelde nauwkeurigheid steeg met maximaal 23,8% over zes verschillende taken op het gebied van wiskunde en codering.
* Er is een reductie in latentie (verwerkingstijd) bereikt tot 1,8x in vergelijking met traditionele diffusiemodellen zoals LLaDA en Dream, alsook unified architecturen zoals TiDAR.
De onderzoekers benadrukken dat de uiteindelijke "solver" een cruciale rol speelt in het omzetten van de samengestelde, maar soms nog imperfecte rationales, naar een accuraat eindantwoord. De code voor dit framework is publiekelijk beschikbaar gesteld via de links in de .