← Terug
Nieuwe methode S2T-RLHF probeert instabiliteit in AI-training te verminderen

Nieuwe methode S2T-RLHF probeert instabiliteit in AI-training te verminderen

Onderzoekers hebben een nieuw framework ontwikkeld genaamd S2T-RLHF, dat gericht is op het stabiliseren van het trainingsproces bij kunstmatige intelligentie door beloningen op een hiërarchische manier te verdelen.

Binnen de ontwikkeling van grote taalmodellen is Reinforcement Learning from Human Feedback (RLHF) een cruciale techniek. Hierbij leert een model welke antwoorden wenselijk zijn op basis van menselijke voorkeuren. Echter, een hardnekkig probleem bij deze methode is de instabiliteit tijdens de trainingsfase. Volgens een recent onderzoekspapier op arxiv.org komt dit grotendeels voort uit de manier waarop beloningen worden toegewezen aan de gegenereerde tekst.

Het probleem van de 'single scalar reward'

In standaard RLHF-processen krijgt een volledig antwoord (een sequentie) één enkele numerieke score, ook wel een scalar reward genoemd. Deze score geeft aan of het totale antwoord goed of slecht is. Het probleem ontstaat wanneer deze globale score wordt gebruikt om updates door te voeren op het niveau van individuele tokens (woorden of lettergrepen).

De auteurs van het onderzoek, waaronder Wei Chen en Guanghui Zhu, stellen dat dit leidt tot ambiguïteit in de zogenaamde credit assignment. Het model weet wel dat het totale antwoord fout was, maar niet precies welk specifiek deel van de tekst de fout veroorzaakte. Hoewel sommige recente pogingen probeerden dit op te lossen door beloningen zeer fijnmazig op token-niveau toe te passen, waarschuwen de onderzoekers in hun publicatie op dat dit juist averechts kan werken. Wanneer de input van mensen ruis bevat, kan een te gedetailleerde beloning de onzekerheid vergroten en het leerproces verder destabiliseren.

De oplossing: Hiërarchische toewijzing

Om deze balans te vinden, introduceren de onderzoekers het S2T-RLHF-framework (Sentence-to-Token RLHF). In plaats van direct van een volledige tekst naar een individueel token te springen, introduceert deze methode een tussenstap: de zin.

De kern van deze aanpak is een 'granularity-aware' principe. De onderzoekers beargumenteren dat zinnen een natuurlijke eenheid vormen die semantische samenhang biedt, terwijl ze tegelijkertijd robuust genoeg zijn om de ruis van individuele tokens te filteren. Het proces werkt in twee fasen:
1. De globale beloning van de volledige sequentie wordt eerst verdeeld over de verschillende zinnen in het antwoord.
2. Binnen elke zin vindt vervolgens een beperkte verfijning op token-niveau plaats.

Een belangrijk voordeel van deze methode is dat er geen extra training van het beloningsmodel nodig is en er geen externe supervisie op token-niveau vereist is. Volgens de details in de zorgt deze gelaagde aanpak voor een stabielere optimalisatie zonder dat de nauwkeurigheid van de voorkeursuitlijning verloren gaat.

Resultaten en impact

De effectiviteit van S2T-RLHF is getest over diverse datasets en optimalisatie-instellingen. De resultaten tonen aan dat het framework de trainingsstabiliteit en robuustheid aanzienlijk verbetert. Tegelijkertijd blijft het model competitief in termen van preference alignment, wat betekent dat de AI nog steeds zeer effectief leert wat mensen prefereren in een antwoord.

Door de focus te verschuiven van maximale precisie naar stabiliteitsgeoriënteerd ontwerp, biedt S2T-RLHF een mogelijke uitweg uit de grillige trainingsdynamiek die veel AI-ontwikkelaars mompelen bij het gebruik van voorkeursgebaseerde beloningsmodellen. De volledige technische onderbouwing en experimentele data zijn beschikbaar via de digitale object identifier (DOI) van de publicatie.

Het onderzoek is ingediend in de categorie Artificial Intelligence en markeert een verschuiving in hoe wetenschappers nadenken over de granulariteit van feedback bij het trainen van complexe neurale netwerken. De volledige lijst van auteurs, waaronder Yafei Li, Limin Wang en Yihua Huang, is terug te vinden in de .

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!