Onderzoekers hebben vastgesteld dat het trainen van grote taalmodellen (LLM's) om beter te redeneren, vaak leidt tot een sterke afname van de variatie in hun acties. Dit fenomeen, aangeduid als 'diversity collapse', zorgt ervoor dat modellen repetitief worden in hun besluitvorming, zelfs wanneer er meerdere optimale opties beschikbaar zijn.
In een recent wetenschappelijk onderzoek, gepubliceerd op het platform arxiv.org, is geanalyseerd hoe supervised fine-tuning (SFT) de gedragsdiversiteit van AI-modellen beïnvloedt tijdens sequentiële besluitvorming. De auteurs, waaronder Junyi Sha, Renfei Tan en David Simchi-Levi, richtten zich specifiek op de vraag of het verbeteren van de nauwkeurigheid van een model onvermijdelijk leidt tot een minder gevarieerd speelstijl.
De impact van fine-tuning op diversiteit
De onderzoekers maakten gebruik van een gecontroleerde omgeving bestaande uit deterministische bordspellen, gebaseerd op varianten van tic-tac-toe. In deze spellen zijn de optimale zetten exact berekenbaar, waardoor de diversiteit van de acties van het model direct gemeten kon worden. Volgens de bleek dat het gebruik van een 'reasoning-mode' (redeneermodus) bij de generatie van antwoorden vaak de diversiteit van acties onderdrukt.
Opvallend is dat deze afname in variatie niet altijd gepaard gaat met een proportionele stijging in de nauwkeurigheid van de zetten. De onderzoekers stellen dat standaard SFT-methoden weliswaar de precisie verbeteren, maar vaak een voortijdige 'diversity collapse' induceren. Dit betekent dat het model stopt met het verkennen van verschillende correcte paden en zich vastklampt aan een zeer beperkt aantal acties, veel meer dan strikt noodzakelijk is voor het behalen van een optimaal resultaat.
Oorzaken en mogelijke oplossingen
Het onderzoek identificeert 'narrow-support imitation' als de primaire bron van deze beleidsinstorting. Wanneer een model wordt getraind op een beperkte set van gedemonstreerde acties, leert het simpelweg deze specifieke voorbeelden te imiteren in plaats van het bredere concept van een 'optimale zet' te begrijpen.
Om dit tegen te gaan, stelden de auteurs een methode voor genaamd action augmentation. In plaats van het model te trainen op één enkele gedemonstreerde actie per situatie, wordt het model getraind op alle mogelijke optimale acties voor die specifieke staat. Volgens de helpt deze aanpak om het effect van de diversiteitsinstorting gedeeltelijk te verzachten.
Implicaties voor AI-ontwikkeling
De resultaten suggereren dat het behouden van 'action support' tijdens het fine-tuningproces essentieel is als men wil dat AI-modellen hun exploratieve gedrag behouden. Zonder deze variatie kunnen modellen in complexere scenario's minder flexibel reageren, omdat ze vastzitten in een nauw gedefinieerd patroon van acties.
Het artikel, dat is ingediend onder de categorie , benadrukt dat de balans tussen nauwkeurigheid en diversiteit een cruciaal aspect is van de verdere ontwikkeling van besluitvormende AI-systemen. De volledige details en technische analyses zijn beschikbaar via de .