← Terug
Code-gebaseerde vaardigheden verbeteren efficiëntie en leervermogen van taalagenten

Code-gebaseerde vaardigheden verbeteren efficiëntie en leervermogen van taalagenten

Taalagenten kampen vaak met uitdagingen wanneer een doel wordt bereikt via lange reeksen van eenvoudige, laag-niveau acties. Om dit probleem aan te pakken, hebben Bartłomiej Cupiał en zijn medestanders een methode ontwikkeld waarbij agenten gebruikmaken van code-gebaseerde abstracties. Deze aanpak stelt de agenten in staat om herbruikbare vaardigheden in te zetten, waardoor de noodzaak om telkens individuele basisacties te selecteren wegvalt.

Het centrale mechanisme van dit onderzoek is de zogenaamde 'abstractieladder'. In dit systeem neemt de code de terugkerende lokale beslissingen voor zijn rekening, terwijl het taalmodel bepaalt welke specifieke vaardigheden op welk moment moeten worden gecombineerd. De onderzoekers waarschuwen echter dat abstracties soms 'lek' kunnen zijn, wat betekent dat de beschikbare vaardigheden in bepaalde situaties onvoldoende zijn. Om dit op te vangen, kan de agent terugvallen op primitieve acties om de taak alsnog te voltooien.

Om de effectiviteit van deze benadering te toetsen, maakten de onderzoekers gebruik van de complexe game-omgeving NetHack. Hiervoor creëerden zij CodeHack, een bibliotheek met code-gebaseerde vaardigheden die zijn voorzien van beschrijvingen in natuurlijke taal. Volgens een publicatie op arxiv.org is er in dit kader onderzocht hoe agenten presteren wanneer zij uitsluitend primitieve acties gebruiken, enkel semantische vaardigheden inzetten, of een hybride vorm van beide toepassen.

De resultaten van de evaluatie, die werd uitgevoerd via zero-shot prompting, supervised fine-tuning en reinforcement learning (RL), tonen significante verbeteringen. In een brede zero-shot evaluatie binnen NetHack bleek dat de voortgang in het spel bijna drie keer zo hoog lag bij het gebruik van vaardigheden vergeleken met enkel primitieve acties. Daarnaast zorgde de inzet van deze abstracties voor een aanzienlijke daling in de rekenkosten, die per episode met 86% afnamen. Door de combinatie van vaardigheden en primitieve acties bleven de voordelen van abstractie behouden, terwijl de agent flexibel genoeg bleef voor situaties waarin de bibliotheek tekortschoot.

Ook het leerproces van de agenten werd positief beïnvloed. In scenario's met reinforcement learning bleken vaardigheidsgebaseerde agenten veel sneller te leren dan agenten die enkel op basisacties vertrouwden. De studie op meldt dat deze agenten een gemiddelde winst in 'dungeon level' behaalden die 7,2 keer groter was dan die van de controlegroep, ondanks een gelijkblijvend trainingsbudget.

De onderzoekers, waaronder Jens Tuyls, Maciej Wołczyk en Davide Paglieri, hebben de CodeHack-bibliotheek en de bijbehorende code voor training en evaluatie openbaar gemaakt. Hiermee willen zij bijdragen aan verdere wetenschappelijke inzichten in de interactie tussen taalmodellen en complexe omgevingen. Meer informatie over de methodologie is beschikbaar via het wetenschappelijke document op . Voor ontwikkelaars die experimenteren met code-gebaseerde tools kunnen platforms zoals codemonkey.com relevant zijn voor het aanleren van programmeervaardigheden, hoewel dit een andere toepassing is dan de geavanceerde agent-abstracties in dit onderzoek.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!