⚠️ KMI: Hitte in België De waarschuwingsfase van het hitteplan is geactiveerd vanwege temperaturen die woensdag en donderdag de 30 graden zulle… 28/07 00u – 01/08 00u KMI ↗ Kaart ↗ Artikel →
← Terug
FlowEvo: Nieuwe methode laat AI-agenten zelfstandig vaardigheden ontwikkelen

FlowEvo: Nieuwe methode laat AI-agenten zelfstandig vaardigheden ontwikkelen

Onderzoekers hebben FlowEvo ontwikkeld, een raamwerk waarmee AI-agenten complexe taken kunnen oplossen door succesvolle werkprocessen om te zetten in herbruikbare vaardigheden, zonder dat hiervoor nieuwe modeltraining nodig is.

Binnen de ontwikkeling van Large Language Model (LLM) agenten is er een groeiende trend om complexe problemen op te lossen via 'inference-time workflows'. Dit zijn dynamische processen waarin redeneren, het gebruik van tools en het uitvoeren van code worden gecombineerd. Een hardnekkig probleem bij deze aanpak is echter dat succesvolle procedures vaak vluchtig zijn: ze helpen bij het oplossen van een specifieke taak, maar worden niet systematisch bewaard om toekomstige opdrachten te versnellen of te verbeteren.

De werking van FlowEvo

Om dit probleem aan te pakken, introduceerden Zeyu Ren en collega's het systeem FlowEvo. Volgens een publicatie op arxiv.org is FlowEvo een 'training-free' raamwerk. Dit betekent dat de agent zijn capaciteiten kan uitbreiden zonder dat de parameters van het onderliggende taalmodel hoeven te worden aangepast.

Het systeem werkt via een continue feedbackloop die bestaat uit drie gekoppelde mechanismen:
1. Workflow-to-skill compilatie: Succesvolle uitvoeringssporen worden geanalyseerd en omgezet in herbruikbare 'skill records'. Deze records bevatten een uitvoerbaar artefact samen met gestructureerde begeleiding.
2. Skill-to-workflow feedback: Tijdens het oplossen van nieuwe problemen kan de agent opgeslagen vaardigheden uit een 'skill bank' ophalen. Dit gebeurt via directe uitvoering of door de informatie als context toe te voegen aan het proces.
3. Skill curation: Het systeem monitort het nut van de opgeslagen vaardigheden. Skills die leiden tot slechtere resultaten (negatieve transfer) worden onderdrukt of verwijderd.

Prestaties en resultaten

De effectiviteit van FlowEvo is getest op diverse benchmarks, waaronder interactieve omgevingen zoals ALFWorld en taken gericht op wiskunde en codegeneratie (GSM8K en HumanEval). Uit de resultaten blijkt dat FlowEvo een superieure balans vindt tussen nauwkeurigheid en kosten vergeleken met bestaande baselines.

In de ALFWorld-omgeving behaalde FlowEvo een succespercentage van 82,8%. Dit is 23,6 procentpunt hoger dan de sterkste baseline die in het onderzoek werd gebruikt. Daarnaast was het systeem aanzienlijk efficiënter in het verbruik van tokens; het gemiddelde gebruik per episode lag minder dan half zo hoog als bij de meest efficiënte baseline. De volledige implementatie en code zijn publiek gemaakt via github.com.

Bredere context van zelf-evoluerende agenten

FlowEvo past in een bredere wetenschappelijke beweging naar agenten die hun eigen capaciteiten kunnen uitbreiden. Andere recente ontwikkelingen benadrukken vergelijkbare principes van co-evolutie. Zo richt het project arxiv.org zich op het autonoom genereren van complexe, uit meerdere bestanden bestaande skill-packages via een combinatie van een generator en een verifieerder.

Daarnaast is er onderzoek gedaan naar arxiv.org, een paradigma dat ervaringen en activa (assets) integreert. Mem$^2$Evolve gebruikt een 'Experience Memory' en een 'Asset Memory' om de groeiruimte van een agent te vergroten. Uit experimenten met dit systeem bleek een verbetering van 18,53% ten opzichte van standaard LLM's.

Waar eerdere methoden vaak ervaring en de creatie van nieuwe tools als gescheiden processen zagen, laten zowel FlowEvo als deze andere raamwerken zien dat de synergie tussen het onthouden van succesvolle acties en het creëren van nieuwe instrumenten essentieel is voor stabiele en schaalbare groei van AI-capaciteiten.

Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!