← Terug
ARISE-RL: Nieuw framework voor zelfevoluerende AI-agenten via reinforcement learning

ARISE-RL: Nieuw framework voor zelfevoluerende AI-agenten via reinforcement learning

Onderzoekers hebben ARISE-RL ontwikkeld, een innovatief systeem dat kunstmatige intelligentie-agenten in staat stelt zichzelf te verbeteren door middel van een interactie tussen taakgeneratie en probleemoplossing.

Het trainen van AI-agenten voor open-ended taken is traditioneel complex vanwege het gebrek aan verifieerbare antwoorden en schaalbare beoordelingscriteria. In een recent gepubliceerd wetenschappelijk document op arxiv.org beschrijven Fanrui Zhang en een team van vijftien andere auteurs hoe zij deze hindernissen hebben aangepakt met het ARISE-RL framework. Dit systeem is specifiek ontworpen om de stabiliteit van beloningssignalen te verbeteren bij complexe taken met een lange tijdshorizon.

Co-evolutie van generator en solver

De kern van ARISE-RL bestaat uit een proces van rubric-gemedieerde co-evolutie. Hierbij werken twee componenten nauw samen: een 'Generator' en een 'Solver'. De Generator is verantwoordelijk voor het creëren van taken en bijbehorende beoordelingscriteria (rubrics). Deze criteria worden gebaseerd op werkelijke observaties van tools, waardoor de taken relevant blijven.

De Generator wordt beloond wanneer hij taken produceert die een gemiddelde moeilijkheidsgraad hebben en aansluiten bij de huidige capaciteiten van de Solver. Tegelijkertijd leert de Solver van de gedetailleerde signalen uit deze rubrics om via multi-step reasoning en het gebruik van tools betere resultaten te behalen. Volgens de publicatie op zorgt deze dynamiek ervoor dat het model constant tegen zijn eigen grens wordt uitgedaagd zonder dat de taken te eenvoudig of onmogelijk worden.

Innovaties in distillatie en evaluatie

Om te voorkomen dat het model ruis overneemt of blindelings foutieve patronen imiteert, introduceerden de onderzoekers de Reward-Gated Self-Evolution Distillation (RG-SED). Deze techniek destilleert een variant van het beleid met geheugenondersteuning terug in het basismodel, maar doet dit enkel wanneer er een empirische verbetering in de beloning wordt vastgesteld. Dit vermindert de discrepantie in distributie en verhoogt de stabiliteit van het leerproces.

Ter ondersteuning van deze ontwikkelingen is ECR-Bench ontwikkeld. Dit is een benchmark-suite met door experts gekalibreerde rubrics. De tests binnen deze suite richten zich op twee specifieke scenario's: diepgaand onderzoek met één tool en complexe reisplanning waarbij meerdere tools tegelijkertijd moeten worden ingezet. De resultaten tonen aan dat ARISE-RL consistent state-of-the-art prestaties levert over alle geteste benchmarks.

Bredere context van technologische platforms

Terwijl ARISE-RL zich richt op de theoretische en praktische vooruitgang van reinforcement learning, opereren andere organisaties met een gelijknamige branding in de commerciële sector. Zo positioneert arise.com zich als een technologieplatform dat menselijke intelligentie on-demand levert via een wereldwijd netwerk van professionals, ondersteund door Warburg Pincus. Hoewel zij zich richten op schaalbaarheid voor ondernemingen, is dit een fundamenteel ander domein dan de academische AI-onderzoeken naar zelfevoluerende agenten.

Daarnaast zijn er diverse mediakanalen en diensten die de naam 'Arise' gebruiken, zoals arise.tv, een zender die vanuit Londen en New York uitzendt met een sterke focus op Afrikaanse politiek, business en technologie. Hoewel dergelijke platforms rapporteren over technologische trends, vormen zij geen deel van het technische ontwikkelingsproces van het ARISE-RL framework.

De toegang tot bepaalde online diensten kan overigens beperkt zijn door beveiligingsmaatregelen. Zo meldt een beveiligingspagina van ariseworkfromhome.com dat toegang soms wordt geblokkeerd door Cloudflare-beveiligingsdiensten om aanvallen te voorkomen, wat illustreert hoe digitale infrastructuren worden beschermd tegen malafide dataverkeer.

Samenvattend biedt ARISE-RL een nieuwe methode om AI-agenten robuuster te maken door middel van een gesloten cyclus van taakgeneratie en zelfverbetering, wat een significante stap voorwaarts is in de ontwikkeling van autonome systemen die complexe, open-ended opdrachten kunnen uitvoeren.

Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!