⚠️ KMI: Hitte in België De waarschuwingsfase van het hitteplan is geactiveerd vanwege temperaturen die woensdag en donderdag de 30 graden zulle… 28/07 00u – 30/07 00u KMI ↗ Kaart ↗ Artikel →
← Terug
ARCO-methode optimaliseert training van AI-agenten via adaptieve rubrieken

ARCO-methode optimaliseert training van AI-agenten via adaptieve rubrieken

In de ontwikkeling van kunstmatige intelligentie vormen grote taalmodellen (LLM's) steeds vaker de basis voor 'agenten' die complexe, meerstapsopdrachten moeten volbrengen. Een hardnekkig probleem bij het trainen van deze systemen via reinforcement learning is de afhankelijkheid van scalaire beloningen. Hierbij ontvangt een model enkel een eindcijfer dat aangeeft of het resultaat correct was, zonder dat duidelijk is welke specifieke actie in het proces tot dat succes of falen leidde.

Om deze beperking te overbruggen, hebben Zihang Tian en zijn team een innovatieve benadering ontwikkeld. Volgens een wetenschappelijke publicatie op arxiv.org maakt deze methode gebruik van Adaptive Rubrics with Co-Evolution, kortweg ARCO. In plaats van een statische score aan het einde van een proces, genereert ARCO per individuele stap een rubriek. Dit houdt in dat elke actie van de AI-agent wordt getoetst aan specifieke criteria in natuurlijke taal, waardoor de kwaliteit van het redeneerproces per stap wordt beoordeeld.

Een essentieel kenmerk van dit systeem is de dynamiek van de beoordelingscriteria. De rubrieken zijn niet vastgelegd, maar evolueren mee naarmate de AI-agent leert en zijn prestaties verbetert. Deze co-evolutie zorgt ervoor dat de eisen voor een 'correcte stap' meegroeien met het niveau van de agent, wat een veel nauwkeuriger trainingsproces mogelijk maakt dan bij traditionele methoden.

De effectiviteit van deze aanpak is uitvoerig getest op diverse datasets, waaronder MuSiQue, 2WikiMultiHopQA en HotpotQA. De resultaten wijzen uit dat ARCO superieur presteert op het gebied van Exact Match (EM) scores in vergelijking met systemen die enkel naar de uitkomst kijken of gebruikmaken van statische procesbeloningen. Daarnaast stellen de onderzoekers dat de gebruikte rubrieken een waardevol instrument zijn voor het diagnosticeren van het gedrag van de agent, waardoor de zogenaamde 'black box' van AI-beslissingen transparanter wordt.

Hoewel de academische wereld ARCO associeert met AI-optimalisatie, is de term in de commerciële sector verbonden aan geheel andere domeinen. Zo is er in België een organisatie genaamd arco.be die zich richt op digitale transformatie en workflow-automatisering, met een focus op sectoren zoals de retail en de gezondheidszorg.

In de Verenigde Staten wordt de naam gebruikt door arco.com, een bedrijf dat gespecialiseerd is in de levering van brandstoffen en het beheer van brandstofkaarten voor transportvloten. Daarnaast is er een specifiek softwareplatform genaamd arco.sa, dat zich richt op zakelijke oplossingen voor personeelsadministratie, loonverwerking en contractbeheer.

De wetenschappelijke doorbraak van de ARCO-methode markeert een belangrijke verschuiving naar meer interpreteerbare AI. Door abstracte beloningen te vervangen door begrijpelijke en evoluerende criteria, kunnen ontwikkelaars preciezer bepalen waar een AI-agent de fout in gaat. Terwijl de commerciële entiteiten met dezelfde naam zich richten op logistiek en administratieve software, legt de academische ARCO-benadering de basis voor een fundamentele verbetering in hoe machines complexe redeneerprocessen aanleren.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!