Onderzoekers van Duke University hebben PRO-LONG ontwikkeld, een nieuw contextbeheersysteem dat grote taalmodellen (LLM's) helpt bij het uitvoeren van taken met een lange tijdshorizon. Door gebruik te maken van een gestructureerd, programmatisch geheugen kunnen AI-agenten efficiënter informatie uit hun eigen geschiedenis ophalen zonder dat de prestaties kelderen naarmate de hoeveelheid data toeneemt.
De uitdaging van lange tijdshorizons
Voor AI-agenten vormen taken die een langdurige waarneming, redenering en exploratie vereisen een aanzienlijke hindernis. Dit probleem wordt duidelijk bij benchmarks voor continu leren, zoals ARC-AGI-3, waar standaardmodellen vaak beperkt presteren wanneer ze direct worden ingezet. Volgens een publicatie op arxiv.org ligt de kern van het probleem bij het beheer van de context: hoe bepaalt een model welke informatie uit de omgeving moet worden opgeslagen en hoe wordt deze informatie weer in het werkgeheugen van het model geladen?
Bestaande methoden kampen vaak met een fundamentele afweging. Enerzijds is het behouden van meer informatie wenselijk voor de volledigheid, maar anderzijds maakt een overvloed aan data het moeilijker voor het model om snel en accuraat de relevante details terug te vinden.
De werking van PRO-LONG
PRO-LONG doorbreekt deze impasse door het geheugen niet te behandelen als een tekst die gecomprimeerd moet worden, maar als een doorzoekbare database. Het framework houdt een volledig en gestructureerd logboek bij van alle interacties van de agent. In plaats van te vertrouwen op traditionele context-engineering, maakt PRO-LONG gebruik van de recente vooruitgang in 'coding agents' om deze geschiedenis programmatisch en efficiënt te doorzoeken.
Zoals beschreven door x.com, stelt deze aanpak de agent in staat om op aanvraag specifieke gegevens uit het logboek op te vragen via programmeertools, waardoor de noodzaak om enorme hoeveelheden irrelevante tekst in de actuele context te laden vervalt.
Significante prestatiewinst en efficiëntie
De resultaten van de tests op de publieke game-set van ARC-AGI-3 tonen een aanzienlijke verbetering aan. PRO-LONG presteert gemiddeld 18,0 procentpunt beter dan een standaard coding agent over verschillende geavanceerde modellen heen. Bovendien gaat het systeem gelijke of zelfs betere resultaten behalen dan gespecialiseerde harnesses, met een pass@1-score tot 76,1%.
Een opvallend aspect van PRO-LONG is de drastische vermindering van de kosten en rekenkracht. Volgens informatie van papers.cool verbruikt het framework tussen de 4,2 en 5,8 keer minder tokens dan concurrerende systemen. In combinatie met het model Fable 5 wist de methode een score van 97,4% (best@2) te behalen tegen totale kosten van 1.750 dollar.
Implicaties voor AI-agenten
De introductie van programmatisch geheugen markeert een verschuiving in hoe ontwikkelaars nadenken over de interactie tussen LLM's en hun omgeving. Door de scheiding tussen de opslag van ervaringen en het actieve redeneerproces te optimaliseren, kunnen agenten complexere problemen oplossen zonder dat de contextvensters overbelast raken.
De bredere relevantie van dit onderzoek wordt benadrukt door aidownload.com, waarbij wordt gesteld dat effectiever geheugenbeheer een van de belangrijkste knelpunten is voor de ontwikkeling van autonome AI-agenten. De mogelijkheid om gestructureerde interactielogs te gebruiken, biedt een schaalbaar alternatief voor methoden die proberen informatie samen te vatten of weg te laten.
De volledige details van het onderzoek, inclusief de relevante code en logs, zijn publiekelijk beschikbaar gesteld via GitHub om verdere ontwikkeling in het veld van kunstmatige intelligentie te stimuleren.