Wetenschappers hebben een innovatieve methode ontwikkeld die kunstmatige intelligentie-agenten in staat stelt om onnodige redeneerstappen uit hun actieve geheugen te verwijderen. Deze techniek, aangeduid als ICLR, zorgt voor een aanzienlijke daling van de computationele kosten en het verbruik van tokens, terwijl de effectiviteit van de agent behouden blijft.
Binnen de informatica worden AI-agenten beschouwd als systemen die hun omgeving waarnemen en acties ondernemen om specifieke doelen te bereiken, variërend van eenvoudige reactieve modellen tot complexe proactieve systemen. Volgens geeksforgeeks.org zijn deze agenten essentieel voor het autonoom oplossen van problemen. In de praktijk betekent dit dat softwarematige systemen zelfstandig doelen nastreven door informatie te verwerken en beslissingen te nemen. Zoals google.com uitlegt, onderscheiden deze agenten zich door hun vermogen om te redeneren, plannen op te stellen en keuzes te maken op basis van de beschikbare context.
Een hardnekkig probleem bij langdurige opdrachten is de opbouw van een enorme hoeveelheid redeneringsgeschiedenis. Wanneer een agent een complexe taak uitvoert, creëert hij vaak een zogenaamde 'Chain of Thought'. Naarmate de interactie vordert, groeit deze context, wat leidt tot hogere inferentiekosten en een lagere efficiëntie. Traditionele methoden om deze data te comprimeren zijn vaak statisch, wat bij interactieve systemen kan leiden tot onvoorspelbaar gedrag omdat cruciale historische informatie verloren gaat.
Om dit op te lossen, presenteren Mingxuan Wang en collega-onderzoekers in een publicatie van 24 september 2026 de methode Interaction Aware Compression for Long Horizon Reasoning (ICLR). Volgens het onderzoek op arxiv.org is dit een 'training-free' online benadering. Het systeem maakt gebruik van bevroren proxy-entropie om redeneerblokken te rangschikken. Hierdoor kan de AI bepalen welke informatie veilig gewist kan worden, terwijl essentiële elementen zoals tool-aanroepen, observaties en concrete acties bewaard blijven.
De resultaten van de tests op 260 WorkBuddyBench-taken tonen aan dat ICLR niet alleen efficiënter is, maar zelfs een lichte verbetering in prestaties oplevert; de gemiddelde beloning steeg van 0,699 naar 0,718. De winst in efficiëntie is substantieel: het verbruik van inputtokens daalde met 25,5%, outputtokens met 14,4% en cache read tokens met maar liefst 33,3%.
De onderzoekers concluderen dat historische redeneringen overbodig worden zodra de relevante informatie is geëxternaliseerd. Dit gebeurt wanneer de agent de resultaten heeft vastgelegd in externe bestanden, code of via feedback uit de omgeving. De redenering fungeert in dit proces eerder als een tijdelijke werkstatus dan als een permanent archief.
De relevantie van dit onderzoek is groot, zeker wanneer men kijkt naar geavanceerde implementaties. Op github.com zijn projecten te vinden waarbij meerdere gespecialiseerde agenten, zoals 'reality checkers' en 'frontend wizards', samenwerken in een AI-agency. In dergelijke multi-agent omgevingen groeit de hoeveelheid uitgewisselde informatie exponentieel, waardoor effectief geheugenbeheer cruciaal is. Door irrelevante redeneringen selectief te 'vergeten', kunnen ontwikkelaars snellere en kostenefficiëntere systemen bouwen die toch in staat zijn om complexe, langdurige projecten succesvol af te ronden.