← Terug
Nieuwe benchmark EgoMemReason onthult tekortkomingen in geheugen van AI-modellen

Nieuwe benchmark EgoMemReason onthult tekortkomingen in geheugen van AI-modellen

Onderzoekers hebben EgoMemReason geïntroduceerd, een nieuwe benchmark die meet hoe goed AI-systemen informatie kunnen onthouden en redeneren over video-opnamen die zich over een hele week uitstrekken. De resultaten tonen aan dat zelfs de meest geavanceerde modellen moeite hebben met het koppelen van bewijslast over lange tijdspannen.

De ontwikkeling van visuele assistenten, zoals smart glasses en 'always-on' life-logging systemen, vereist dat AI-modellen in staat zijn om visuele ervaringen van een dag of langer te analyseren. Volgens een publicatie op arxiv.org is relevante informatie in dergelijke ultra-lange video's vaak schaars verspreid. Dit stelt hoge eisen aan het geheugen van een model: het moet informatie over tijd accumuleren, eerdere toestanden kunnen oproepen, de temporele volgorde bewaken en terugkerende patronen abstraheren.

Focus op geheugentypen

Bestaande benchmarks voor video's van een week richten zich volgens de onderzoekers voornamelijk op perceptie en herkenning, zoals het lokaliseren van momenten of globale samenvattingen. EgoMemReason is specifiek ontworpen om het redeneervermogen te testen door bewijzen over meerdere dagen te integreren. De benchmark evalueert drie specifieke vormen van geheugen:

  • Entity memory: Het volgen van hoe de status van objecten evolueert en verandert over meerdere dagen.
  • Event memory: Het herinneren en chronologisch ordenen van activiteiten die uren of dagen uit elkaar liggen.
  • Behavior memory: Het abstraheren van terugkerende patronen op basis van schaarse, herhaalde observaties gedurende een hele week.

De dataset bestaat uit 500 vragen verdeeld over deze drie geheugentypen en zes kernuitdagingen. Gemiddeld zijn er per vraag 5,1 videosegmenten aan bewijslast nodig, waarbij het model gemiddeld 25,9 uur aan geheugen moet doorzoeken.

Prestaties en tekortkomingen

In het onderzoek zijn 17 verschillende methoden getest, variërend van Multimodal Large Language Models (MLLMs) tot agentic frameworks. De resultaten zijn volgens de auteurs van de ontnuchterend: het best presterende model behaalde een totale nauwkeurigheid van slechts 39,6%.

Uit verdere analyse blijkt dat de drie verschillende geheugentypen om uiteenlopende redenen falen. Bovendien degradeert de prestatie van de modellen naarmate de tijdspanne tussen de bewijsstukken groter wordt. Dit wijst erop dat het probleem van 'long-horizon memory' in AI nog lang niet is opgelost.

Toegankelijkheid en academische context

Om andere onderzoekers in staat te stellen hun systemen te testen, is de dataset beschikbaar gesteld op huggingface.co, waar de 500 testvragen in JSON-formaat kunnen worden ingezien. Voorbeelden van vragen in de dataset betreffen dagelijkse gewoonten, zoals wat een persoon het vaakst ontbijt of welke activiteit doorgaans volgt op de lunch. Daarnaast is de broncode van het project publiekelijk toegankelijk via github.com.

Het project is het resultaat van een samenwerking tussen diverse onderzoekers, waaronder Ziyang Wang en Mohit Bansal. Bansal is een van de onderzoekers. Het werk is officieel geaccepteerd voor presentatie op de conferentie COLM2026.

Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!