Onderzoekers hebben een innovatieve methode ontwikkeld om te bepalen of grote taalmodellen (LLM's) in staat zijn om een virtuele wereld over een langere periode consistent te laten functioneren. Waar de nadruk in de AI-sector voorheen vooral lag op het genereren van realistische beelden of korte scènes, richt dit nieuwe onderzoek zich op de operationele continuïteit van interactieve omgevingen.
In de publicatie arxiv.org leggen wetenschappers uit dat er tot nu toe nauwelijks is getest of een door AI gecreëerde wereld daadwerkelijk kan blijven draaien zonder dat er logische fouten optreden. De auteurs, waaronder Nan An, Weipeng Zhang en Weixing Chen, stellen dat huidige evaluatiemethoden vaak tekortschieten omdat ze te vroeg stoppen. Veel tests beperken zich tot de initiële creatie van een wereld of de overgang tussen twee opeenvolgende stappen.
Het fundamentele probleem is dat een correcte lokale overgang niet automatisch betekent dat er een logische stroom van causale gebeurtenissen is. Een model kan weliswaar een plausibele volgende stap genereren, maar daarbij de bredere context of de gevolgen van eerdere acties over het hoofd zien. Om dit gat in de kennis te dichten, hebben de onderzoekers de 'world agent task' geïntroduceerd. Hierbij wordt het model niet enkel gevraagd een wereld te bouwen, maar is het verantwoordelijk voor het beheer ervan, waarbij gebeurtenissen gecoördineerd moeten worden om de evolutie van de wereld consistent te houden.
Om deze capaciteiten objectief te meten, is de WorldAgent-Benchmark ontwikkeld. Deze benchmark is opgebouwd uit twee specifieke trajecten. Het eerste is het onderhoudstraject, waarbij het model gebeurtenissen uit een doorlopend verhaal moet vertalen naar correcte wijzigingen in de staat van de wereld. Hierbij moet rekening worden gehouden met tijdlijnen en causale verbanden. Het tweede is het deductietraject, waarin het model op basis van onvolledige observaties moet voorspellen hoe de wereld zich ontwikkelt en acties moet ondernemen om een specifiek doel te bereiken.
Volgens de details op zijn alle oordelen in dit proces auditeerbaar via wereldstaten en executielogs, wat een objectieve herberekening van de scores mogelijk maakt. Hoewel algemene wereldnieuwsbronnen zoals apnews.com vaak focussen op de bredere maatschappelijke impact van AI, biedt dit specifieke technische onderzoek dieper inzicht in de cognitieve beperkingen van huidige modellen.
Uit de tests met acht verschillende modellen blijkt dat de prestaties gestaag dalen naarmate er minder vooraf gedefinieerde structuur in de wereld aanwezig is. De meest opvallende conclusie is dat het bewaken van causale relaties voor elk van de geteste modellen de grootste uitdaging vormt. De benchmark maakt hiermee een essentieel onderscheid tussen 'lokale voltooiing' — het correct invullen van een klein detail — en het vermogen om gebeurtenissen op grote schaal logisch te organiseren.
Het onderzoek, dat op 26 september 2026 is ingediend, onderstreept dat het genereren van een wereld iets fundamenteel anders is dan het kunnen beheren van de logica binnen die wereld. De volledige dataset en de resultaten zijn raadpleegbaar via de .