Wetenschappers hebben een significante beperking ontdekt in de manier waarop multimodale grote taalmodellen (LLM's) omgaan met ruimtelijke informatie. Hoewel deze modellen vaak in staat zijn om feiten over de positie van objecten correct te rapporteren, blijkt het ze vaak onmogelijk om deze informatie effectief in te zetten tijdens complexere redeneerprocessen. Dit fenomeen wordt in de wetenschappelijke literatuur aangeduid als de kloof tussen de beschikbaarheid en de benutting van informatie.
In een studie die op 2 oktober 2026 werd gepubliceerd, leggen Jinchang Zhang en zijn team uit dat het simpelweg kunnen identificeren van een visuele situatie niet garandeert dat een AI-model deze data kan integreren in een logische reeks stappen. Om dit systematisch te onderzoeken, hebben de auteurs arxiv.org ontwikkeld, een benchmark die bestaat uit ruim 23.000 verschillende inputs. Deze tool is specifiek ontworpen om te testen hoe modellen ruimtelijke toestanden construeren en vervolgens toepassen.
Het onderzoek categoriseert de ruimtelijke uitdagingen in vier verschillende complexiteitsniveaus. Het begint bij lokale feitenbinding (L1), waarbij objecten aan locaties worden gekoppeld, en loopt via relationele compositie (L2) en consistentie over meerdere observaties (L3) tot aan de beoordeling van toestanden na een transformatie (L4). De kern van het probleem ligt in het feit dat modellen vaak wel de beginstatus van een scène kunnen waarnemen — in de zin van het cambridge.org — maar falen zodra deze status als basis moet dienen voor een verandering of actie.
Een treffend voorbeeld uit de studie is het gedrag van het model Qwen3.5-9B. Volgens de maakte dit model in de helft van de gevallen fouten bij transformatie-opdrachten, terwijl de beginstatus van de scène wel correct was vastgesteld. Opvallend genoeg werden al deze fouten gecorrigeerd wanneer de beginstatus expliciet als tekstuele input aan het model werd meegegeven. Dit bewijst dat de informatie wel aanwezig was, maar niet operationeel werd gebruikt. De onderzoekers merken overigens op dat deze kloof weliswaar afneemt bij grotere modellen, maar dat het probleem fundamenteel blijft bestaan.
Om deze tekortkoming te verhelpen, introduceert het team van Zhang de methode Operational State Supervision (OSS). Deze techniek richt zich op het superviseren van ruimtelijke toestanden die relevant zijn voor de specifieke taak, inclusief de trajecten van transformaties. Door feiten over verschillende contexten heen uit te lijnen, wordt de AI gestimuleerd om informatie niet alleen passief te registreren, maar deze ook inzetbaar te maken voor actieve berekeningen.
De resultaten van deze nieuwe aanpak zijn vooral zichtbaar op de hoogste niveaus van de benchmark, specifiek L3 en L4. Dit zijn juist de fasen waarin het organiseren en actief gebruiken van ruimtelijke data essentieel is voor een correct antwoord. De studie concludeert dat de huidige evaluatiemethoden voor multimodale ruimtelijke redenering tekortschieten. Het is volgens de auteurs onvoldoende om enkel te testen of een model een feit kan benoemen; de werkelijke maatstaf is of dat feit wordt omgezet in een bruikbare toestand voor logische stappen. Voor een diepere analyse van de methodologie en de specifieke data kan men de volledige raadplegen.