Een recent wetenschappelijk onderzoek wijst op een kritiek probleem bij het evalueren van Vision-Language Modellen (VLM's). Volgens een publicatie van onderzoekers Zeyan Li, Siyuan Qiu en Jianfeng Xu kan een specifieke methode om prestaties te meten leiden tot resultaten die de werkelijke capaciteiten van een AI-model ernstig onderschatten. Het fenomeen, dat door de auteurs arxiv.org wordt genoemd, treedt op wanneer de evaluatie van een model niet aansluit bij de gegeven instructies.
Het probleem concentreert zich rond de zogenaamde 'Chain-of-Thought' (CoT) techniek. Bij deze methode wordt een AI gevraagd om stap voor stap te redeneren voordat er een definitief antwoord wordt geformuleerd. De fout ontstaat wanneer een evaluatiesysteem het model wel instrueert om te redeneren, maar de score direct afleidt uit de kansberekening van de antwoordlabels, nog voordat de redenering daadwerkelijk is gegenereerd. In feite wordt er van het model gevraagd om na te denken, terwijl de evaluator direct naar het eindresultaat kijkt zonder op het denkproces te wachten.
Deze mismatch in de interface van de evaluatie zorgt ervoor dat de werkelijke kennis van het model niet correct wordt gemeten. In plaats daarvan wordt de score bepaald door een fout in de meetmethode. Om dit aan te tonen, hebben de onderzoekers het model Qwen2.5-VL-7B getest met behulp van de ScienceQA-dataset. De resultaten waren opvallend: de nauwkeurigheid van het model zakte van 80,76% naar slechts 45,48% zodra de CoT-prefix scoring werd toegepast. De studie, die is ingediend bij de sectie Computation and Language van , laat verder zien dat het model in 93,54% van de gevallen simpelweg de eerste beschikbare optie koos bij vijf verschillende permutaties van antwoorden. Dit wijst erop dat het model in deze modus vervalt in een mechanisch patroon in plaats van inhoudelijk te antwoorden.
Ondanks deze lage scores blijkt uit het onderzoek dat de kennis binnen het model wel degelijk aanwezig blijft. Door gebruik te maken van 'condition-matched linear probes' konden de onderzoekers de interne toestanden van het model analyseren. Hieruit bleek dat 78,94% van de correcte antwoorden nog steeds herleidbaar was in de verborgen lagen van het netwerk. Wanneer het model de vrijheid kreeg om tekst te genereren, herstelde de nauwkeurigheid zich tot 75,24%. De analyse suggereert dat de waarschijnlijkheidsmassa verschuift naar tokens die de redenering voortzetten, waardoor de directe uitlezing van het eindantwoord faalt, terwijl de informatie lineair toegankelijk blijft in latere lagen.
De auteurs concluderen dat dit effect in verschillende mate voorkomt bij diverse modellen en datasets, hoewel het niet universeel is. De belangrijkste waarschuwing is dat deze scoringsmethode de feitelijke kennis van een model kan verwarren met een technische fout in de evaluatie-interface. In het rapport op wordt daarom geadviseerd om deze specifieke methode te vermijden. Voor betrouwbare resultaten moeten de gevraagde output en het moment van scoren volledig op elkaar zijn afgestemd.
Hoewel technische papers van dit niveau vaak complex zijn en vertaalhulpmiddelen zoals deeplcocom kunnen worden ingezet om de toegankelijkheid te vergroten, benadrukt dit onderzoek vooral de noodzaak van uiterste precisie bij het testen van geavanceerde AI-systemen. De studie is op 24 september 2026 officieel ingediend.