Een team van onderzoekers heeft een fundamentele tekortkoming blootgelegd in de manier waarop vision-language modellen visuele informatie verwerken. In hun studie wordt aangetoond dat essentiële details uit beelden volledig kunnen verdwijnen tijdens de voorbewerking, nog voordat de data het taalmodel bereikt. Dit fenomeen zorgt ervoor dat het AI-model beelden die voor mensen duidelijk verschillen, als exact hetzelfde registreert.
Volgens de publicatie arxiv.org van Mert Onur Cakiroglu, Elham Buxton, Mehmet Dalkilic en Hasan Kurban, ontstaat dit probleem in de interface tussen de beeldverwerking en het taalmodel. Terwijl mensen afbeeldingen in volledige resolutie kunnen beoordelen, maken AI-modellen gebruik van versimpelde versies in de vorm van tensors. De onderzoekers stellen dat er situaties ontstaan waarbij visueel bewijs simpelweg nooit het taalmodel bereikt, wat leidt tot zogenaamde 'interface aliases'.
Om dit proces te bewijzen, hebben de auteurs een instrument genaamd AliasForge ontwikkeld. Met behulp van fixed-point resampling kunnen zij scenario's creëren waarin de resize-operatie bepaalde verstoringen naar nul stuurt. Hierdoor ontstaan beelden die voor een menselijke waarnemer verschillend zijn — bijvoorbeeld door een tegengesteld label — maar die voor het AI-model een bit-identieke status hebben.
De impact van deze collisies is aanzienlijk voor de betrouwbaarheid van AI-systemen. Uit de blijkt dat verifiers in dergelijke gevallen een nauwkeurigheid van precies vijftig procent hebben. Omdat het model geen enkel onderscheid kan maken tussen de twee verschillende beelden, is elke poging om dit aan de taalzijde van het model te corrigeren zinloos; de benodigde informatie is immers al verloren gegaan.
Daarnaast heeft dit effect op de 'routers', de systemen die bepalen hoeveel rekenkracht een specifieke taak vereist. De onderzoekers ontdekten dat deze routers onnodig rekenkracht verspillen aan extra redeneringen of herhaalde aandacht, terwijl de gezochte informatie tijdens de initiële beeldverwerking al was gewist.
Technisch gezien hebben de auteurs een lattice-criterium ontwikkeld om te bepalen wanneer dergelijke collisies mogelijk zijn op basis van de resize-configuratie. Bij het screenen van 20 configuraties werden er 17 als constructible en 3 als non-constructible aangemerkt. De praktische gevolgen werden bevestigd over drie verschillende architecturen, waarbij een "zero decision-logit gap" werd gerapporteerd bij alle 18 geteste paren. Dit bewijst dat de modellen absoluut geen verschil konden waarnemen tussen de beelden.
In dit wetenschappelijke onderzoek wordt de term "certified" gebruikt om aan te geven dat de collisies wiskundig bewezen en gegarandeerd zijn binnen een specifieke constructiefamilie. Hoewel de term in een bredere Engelse context vaak betrekking heeft op kwalificaties, zoals beschreven door oneminuteenglish.org, is de betekenis hier strikt technisch.
De conclusie van de studie is dat er een zogenaamd "fiber ceiling" bestaat: een absolute grens aan de hoeveelheid informatie die uit de interface kan worden teruggewonnen. Hoewel er bij natuurlijke beelden enige ruimte is voor optimalisatie van routing, bleek geen enkele geteste interface-only router in staat om beter te presteren dan het simpelweg staken van de berekening wanneer de informatie ontbreekt. Meer details over deze wiskundige bewijsvoering zijn terug te vinden in het volledige .