De strijd tegen digitale desinformatie krijgt een krachtig nieuw instrument in de vorm van M4FC. Deze uitgebreide dataset is specifiek ontwikkeld om de detectie van misleidende beelden te verbeteren door een aanpak die rekening houdt met verschillende talen en culturele contexten. Volgens een publicatie op arxiv.org is dit project het resultaat van het werk van onderzoekers Jiahui Geng, Jonathan Tonglet en Iryna Gurevych.
Veel bestaande datasets voor factchecking worden door experts als ontoereikend beschouwd. De redenen hiervoor zijn vaak een te beperkte omvang, een focus op slechts enkele talen of een te nauwe specialisatie in één type taak. M4FC probeert deze tekortkomingen op te lossen door een aanzienlijke schaal en diversiteit te bieden. De dataset bevat 4.982 afbeeldingen die gekoppeld zijn aan 6.980 claims. Om de kwaliteit van deze informatie te garanderen, zijn de beelden geverifieerd door professionele factcheckers van 22 verschillende organisaties, zoals vermeld in de documentatie op .
Een opvallend kenmerk van M4FC is de meertalige insteek. De claims zijn beschikbaar in tien verschillende talen, waarbij elke bewering in één of twee van deze talen is geformuleerd. Hiermee wordt getracht de geografische en culturele beperkingen van eerdere onderzoeksprojecten te doorbreken.
Om AI-systemen effectief te trainen, is de dataset gestructureerd rond zes specifieke multimodale taken. Deze stappen stellen een model in staat om een claim systematisch te ontleden. De taken omvatten het extraheren van claims uit visueel materiaal, het voorspellen van de intentie van de verspreider, het detecteren van gemanipuleerde beelden, het contextualiseren van de afbeelding, het verifiëren van de locatie en het formuleren van een definitief oordeel over de waarheid van de claim. De onderzoekers hebben baseline-resultaten voor al deze stappen opgeleverd om te analyseren hoe deze tussenstappen de uiteindelijke nauwkeurigheid beïnvloeden.
De ontwikkeling van M4FC sluit aan bij de bredere evolutie van kunstmatige intelligentie. Er is een groeiende trend naar multimodale systemen, waarbij modellen verschillende datatypen zoals tekst, audio en beeld gelijktijdig kunnen verwerken. Volgens een analyse van unitlab.ai leren deze modellen gezamenlijke representaties in plaats van elk datatype apart te behandelen. Dit proces van alignering tussen visuele signalen en tekstuele beschrijvingen is cruciaal voor complexe operaties, zoals het beantwoorden van vragen over beelden of het genereren van accurate bijschriften. De kracht van deze ligt in het vermogen om informatie uit diverse bronnen in een gedeelde ruimte te integreren.
Het onderzoek naar M4FC is inmiddels geaccepteerd voor de 'Camera-ready version' van de EMNLP Findings 2026. Om verdere wetenschappelijke vooruitgang te stimuleren, hebben de auteurs besloten om zowel de dataset als de bijbehorende code openbaar te maken via . Door deze openbare toegankelijkheid en de focus op mondiale diversiteit biedt M4FC een stevig fundament voor de ontwikkeling van AI-tools die desinformatie wereldwijd kunnen bestrijden, ongeacht de taal of herkomst van de content.