Onderzoekers hebben een omvangrijke dataset van amateurfilms gelanceerd om de capaciteiten van vision-language modellen (VLM's) bij het analyseren van langere video-narratieven te verbeteren.
De ontwikkeling van vision-language modellen heeft geleid tot aanzienlijke vooruitgang in het begrijpen van video-inhoud. Desondanks kampen huidige datasets vaak met beperkingen. Veel beschikbare data richten zich op korte fragmenten met een beperkt aantal gebeurtenissen of smalle narratieven, zoals instructievideo's of egocentrische beelden waarin één persoon in één enkele scène centraal staat.
Om deze tekortkomingen aan te pakken, hebben Ridouane Ghermi, Xi Wang, Vicky Kalogeiton en Ivan Laptev een nieuwe dataset ontwikkeld genaamd Short-Films 20K (SF20K). Volgens een publicatie op arxiv.org is dit de grootste publiek toegankelijke movie-dataset tot nu toe. De collectie bestaat uit 20.143 amateurfilms, wat neerkomt op een totaal van 3.582 uur aan videomateriaal. De films in deze dataset hebben een gemiddelde duur van 12 minuten per stuk.
Problematiek van commerciële filmdata
De onderzoekers stellen dat bestaande datasets gebaseerd op commerciële films problematisch zijn. Enerzijds zijn deze vaak beperkt tot kortetermijntaken en zijn de video's niet altijd publiekelijk beschikbaar. Anderzijds is er een risico op 'data leakage'. Omdat grote taalmodellen (LLM's) tijdens hun training vaak zijn blootgesteld aan ondertitels en andere informatie over bekende commerciële films, kunnen ze vragen over deze films beantwoorden zonder de video daadwerkelijk te analyseren.
Door gebruik te maken van amateurfilms in SF20K wordt dit risico geminimaliseerd. Om de effectiviteit van de dataset te testen, hebben de auteurs SF20K-Test geïntroduceerd. Dit is een benchmark voor open-ended vraag-en-antwoordinteracties, bestaande uit 95 films en 979 specifieke vraag-antwoordparen.
Resultaten en toekomstperspectief
De analyse van de SF20K-Test bevestigt dat er sprake is van beperkte data leakage, wat betekent dat de modellen daadwerkelijk de visuele informatie moeten verwerken om tot het juiste antwoord te komen. De resultaten benadrukken bovendien de noodzaak voor 'long-term reasoning', oftewel het vermogen van AI om verbanden te leggen over een langere tijdlijn binnen een verhaal.
De onderzoekers tonen aan dat 'instruction tuning' op deze grootschalige dataset de prestaties van modellen aanzienlijk verbetert. Hiermee wordt een fundament gelegd voor toekomstige vooruitgang in het begrijpen van complexe, langdurige video-inhoud. Het onderzoek is verschenen in het , volume 134, artikelnummer 396.
Bredere context van storytelling
Terwijl de wetenschappelijke focus ligt op het technisch begrijpen van video, blijft de interesse in korte verhalen in bredere zin groot. Platforms zoals reedsy.com bieden bijvoorbeeld duizenden korte verhalen aan en organiseren wekelijkse schrijfwedstrijden om creativiteit te stimuleren. Hoewel deze platforms zich richten op tekstuele narratieven en auteurschap, onderstreept de diversiteit aan genres — van mysterie en drama tot fantasy — de complexiteit van storytelling die AI-modellen nu via SF20K leren te herkennen.
Andere online bronnen voor literatuur en korte verhalen, zoals americanliterature.com en bookbub.com, dragen bij aan de brede beschikbaarheid van narratieve structuren, hoewel de focus van het SF20K-project specifiek ligt op de visuele vertaling van deze verhalen in filmvorm.