Het produceren van korte series met behulp van kunstmatige intelligentie is inmiddels een geïndustrialiseerd proces, maar de stap van losse beelden naar een samenhangende aflevering blijft problematisch. Een groot knelpunt is de visuele continuïteit; omdat huidige systemen elk shot vaak onafhankelijk genereren, ontstaan er fouten in de context. Dit leidt tot storende inconsistenties in de positionering van personages, hun houding en de weergave van rekwisieten wanneer de shots worden samengevoegd.
Om deze visuele breuken te elimineren, hebben onderzoekers Shot Entity-Attribute Memory (SEAM) ontwikkeld. Volgens een publicatie op arxiv.org is dit een model-agnostische geheugengrafiek die geen extra training vereist. In plaats van het AI-model zelf aan te passen, intervenieert SEAM op het niveau van de tekstprompts. Het systeem extraheert voor elk shot een multidimensionale status en haalt via een grafiekstructuur enkel de relevante causale context uit voorgaande scènes op. Deze informatie wordt vervolgens via 'prompt rewriting' in natuurlijke taal aan de beeldgenerator doorgegeven, waardoor strikte visuele kaders worden opgelegd.
Ter validatie van deze methode is SEAM-Bench ontwikkeld, een benchmark die specifiek is ontworpen om de continuïteit in storyboarding te meten. Uit de resultaten blijkt dat de 'cross-episode continuity recall' steeg van 0,700 naar 0,946. In een analyse via acadeus wordt vermeld dat het systeem effectief functioneert over zes verschillende gangbare tekstmodellen. Hoewel de visuele verbeteringen consistent zijn, worden ze in de rapportage nog niet als significant bestempeld.
De praktische effectiviteit van de technologie werd getest binnen de productiepijplijn van CreativeFitting via de zogenaamde SEAM-Agent. Bij een test met 201 shots behaalde het systeem een acceptatiegraad van 96,5% bij regisseurs. Een conservatieve schatting wijst uit dat 21,9 procentpunten van dit resultaat direct toe te schrijven zijn aan het cross-episode geheugen van SEAM. De bijbehorende dataset voor SEAM-Bench is inmiddels publiekelijk toegankelijk via hf-mirror.com.
De problematiek rondom visuele stabiliteit is een breder thema in de computerwetenschappen. Een parallel project, EntityBench, richt zich specifiek op het consistent houden van locaties, objecten en personages over langere sequenties. Zoals beschreven op de github.io, maakt EntityBench gebruik van een dataset met 140 episodes en 2.491 shots uit echte media om te analyseren hoe de consistentie over grotere afstanden degradeert.
Binnen dit kader is ook EntityMem geïntroduceerd, een systeem dat visuele referenties van entiteiten opslaat in een persistente geheugenbank vóór de start van de generatie. Deze aanpak helpt bij het bewaken van de identiteit van personages en behaalde in vergelijkingen met andere methoden de hoogste getrouwheid. De combinatie van SEAM en initiatieven zoals EntityBench markeert een transitie naar een meer gestructureerde, geheugen-gestuurde aanpak van videogeneratie, wat essentieel is voor professionele digitale workflows.