← Terug
VIBE: Nieuw AI-model voor nauwkeurige generatie van achtergrondmuziek bij video

VIBE: Nieuw AI-model voor nauwkeurige generatie van achtergrondmuziek bij video

De ontwikkeling van muziek die naadloos aansluit bij videobeelden vormt een aanzienlijke uitdaging voor kunstmatige intelligentie. Traditionele systemen voor video-naar-muziek (V2M) missen vaak de nodige semantische controle, waardoor ze moeite hebben om specifieke instructies nauwkeurig uit te voeren. Volgens een wetenschappelijk rapport op arxiv.org komt dit voort uit een te sterke focus op reconstructiedoelstellingen en de beperkingen van statische conditionering binnen Diffusion Autoregressive (DAR) architecturen.

Om deze problemen op te lossen, hebben Aryan Vijay Bhosale en collega-onderzoekers VIBE ontwikkeld. De afkorting staat voor Video Instruction-aligned Background music gEneration. In tegenstelling tot oudere methoden werkt VIBE als een 'text-and-video-to-music' (T+V2M) model. Dit stelt het systeem in staat om niet enkel de visuele input te analyseren, maar ook tekstuele aanwijzingen te integreren om de sfeer, structuur en stijl van de muziek te bepalen. Meer informatie over de implementatie is terug te vinden op de github.io.

Het model introduceert twee fundamentele technische verbeteringen om de precisie te verhogen. De eerste is de 'Conditioning Connection', een mechanisme voor cross-layer conditionering. Deze techniek slaat een dynamische brug tussen de planning- en de diffusie-verfijningskoppen, waardoor het model beter kan anticiperen op de behoeften van de video tijdens het generatieproces.

Daarnaast maakt het team gebruik van een uitgebreide taxonomie voor beloningsmodellering. Zoals beschreven in de publicatie op , is VIBE getraind via een gestructureerd curriculum dat uit vijf fasen bestaat. Hierbij wordt geoptimaliseerd op basis van twee verschillende criteria. Enerzijds zijn er de harde, verifieerbare beperkingen, zoals de toonsoort en het tempo. Anderzijds richt het model zich op zachte, subjectieve kwaliteiten, waaronder de algemene muzikaliteit en de multimodale uitlijning, oftewel de mate waarin de audio past bij de beelden.

De effectiviteit van het systeem is getoetst via diverse meetmethoden, waaronder de audiokwaliteit, de mate van instructie-opvolging en de audio-visuele synchronisatie. Ook is er een subjectieve evaluatie door mensen uitgevoerd. De resultaten tonen aan dat VIBE een superieure controle biedt en instructies nauwkeuriger uitvoert dan eerdere modellen. Op het gebied van generatieve getrouwheid presteert het model vergelijkbaar met bestaande baselines, wat bewijst dat de toegenomen controle niet ten koste gaat van de geluidskwaliteit. Details over deze evaluaties zijn beschikbaar via de .

Het onderzoek, dat op 31 augustus 2026 werd ingediend door Vaibhavi Lokegaonkar, is breed gecategoriseerd binnen diverse informatica-disciplines. Volgens de metadata van valt het project onder categorieën zoals Machine Learning (cs.LG), Kunstmatige Intelligentie (cs.AI), Computer Vision and Pattern Recognition (cs.CV), Sound (cs.SD) en Computation and Language (cs.CL). Het biedt hiermee een theoretisch kader voor hoe AI-systemen menselijke instructies kunnen vertalen naar complexe audio-outputs, waardoor makers meer artistieke controle krijgen over hun producties.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!