⚠️ KMI waarschuwing: Onweer in Noordwest-België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
Prism-framework maakt efficiëntere training van 2K video- en audiogeneratie mogelijk

Prism-framework maakt efficiëntere training van 2K video- en audiogeneratie mogelijk

Het gelijktijdig genereren van video en audio op hoge resoluties biedt aanzienlijke voordelen voor de visuele scherpte en de dynamiek van bewegingen, maar brengt grote technische uitdagingen met zich mee. Traditionele methoden die gebruikmaken van volledige aandachtmechanismen kampen met kwadratische kosten, wat betekent dat de rekenkracht exponentieel toeneemt naarmate de resolutie stijgt. Volgens een wetenschappelijke publicatie op arxiv.org leidt dit ertoe dat aandacht wordt verspreid over een overvloed aan redundante tokens, waardoor relevante leersignalen verzwakken en bestaande pretrained priors kunnen worden verstoord.

Om deze computationele hindernissen te overwinnen, hebben Shuyuan Tu en collega's het Prism-framework ontwikkeld. In tegenstelling tot conventionele technieken voor 'sparse attention', die vaak enkel gericht zijn op snelheid zonder rekening te houden met de specifieke structuur van gecombineerde audio- en videodata, hanteert Prism een dynamische strategie. Zoals beschreven op de officiële pagina van openai.com, is dit framework specifiek ontworpen om het trainen van modellen op een resolutie van 2K efficiënter te maken.

De innovatie van Prism schuilt in de organisatie van token-sequenties in spatiotemporele macro-zones. Dit stelt de attentiestructuur in staat om zich aan te passen aan de lokale inhoud van de data. Het systeem analyseert binnen elke zone de lokale informatiestructuur aan de hand van twee kritieke signalen: de variantie van videokenmerken langs het kanaal en de kenmerknormen die voortkomen uit de cross-attention van audio naar video. Door deze signalen te combineren, kan het framework bepalen hoe visuele inhoud varieert en in welke mate audio een specifiek visueel gebied beïnvloedt.

Op basis van deze analyse wijst Prism een specifieke blokvorm toe aan elke zone. Er wordt een fijnere verdeling gehanteerd op assen waar sprake is van snelle visuele veranderingen of een sterke koppeling tussen de audio- en videostromen. Deze aanpak garandeert dat tokens binnen elk blok semantisch coherent blijven, waardoor zowel de visuele inhoud als de interactiepatronen tussen de verschillende media effectiever worden vastgelegd. Daarnaast maakt het systeem gebruik van een hybride strategie voor blokselectie om de mate van sparsiteit per query dynamisch te bepalen.

De resultaten van deze nieuwe methode zijn volgens de auteurs van het onderzoek zeer positief. Het framework realiseert een versnelling van de training met een factor 2,5 in vergelijking met systemen die volledige aandacht gebruiken. Een cruciaal aspect is dat deze winst in efficiëntie niet leidt tot kwaliteitsverlies; de kwaliteit van de gegenereerde content overtreft zelfs die van modellen die met volledige aandacht zijn getraind.

Het onderzoek, dat op 4 oktober 2026 is ingediend bij onder de categorie Computer Vision and Pattern Recognition, is het resultaat van een samenwerking tussen onderzoekers zoals Shuyuan Tu, Qi Tian en Yinming Huang. Door de focus te leggen op de concentratie van cross-modale interacties rondom regio's die geluid produceren, biedt Prism een schaalbare oplossing voor de complexiteit van native 2K-generatie.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!