Onderzoekers hebben SANA-Video 2.0 gepresenteerd, een nieuw model voor videogeneratie dat gebruikmaakt van een hybride lineaire aandacht-architectuur om hoge resoluties te bereiken met een fractie van de rekenkracht van traditionele modellen.
In een recent wetenschappelijk rapport is SANA-Video 2.0 geïntroduceerd, een hybride video diffusion transformer die beschikbaar is in schalen van 5 miljard (5B) en 14 miljard (14B) parameters. Het model is specifiek ontworpen om kwalitatief hoogwaardige video's tot een resolutie van 720p te genereren op een enkele grafische kaart (GPU), zonder in te boeten op de visuele kwaliteit die normaal gesproken alleen wordt gehaald door zwaardere 'full-softmax' video DiT-modellen.
Innovatie in aandachtmechanismen
De kern van SANA-Video 2.0 ligt in de zogenaamde 'Hybrid Linear-Softmax Attention'. Traditionele aandachtmechanismen in AI hebben vaak te maken met een kwadratische toename van de rekenlast naarmate de sequentie langer wordt. Om dit te omzeilen, combineert SANA-Video 2.0 'gated linear attention' voor de bulk van de dataverwerking met periodieke 'gated-softmax anchors'. Volgens de publicatie op arxiv.org gebeurt dit in een verhouding van 3:1, waardoor de interacties tussen tokens behouden blijven die bij puur lineaire aandacht vaak verloren gaan.
Daarnaast introduceert het model 'Block Attention Residuals' (AttnRes). Deze techniek zorgt ervoor dat samenvattingen van voltooide blokken worden doorgestuurd naar latere lineaire lagen. Dit proces optimaliseert het hergebruik van kenmerken en verhoogt de effectieve rang in diepere lagen met ongeveer 12%.
Prestaties en snelheid
SANA-Video 2.0 is volledig vanaf nul getraind, in plaats van het lineariseren van reeds bestaande modellen. Uit onderzoek naar resolutie-proxy's bleek dat een verhouding van 25% softmax de optimale balans biedt tussen efficiëntie en beeldkwaliteit.
De praktische resultaten van deze architectuur zijn aanzienlijk:
* Snelheid: Bij een resolutie van 480p behaalt het model een VBench-score van 84,30 in slechts 13,2 seconden op een enkele H100 GPU.
* Efficiëntie: De gecompileerde DiT-forward pass is 3,2 keer sneller dan een vergelijkbare full-softmax baseline bij 720p/60s.
* Optimalisatie: Door de implementatie van de 'Sol-Engine' (inclusief kernel fusion en sparse attention) is de 5B-pipeline versneld naar 13,06 seconden voor een video van 720p/5s.
In vergelijking met andere modellen, zoals Wan 2.2-A14B op een H100, is SANA-Video 2.0 volgens de tot wel 120 keer sneller.
Context en onderscheid
Hoewel de naam "SANA" in verschillende contexten voorkomt, is dit technologische project strikt gescheiden van andere entiteiten. Zo is er geen link tussen dit AI-model en de Amerikaanse zorgverzekeringsdienst sanabenefits.com, die zich richt op zorgplannen voor kleine en middelgrote bedrijven. Evenmin heeft de technologie enige relatie met de K-popindustrie of artiesten zoals kprofiles.com, wiens profielen worden bijgehouden op entertainmentplatforms.
De ontwikkeling van SANA-Video 2.0 markeert een belangrijke stap in het toegankelijker maken van hoogwaardige videogeneratie, waarbij de noodzaak voor enorme computerclusters wordt verminderd ten gunste van hardware-vriendelijke backbones die schaalbare, lange en hoge resolutie video's kunnen produceren.