De kosten en rekenkracht die nodig zijn voor het genereren van beelden via diffusiemodellen zijn aanzienlijk gestegen door de toenemende omvang van de gebruikte netwerken. Hoewel er diverse methoden bestaan om het aantal stappen in dit proces te beperken, blijft het een uitdaging om beelden van hoge kwaliteit te produceren binnen het budget van een enkele volledige netwerkdoorloop. Volgens een wetenschappelijke publicatie op arxiv.org resulteren huidige technieken voor generatie in één stap vaak in beelden die te glad ogen, omdat ze proberen de transitie van grove vormen naar fijne details in één enkele mapping te vatten.
Om deze beperking te omzeilen, hebben Zhen Guo en een team van onderzoekers de Phase-wise Velocity Distillation (PVD) ontwikkeld. Deze benadering splitst de tijdlijn van de beeldgeneratie op in merriam-webster.com specifieke fasen: een grove fase en een fijne fase. In plaats van één groot, monolithisch model te gebruiken, zet PVD voor elke fase een eigen 'expert-model' in.
Deze experts zijn elk ongeveer de helft zo groot als het oorspronkelijke model. Door de structurele compositie van het beeld los te koppelen van de uiteindelijke verfijning, blijft de totale benodigde rekenkracht gelijk aan één enkele doorloop van het oorspronkelijke netwerk, terwijl de visuele kwaliteit van de output toeneemt. De overgang binnen elke fase wordt hierbij gemodelleerd aan de hand van de gemiddelde snelheid.
De effectiviteit van deze methode is getest op diverse datasets. Bij klasse-conditionele beeldgeneratie op ImageNet (met een resolutie van 256 x 256) behaalde de techniek een FID-score van 1,48, wat duidt op een hoge visuele getrouwheid. Daarnaast is de techniek toegepast op complexe tekst-naar-beeldgeneratie (T2I) met verschillende backbones, waaronder Qwen-Image, FLUX.1-dev en Stable Diffusion 3.5-Medium. Uit de resultaten op blijkt dat deze gedistilleerde modellen prestaties leveren die concurrerend zijn met de oorspronkelijke 'teacher-modellen' die meerdere stappen vereisen, en dat PVD significant beter presteert dan eerdere distillatiemethoden.
Naast de visuele resultaten biedt PVD aanzienlijke voordelen voor de hardware-efficiëntie. De implementatie zorgt voor een sterke vermindering van de benodigde middelen tijdens het generatieproces. Uit evaluaties van de T2I-backbones komt naar voren dat het aantal actieve parameters met 49,10% tot 50,89% daalt in vergelijking met de oorspronkelijke modellen.
Ook het geheugengebruik wordt aanzienlijk geoptimaliseerd. De piek van het videogeheugen (VRAM) vertoont een daling van 45,76% tot 48,36% ten opzichte van de teacher-modellen. Deze efficiëntie maakt hoogwaardige AI-beeldgeneratie toegankelijker voor systemen met beperktere hardwarecapaciteit. Het volledige onderzoek, inclusief de broncode en de modellen, is op 6 oktober 2026 beschikbaar gesteld via de om verdere innovaties binnen de computer vision en patroonherkenning te stimuleren. De definitie van de gebruikte fasering is consistent met de numerieke aanduiding van afzonderlijke stappen.