⚠️ KMI waarschuwing: Onweer in België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
Nieuwe methode maakt stemklonen mogelijk in tekst-naar-video modellen

Nieuwe methode maakt stemklonen mogelijk in tekst-naar-video modellen

Wetenschappers hebben een innovatieve manier gevonden om generatieve modellen, die tekst omzetten naar audio en video, te voorzien van voice-cloning functionaliteiten. Waar Text-to-Audio-Video (T2AV) systemen voorheen wel beelden en geluid konden creëren op basis van tekst, maar geen controle boden over de specifieke stem, biedt een nieuwe aanpak hier nu wel een oplossing voor.

In een wetenschappelijk rapport dat op 16 augustus 2026 werd gepubliceerd, leggen Ivan Mikheev en zijn team uit hoe een standaard T2AV-model kan worden omgevormd tot een systeem voor stemkopieën. Volgens de publicatie op arxiv.org is dit mogelijk door het toevoegen van een enkele lineaire laag, die op nul is geïnitieerd, aan de audio-backbone van het model.

Technische werking en training

De implementatie van deze techniek vereist een relatief kort traject van fine-tuning. Tijdens het genereren van de output wordt het model gestuurd door een korte referentie-opname van de gewenste stem. Deze referentie wordt via twee verschillende signalen in het systeem verwerkt: enerzijds via de diffusie-latents die aan de audiostroom worden toegevoegd, en anderzijds via een globale 'speaker embedding' die de tokens van de doelaudio moduleert.

Door deze wijziging in de architectuur produceert het systeem geen generieke stemmen meer, maar kan het de unieke kenmerken van de referentie-opname overnemen. De onderzoekers wijzen erop dat deze resultaten behaald kunnen worden met slechts minimale structurele aanpassingen aan het oorspronkelijke basismodel, zoals beschreven in het .

Prestaties en snelheidswinst

Om de effectiviteit van de methode te valideren, is het model met 5 miljard parameters getest tegen vijf sterke baselines voor voice-cloning text-to-speech. De testset bestond uit 674 paren van sprekers en tekst, verdeeld over 30 verschillende personen. De resultaten tonen aan dat het model de hoogste score behaalde op de Speaker-Encoder Cosine Similarity (SECS), een meting die werd bevestigd door drie onafhankelijke netwerken: Resemblyzer, WavLM-SV en ECAPA-TDNN.

Een belangrijk voordeel van deze nieuwe opzet is de efficiëntie tijdens de inferentiefase. Het is namelijk mogelijk om het audiopad los van het videopad te evalueren. Wanneer de audio onafhankelijk van de video wordt gegenereerd, is het proces ongeveer 30 keer sneller dan bij een volledige audio-video diffusie-loop, zonder dat dit ten koste gaat van de kwaliteit van de voice-cloning.

Contrast met commerciële toepassingen

Terwijl dit academische onderzoek zich richt op de creatie van synthetische stemmen, richten commerciële tools zich vaak op het beheer van communicatie. Een voorbeeld hiervan is Google Voice, waarbij de nadruk ligt op het beheren van berichten en het voeren van gesprekken via diverse apparaten, zoals uitgelegd in de google.com.

De integratie van voice-cloning in T2AV-modellen biedt aanzienlijk meer controle over synthetische media. Het vermogen om snel en accuraat een specifieke stem te reproduceren in een video, zonder dat daarvoor een volledig nieuw model getraind moet worden, kan een grote impact hebben op de digitale contentcreatie. Meer technische details over de gebruikte datasets en de implementatie zijn terug te vinden via de .

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!