⚠️ KMI waarschuwing: Onweer in België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
Voice cloning-model XTTSv2 kan worden ingezet voor anonimisering van spraak

Voice cloning-model XTTSv2 kan worden ingezet voor anonimisering van spraak

Een team van wetenschappers heeft een innovatieve manier gevonden om bestaande technologie voor stemklonen om te vormen tot een instrument voor privacybescherming. Door het meertalige model XTTSv2 in te zetten, is het mogelijk om sprekerspecifieke kenmerken uit audio-opnames te verwijderen, terwijl de kwaliteit en de inhoud van de boodschap behouden blijven.

In een rapport dat op 27 augustus 2026 verscheen, leggen Romolo Muletta, Felix Matthias Saaro, Mark Cieliebak en Jan Deriu uit hoe zij dit hebben bereikt. Het hoofddoel van hun benadering is het onderdrukken van identificerende stemeigenschappen zonder dat dit ten koste gaat van de linguïstische informatie. Volgens de publicatie op arxiv.org is het model XTTSv2 hiervoor zeer geschikt, aangezien dit systeem oorspronkelijk is getraind op een enorme dataset van 27.000 uur aan spraakgegevens.

Efficiëntie door hergebruik

Het bijzondere aan deze methode is dat er geen sprake is van een tijdrovende hertraining van het AI-model. De onderzoekers ontdekten dat XTTSv2 de prosodische structuur — de ritmiek en de intonatie van de spraak — kan behouden, ongeacht wie de spreker is. Door het model te conditioneren op een zogenaamde 'pseudo-spreker', kan de oorspronkelijke stem effectief worden vervangen door een anonieme variant.

Om een optimaal resultaat te behalen, hebben de auteurs een specifieke verfijningsstrategie ontwikkeld. Deze methode zoekt naar een balans tussen de privacy (de mate waarin sprekers van elkaar verschillen) en de utiliteit (hoe goed de tekst verstaanbaar blijft). In het artikel wordt gesteld dat deze aanpak een superieure spraakkwaliteit biedt in vergelijking met traditionele systemen die specifiek voor anonimisering zijn gebouwd.

Prestaties in diverse talen

De effectiviteit van het systeem is uitgebreid getest in zeven verschillende Europese talen. Hierbij is gebruikgemaakt van erkende datasets zoals Multilingual LibriSpeech en CommonVoice. De resultaten laten zien dat de methode een zeer hoge privacygraad behaalt, met een Equal Error Rate (EER) van ongeveer 0,49. Een belangrijk voordeel is dat het systeem geen taal-specifieke training nodig heeft om in deze diverse talen te functioneren.

Contrast met commerciële toepassingen

Terwijl dit academische onderzoek zich richt op de complexe transformatie van stemkenmerken voor privacydoeleinden, richten commerciële communicatietools zich op andere aspecten van spraaktechnologie. Zo biedt google.com bijvoorbeeld praktische functionaliteiten voor het beheren van voicemail, tekstberichten en telefoongesprekken via apps of browsers, zonder dat daar sprake is van stemtransformatie.

De verschuiving van voice cloning naar anonimisering toont aan hoe veelzijdig AI-modellen kunnen zijn. Technologie die bedoeld was om stemmen exact te imiteren, kan nu worden ingezet om identiteiten juist onherkenbaar te maken. Om verdere innovatie binnen de computationele linguïstiek te stimuleren, hebben de auteurs de code van hun systeem openbaar gemaakt. De volledige details van het onderzoek zijn terug te vinden in de , waar het werk is gecategoriseerd onder de rubriek Computation and Language.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!