Wetenschappers hebben een innovatief AI-raamwerk genaamd UniVoice ontwikkeld, waarmee de processen van automatische spraakherkenning (ASR) en tekst-naar-spraak-synthese (TTS) in één enkel model zijn geïntegreerd. Waar deze twee functies voorheen doorgaans via afzonderlijke architecturen werden beheerd, streeft dit nieuwe project naar een uniforme aanpak. Volgens een arxiv.org op arXiv.org is het doel om de traditionele scheiding tussen herkenning en generatie van spraak te doorbreken.
Aanpak van informatieverlies
Een centraal probleem bij eerdere pogingen om deze taken te combineren, was het gebruik van discrete spraaktokenisatie. Deze methode leidde vaak tot inherent informatieverlies, wat de kwaliteit van zowel de herkenning als de uiteindelijke spraakgeneratie negatief beïnvloedde. UniVoice lost dit op door gebruik te maken van continue representaties, waardoor spraaksignalen preciezer kunnen worden verwerkt.
Om dit te bereiken, combineert het raamwerk twee verschillende technieken. Enerzijds wordt er gebruikgemaakt van autoregressieve modellering, wat vooral effectief is voor de herkenningszijde. Anderzijds wordt flow matching ingezet om een hoogwaardige synthese van spraak te garanderen. Deze hybride benadering zorgt ervoor dat het model accurater kan reproduceren wat het hoort.
Technisch vernieuwend aandachtmechanisme
Om de kloof tussen de autoregressieve methode en de flow-matching modellen te dichten, hebben de ontwikkelaars een zogenaamd 'dual attention mechanism' geïmplementeerd. Dit systeem stelt UniVoice in staat om dynamisch te wisselen tussen twee specifieke modi. Tijdens de fase van spraakherkenning maakt het model gebruik van een causaal masker, terwijl er tijdens de synthesefase wordt overgeschakeld naar een bidirectioneel aandachtmasker.
Daarnaast introduceert het systeem een methode voor spraak-infilling op basis van tekst-prefixes. Deze techniek maakt 'zero-shot voice cloning' mogelijk, waarbij het model in staat is om een stem zeer getrouw te kopiëren zonder dat daarvoor uitgebreide nieuwe trainingsdatasets nodig zijn. De technische details over deze implementatie zijn terug te vinden in de .
Prestaties en wetenschappelijke erkenning
Uit experimentele resultaten blijkt dat UniVoice concurrerend is met, of zelfs superieur aan, bestaande methoden die zich slechts op één specifieke taak richten. Dit geldt zowel voor de precisie van de spraakherkenning als voor de kwaliteit van de tekst-naar-spraak-taken. Zoals beschreven in de , presteert het model op gelijke hoogte met gespecialiseerde single-task modellen.
Het onderzoeksproject werd geleid door Wenhao Guan, samen met een team van zeven andere auteurs, waaronder Ziyue Jiang en Zhikang Niu. De wetenschappelijke waarde van het werk is bevestigd door de acceptatie voor presentatie op de conferentie Interspeech 2026. De onderzoekers hebben tevens de code van het project openbaar gemaakt om verdere innovaties binnen de AI-gemeenschap te stimuleren. De meest recente update van het artikel, versie 4, werd op 4 september 2026 gepubliceerd via .