← Terug
Nieuw framework verbetert generatie van non-verbale geluiden in spraakmodellen

Nieuw framework verbetert generatie van non-verbale geluiden in spraakmodellen

Wetenschappers hebben een innovatieve techniek ontwikkeld om continue autoregressieve spraakmodellen natuurlijker te laten klinken. De focus ligt hierbij op het verbeteren van non-verbale vocalisaties (NVV), oftewel de geluiden die mensen maken tijdens het spreken die geen woorden zijn, maar wel emotie en context toevoegen, zoals zuchten of lachen. Dit onderzoek is gepresenteerd in een wetenschappelijke publicatie via arxiv.org.

Automatisering van menselijke voorkeuren

Een centraal probleem bij het trainen van AI-spraakmodellen is het gebrek aan kwalitatieve data over wat mensen precies 'natuurlijk' vinden. Het handmatig labelen van deze voorkeuren is een kostbaar en tijdrovend proces. Om dit op te lossen, stelt het team onder leiding van Jingbin Hu een systeem voor waarbij een Large Audio-Language Model (LALM) optreedt als beoordelaar.

Volgens de is hiervoor een tweetalig corpus van prompts samengesteld. Hierbij werden echte transcripten met non-verbale geluiden gecombineerd met prompts die door een taalmodel waren gegenereerd. Het LALM rangschikte vervolgens verschillende mogelijke audio-uitspraken, waardoor paren van 'gekozen' en 'afgewezen' samples ontstonden. Dit proces is gebaseerd op het concept van weblio.jp, waarbij een specifieke keuze wordt gemaakt voor de ene optie boven de andere.

Een tweestaps optimalisatie

Om de kwaliteit van de audio-output te maximaliseren, hanteert het onderzoeksteam een strategie in twee fasen. In de eerste fase, genaamd Rejection Sampling Fine-Tuning (RSFT), wordt het model bijgestuurd op basis van de best scorende samples die door het LALM zijn geselecteerd.

In de tweede fase wordt gebruikgemaakt van Anchored Flow-DPO. Deze methode optimaliseert de voorkeuren via een zogenaamde utterance-level flow-matching loss. Door de flow-matching van de gekozen samples als een anker te gebruiken, kan het model leren van voorkeuren zonder dat er expliciete sequence likelihoods nodig zijn. Dit zorgt ervoor dat de directe supervisie op de gewenste audio-realisaties behouden blijft, zoals verder uitgelicht in de .

Prestaties en resultaten

De effectiviteit van het framework is getest binnen de NVVSpeech Challenge Track 2, waarbij een testset van 1.600 uitspraken werd gebruikt. De resultaten laten een duidelijke verbetering zien ten opzichte van bestaande systemen. Het model behaalde een Final Track2Score van 75,80, met een score van 79,39 voor het Chinees en 72,21 voor het Engels.

Uit de data in de blijkt dat deze methode 1,84 punten beter presteerde dan de baseline van VoxCPM2. De vooruitgang is vooral toe te schrijven aan een hogere nauwkeurigheid van de non-verbale vocalisaties en een sterker perceptueel effect, terwijl de algemene audiokwaliteit stabiel bleef.

Het onderzoek is geaccepteerd voor de ISCSLP 2026. Door de integratie van feedback van audio-taalmodellen kunnen spraaksystemen menselijke nuances accurater nabootsen, wat bijdraagt aan een meer natuurlijke interactie tussen mens en machine.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!