Een team van onderzoekers, onder leiding van Weizhen Bian, heeft een innovatief text-to-speech-systeem ontwikkeld genaamd COT-TTS. Dit systeem is ontworpen om de menselijke interactie nauwer te benaderen door de spreektoon en emotie automatisch af te leiden uit de context van een lopend gesprek, waardoor expliciete instructies van de gebruiker over de gewenste stijl overbodig worden.
Traditionele systemen voor spraaksynthese zijn vaak afhankelijk van specifieke aanwijzingen om expressiviteit te bereiken. COT-TTS doorbreekt dit patroon door een redeneerstap toe te voegen aan het proces. In plaats van een directe omzetting van tekst naar audio, analyseert het model eerst de conversationele context. Er wordt een tussenliggende redenering geformuleerd over de optimale manier van uitspraak voordat de uiteindelijke audio wordt gegenereerd. Deze methode sluit aan bij bredere ontwikkelingen in AI, waarbij openai.com gebruikmaken van een interne keten van gedachten om complexere taken nauwkeuriger uit te voeren.
Volgens de technische beschrijving op arxiv.org combineert het systeem drie cruciale inputvariabelen: de audio van een voorgaand gesprek, de te produceren tekst en een referentiefragment voor het specifieke stemtimbre. Door deze combinatie kan het model variaties in ritme, klemtonen en emoties automatisch aanpassen aan de situatie, wat resulteert in een vloeiendere en minder mechanische spraak.
Om dit systeem te trainen, hebben de auteurs een uitgebreide tweetalige dataset voor conversationele spraak samengesteld. Deze dataset bevat in totaal 9 miljoen trainingsvoorbeelden, waarvan 1 miljoen samples als hoogwaardig zijn geclassificeerd. Ter validatie is er een benchmark opgesteld met 800 door mensen geverifieerde voorbeelden. Het model is technisch opgezet als een end-to-end autoregressief systeem, waarbij twee versies zijn ontwikkeld met respectievelijk 0,6 miljard en 1,7 miljard parameters. Zoals vermeld in de , is het model in staat om transcripties te genereren die voorzien zijn van emotie-labels en aanpasbare gevolgtrekkingen over de stijl.
De resultaten tonen aan dat COT-TTS prestaties levert die concurrerend zijn met veel grotere basissystemen, ondanks het lagere aantal parameters. Het systeem blinkt met name uit in emotionele consistentie en de nauwkeurigheid van de spraakduur. Door passende ritmische variaties en stressaccenten toe te voegen op basis van de context, wordt de typische robotachtige klank van oudere TTS-technologieën vermeden.
Met het oog op verdere innovatie binnen de computationele taalwetenschap en audioverwerking, hebben de makers aangekondigd hun hulpmiddelen openbaar te maken. Dit omvat de getrainde modellen, de dataset en de volledige pijplijn voor dataconstructie. Meer details en demonstraties zijn terug te vinden via de .