← Terug
Nieuwe AI-methode verbetert natuurlijke spraakgeneratie door non-verbale geluiden

Nieuwe AI-methode verbetert natuurlijke spraakgeneratie door non-verbale geluiden

Het creëren van synthetische spraak die werkelijk menselijk klinkt, blijft een van de grootste uitdagingen binnen de kunstmatige intelligentie. Een cruciale factor hierbij is de integratie van non-verbale vocalisaties (NVV's), zoals zuchten of aarzelingen, die essentieel zijn voor de emotionele overdracht van een boodschap. In een wetenschappelijke publicatie van 13 september 2026 presenteren Ziyu Zhang en collega's een innovatieve methode om deze geluiden effectiever te modelleren.

Volgens een artikel op arxiv.org vormen non-verbale geluiden een aanzienlijk obstakel voor AI-systemen vanwege hun grote akoestische variatie en de ongelijkmatige verdeling in beschikbare datasets. Om dit op te lossen, hebben de wetenschappers het "NVV-aware DiTAR-systeem" ontwikkeld. Dit model maakt gebruik van zestien specifieke categorieën voor non-verbale vocalisaties, die elk als een apart token worden gecodeerd. Een belangrijke verbetering is de verfijning van de stop-voorspelling, waardoor het systeem beter kan herkennen of een geluid midden in een zin voorkomt of dat de uiting daadwerkelijk is beëindigd.

Het proces om dit systeem te perfectioneren verliep in verschillende stadia. Na een uitgebreide tweetalige pre-training op diverse NVV-data volgde een fase van gesuperviseerde fijnafstemming. Hierbij werd het corpus uitgebreid via synthetische augmentatie en een herbalancering van frequenties. Tijdens de uiteindelijke generatie van spraak worden technieken zoals akoestische prompts en "Best-of-N sampling" ingezet om de kwaliteit te waarborgen en fouten te minimaliseren. De technische details van deze architectuur zijn beschreven in de documentatie op .

De praktische effectiviteit van deze technologie werd bewezen tijdens de ISCSLP 2026 NVVSpeech Challenge. In de tweede track van deze competitie behaalde het systeem een gewogen tweetalige score van 62,786. Dit resultaat leverde het team de eerste plaats op in het algemene klassement en in de categorie Mandarijn, terwijl ze in de Engelse categorie als tweede eindigden. Uit aanvullend onderzoek bleek dat de gerichte augmentatie vooral hielp bij categorieën die in de oorspronkelijke data ondervertegenwoordigd waren.

Naast de technische optimalisaties is er in de internationale wetenschappelijke gemeenschap vaak aandacht voor terminologische verschillen. Bij het beschrijven van het verbeteren van systemen varieert de spelling per regio. Zo legt sapling.ai uit dat de term "optimizing" dominant is in de Verenigde Staten, terwijl men in Australië en het Verenigd Koninkrijk vaker kiest voor "optimising".

De onderzoekers concluderen dat een succesvolle selectie van spraakkandidaten afhankelijk is van een zorgvuldige balans tussen de correctheid van de non-verbale geluiden, de lexicale getrouwheid en de algemene perceptuele kwaliteit. De volledige resultaten van de NVVSpeech Challenge en de werking van het DiTAR-model zijn in detail terug te lezen via .

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!