Wetenschappers hebben een doorbraak geforceerd in de ontwikkeling van tekst-naar-spraaktechnologie (TTS) met de introductie van EditVoice. Dit nieuwe model is in staat om de lengte van audiofragmenten op een dynamische manier aan te passen, een eigenschap die tot nu toe ontbrak bij vergelijkbare systemen. Volgens een technisch rapport op arxiv.org is EditVoice het eerste non-autoregressieve (NAR) zero-shot TTS-model dat met variabele lengtes kan werken.
In de huidige stand van zaken kunnen non-autoregressieve modellen audio in parallel genereren, wat resulteert in een aanzienlijk hogere snelheid dan traditionele methoden. Een grote beperking was echter dat de exacte lengte van de audio-sequentie vooraf vastgesteld moest worden. EditVoice lost dit probleem op door de implementatie van 'Edit Flows'. Deze innovatieve benadering stelt het systeem in staat om gelijktijdig de inhoud van de spraak en de totale lengte van het fragment te wijzigen.
De werking van deze technologie berust op drie fundamentele operaties: het toevoegen van segmenten (inserties), het verwijderen van delen (deleties) en het vervangen van fragmenten (substituties). Om dit mogelijk te maken, maken de ontwikkelaars gebruik van 'speech-infilling training'. Deze methode integreert zero-shot TTS met tekstgebaseerde bewerkingen. Hierdoor kan het model referentie-audio aan zowel het begin als het einde van een fragment plaatsen, waardoor de stemstijl en karakteristieken nauwkeuriger kunnen worden gestuurd.
Om de geluidskwaliteit verder te optimaliseren, hebben onderzoekers, waaronder Hongyao Deng, de techniek Complementary Prompt Sampling (CPS) ontwikkeld. Deze methode maakt gebruik van aanvullende voorspellingen die voortkomen uit de verschillende posities van de spraakprompts binnen de Edit Flow. De prestaties van het model zijn uitgebreid getest op diverse datasets. Zo is EditVoice getraind op 10.000 uur aan data uit GigaSpeech. In tests op LibriSpeech-PC en Seed-TTS Eval EN leverde het model resultaten die concurrerend zijn binnen het vakgebied van zero-shot TTS. De kwaliteit van de bewerkingen is bovendien gevalideerd via de RealEdit-benchmark, zoals uiteengezet in de publicatie op .
Een van de meest veelbelovende aspecten van EditVoice is de generalisatiecapaciteit. Het model kan spraak bewerken die niet afkomstig is uit de oorspronkelijke trainingsset, inclusief audio die door het model zelf is geproduceerd. Dit opent de deur naar end-to-end bewerkingen van spraakfragmenten en de mogelijkheid om gegenereerde audio achteraf te verfijnen zonder dat er opnieuw training nodig is. De volledige details van dit onderzoek zijn sinds 24 september 2026 raadpleegbaar via .
Hoewel EditVoice zich specifiek richt op de synthese en manipulatie van stemmen, past deze technologie in een breder ecosysteem van taalhulpmiddelen. Zo zijn er commerciële diensten zoals google.com, die zich richten op het overbruggen van taalbarrières door middel van simultane vertaling en transcriptie. Waar Google Translate zich concentreert op communicatie tussen verschillende talen, focust EditVoice zich op de technische controle over de vorm en lengte van de gesproken output. Samen illustreren deze ontwikkelingen de snelle evolutie van natuurlijke interacties tussen mens en machine.