NemotronLabs heeft een nieuw open-source AI-model gepresenteerd genaamd VoiceChat, dat specifiek is ontworpen voor natuurlijke, gelijktijdige spraakinteractie. In tegenstelling tot traditionele systemen die wachten tot een gebruiker klaar is met spreken, kan dit model simultaan luisteren en reageren. Volgens een arxiv.org functioneert VoiceChat als een zogenaamd "open full-duplex speech-to-speech model".
Een kenmerkend aspect van VoiceChat is de integratie van native mogelijkheden om externe tools aan te roepen. Dit stelt de AI in staat om tijdens een lopend gesprek acties uit te voeren of specifieke functies te activeren, wat de praktische inzetbaarheid van de assistent vergroot. De technische basis van het systeem rust op een streaming spraak-encoder in combinatie met een taalmodel dat volledig op decoders is gebaseerd. Om de interactie vloeiend te houden, maakt het model gebruik van parallelle outputstromen voor zowel de tekst van de agent als voor gestructureerde functie-aanroepen.
Om de transcriptie van de gebruiker incrementeel te verwerken, is er een hulpvertakking in de vorm van een Recurrent Neural Network Transducer (RNN-T) toegevoegd. De uiteindelijke audio-output wordt verzorgd door een streaming Text-to-Speech (TTS) decoder. Deze architectuur stelt het systeem in staat om gelijktijdig te luisteren, te redeneren en te spreken, waarbij het natuurlijke ritme van een menselijk gesprek behouden blijft. De details over deze implementatie en de bijdragen van onderzoekers zoals Travis Bartley en Jagadeesh Balam zijn terug te vinden in de .
De prestaties van VoiceChat zijn getest via de "Full-Duplex-Bench 1.0". Uit deze evaluaties komt naar voren dat het model superieur is in het hanteren van stiltes. Het behaalt namelijk de laagste "pause-handling takeover rates" van alle geteste systemen, wat betekent dat de AI minder snel onbedoeld het woord overneemt tijdens een natuurlijke pauze in het gesprek.
De lancering van VoiceChat past in een bredere industrietrend naar multimodale AI-systemen, waarbij audio, tekst en beeld naadloos worden geïntegreerd. Terwijl NemotronLabs kiest voor een open benadering van spraak-naar-spraak interactie, ontwikkelt Google DeepMind soortgelijke geavanceerde technologieën. Zo richt Google zich met de deepmind.google op het creëren van intelligente agenten die via audio en andere media kunnen communiceren en systemen kunnen aansturen.
Het vermogen om tools aan te roepen is in deze context een cruciale ontwikkeling. Het transformeert een spraakmodel van een passieve informatiebron naar een actieve assistent die taken kan uitvoeren. Door de architectuur van VoiceChat open te stellen, biedt NemotronLabs de wetenschappelijke gemeenschap een instrument om de complexiteit van full-duplex communicatie verder te onderzoeken. Meer informatie over de technische specificaties is beschikbaar via de , terwijl de visie op omnimodellen verder wordt uitgewerkt in de .