Een team van onderzoekers, onder leiding van Yi-Chang Chen, heeft TASTE2 ontwikkeld om de interactie tussen mens en machine vloeiender te maken. Het model is specifiek ontworpen voor zogenaamde 'full-duplex' spraakinteractie, waarbij de nadruk ligt op het verwerken van streaming audio en het natuurlijk wisselen van spreker, in plaats van het traditionele systeem dat werkt met volledige zinnen.
Technische architectuur en werking
TASTE2 is een evolutie van het eerdere TASTE-model (Text-Aligned Speech Tokenization and Embedding) en is getransformeerd tot een incrementele dialoogstack. Volgens een arxiv.org maakt het systeem gebruik van een gedeelde tekst-token woordenschat. Deze aanpak voorkomt dat er berekeningen op basis van gemiddelden op woordniveau worden uitgevoerd, wat de precisie van de interactie verhoogt.
Een essentieel onderdeel van de opbouw is de modality-aligned dialoogtraining. Hierbij wordt per tekst-token één continue audio-latent voorspeld, waardoor verschillende token-stromen niet door elkaar lopen. Om de data weer om te zetten naar hoorbare spraak, combineert het systeem een incrementele 'Speech Detokenizer' met CosyVoice2, wat streaming synthese mogelijk maakt.
Analyse van de prestaties
Om de nauwkeurigheid van TASTE2 te bepalen, is het model vergeleken met tekstgebaseerde referentiemodellen. Uit de blijkt dat de variant TASTE2 (Merge) een score van 56,3% behaalde op LLaMA-Questions. Ter vergelijking behaalde de tekst-only referentie van Qwen2.5-7B Instruct een score van 57,3%, wat betekent dat TASTE2 98,2% van de nauwkeurigheid van het tekstmodel behield. De variant TASTE2 (Direct) scoorde 53,0%, wat neerkomt op een behoud van 92,4% van de nauwkeurigheid.
Praktische toepassing en de VoiceBot
De theoretische resultaten zijn in de praktijk getest met de TASTE2 VoiceBot. Deze bot kan gebruikersspraak incrementeel verwerken en audio streamen. Een belangrijk kenmerk is de 'barge-in' functionaliteit, waardoor de bot direct stopt met spreken zodra een gebruiker het gesprek onderbreekt.
Tests op de Full-Duplex-Bench v1.0 tonen aan dat zowel het model als de bot effectief omgaan met onderbrekingen zonder dat de coherentie van het gesprek verloren gaat. Er blijven echter uitdagingen bestaan op het gebied van snelheid. Wanneer het systeem wordt aangestuurd door twee NVIDIA RTX A6000 kaarten met TensorRT-acceleratie, bedroeg de gemiddelde tijd tot de eerste audio-output 2,701 seconden, wat wijst op een merkbare latentie.
Controle over spraakeigenschappen
Het onderzoek richt zich daarnaast op paralinguïstische controle, oftewel de niet-tekstuele aspecten van spraak zoals spreeksnelheid en emotie. In de wordt beschreven dat een versnelde spreeksnelheid dient als bewijs voor verschillende strategieën na dialoog-SFT. De controle over emoties bleek echter sterker afhankelijk van de gekozen strategie, terwijl andere eigenschappen nog minder goed presteren.
Hoewel commerciële tools zoals google.com al uitgebreide mogelijkheden bieden voor spraakvertaling in talloze talen, richt TASTE2 zich specifiek op de technische architectuur van de interactie. Het doel is om de kloof tussen menselijke gesprekken en machinale interactie te dichten. De resultaten tonen aan dat TASTE-gebaseerde modellering een levensvatbaar pad is naar full-duplex systemen, hoewel de snelheid van generatie en de robuustheid in natuurlijke gesprekken nog verder verbeterd moeten worden.