Onderzoekers hebben een nieuw AI-model ontwikkeld dat spraak, muziek, geluidseffecten en zang in één enkel systeem kan genereren en combineren tot coherente audiobedden. Het model, genaamd SonicWeave, werd op 10 augustus 2026 gepresenteerd op arXiv en maakt gebruik van een zogenaamd chunk-routed mixture-of-experts-systeem.
Eén model voor alle audiocomponenten
Waar tekstgestuurde audiogeneratie zich tot nu toe vooral richtte op afzonderlijke domeinen zoals spraak, muziek of geluidseffecten, wil SonicWeave deze componenten in één model verenigen. Volgens de arxiv.org kunnen gebruikers met één set gewichten spraak, muziek, geluidseffecten, zang en fijnmazige mengvormen daarvan genereren.
De uitdaging bij zo'n uniform systeem is dat heterogene componenten tegenstrijdige structurele eisen stellen aan een gedeelde backbone. Daarnaast kan een complex gemengd tafereel lokaal verschillende of overlappende inhoud bevatten die fijnmazige aanpassingen binnen hetzelfde clip vereist.
Nieuwe routeringsmechanisme
Bestaande audio-mixture-of-experts-modellen (MoE's) routeren voornamelijk op domeinniveau, terwijl token-gewijze routering voorbijgaat aan de lokale continuïteit die eigen is aan akoestische signalen. SonicWeave introduceert daarom een chunk-routed MoE met een conflict-gated prior-evidence routing mechanisme, afgekort CPE-MoE.
Dit mechanisme routeert aaneengesloten audioblokken door een globale prior – die de gestructureerde tekstconditie en diffusiefase codeert – te combineren met lokale evidentie uit de evoluerende akoestische toestand. Een aangeleerde conflictpoort geeft voorrang aan de prior wanneer lokale toestanden onbetrouwbaar zijn, terwijl lokale evidentie de routering kan beïnvloeden wanneer een regio afwijkt van de globale scenecontext.
Betere prestaties op benchmarks
Het onderzoeksteam, bestaande uit onderzoekers van onder meer de Chinese Universiteit van Hongkong, testte SonicWeave op verschillende benchmarks voor tekst-naar-spraak (TTS), tekst-naar-audio (TTA) en tekst-naar-muziek (TTM). Het model presteert volgens de onderzoekers consistent beter dan gecontroleerde Dense- en Base-MoE-baselines.
Bij evaluaties van complexe scènes toonde SonicWeave bovendien verbeterde compositorische kwaliteit. Routeringsanalyses onthulden inhoudafhankelijke expertspecialisatie tijdens verschillende diffusiefasen. De onderzoekers concluderen dat temporeel coherente prior-evidentie-routering een effectieve conditionele-computatiestrategie is voor uniforme audiogeneratie.
Context: bredere ontwikkeling in audiogeneratie
SonicWeave past in een bredere trend binnen de AI-gemeenschap om audiogeneratie te verenigen en te verrijken. Zo introduceerden onderzoekers eerder UniVerse-1, een model dat gecoördineerde audio en video kan genereren door bestaande experts aan elkaar te koppelen, een techniek die "stitching of experts" wordt genoemd. Dit model werd in september 2025 gepresenteerd en combineert voorgetrainde video- en muziekgeneratiemodellen.
Daarnaast richt onderzoek zich ook op ruimtelijke audio. Het arxiv.org genereert bijvoorbeeld ruimtelijke audio voor immersieve 4D-scènes door geluidsbronnen in dynamische 3D-omgevingen te lokaliseren en te volgen. En in het International Journal of Computer Vision verscheen in maart 2026 een artikel over springer.com, waarin eerste-orde ambisonics – een veelgebruikt ruimtelijk audioformaat – direct uit stille video's wordt gegenereerd.
Efficiëntie blijft aandachtspunt
De efficiëntie van mixture-of-experts-modellen blijft een belangrijk onderzoeksthema. NVIDIA publiceerde in februari 2026 een nvidia.com, een communicatiebibliotheek die de all-to-all-communicatie in grootschalige MoE-modellen optimaliseert. Het systeem behaalde volgens NVIDIA tot 514 procent doorvoerverbeteringen ten opzichte van eerdere benaderingen in modellen zoals DeepSeek-V3 en Qwen 3 235B.
SonicWeave is beschikbaar via een projectpagina, waar ook de code en verdere documentatie te vinden zijn. Het onderzoek is ingediend bij arXiv onder het nummer 2608.09571 en wacht nog op formele publicatie in een peer-reviewed tijdschrift.