Een team van wetenschappers, onder leiding van Zixun Guo, heeft een nieuwe technologische benadering ontwikkeld voor het automatisch optimaliseren van de ruimtelijke parameters in muziekopnames. Het systeem, dat de naam SPHERE draagt, richt zich op het proces van 'upmixing', waarbij het model moet bepalen welke mixinstellingen het meest effectief zijn voor opnames die zijn opgebouwd uit diverse afzonderlijke audiosporen.
In tegenstelling tot oudere methoden, die vaak vertrouwden op specifiek voor muziek ontwikkelde encoders, maakt dit nieuwe framework gebruik van audio-taalmodellen (ALM). Volgens een publicatie op arxiv.org stelt deze keuze het systeem in staat om gebruik te maken van uitgebreide representaties. Deze modellen combineren zowel de semantische betekenis van de muziek als bestaande technische kennis over het mixproces, wat leidt tot een meer intuïtieve benadering van audiobewerking.
Om de prestaties van het model te verbeteren, hebben de auteurs een specifiek traject van post-training geïmplementeerd. Dit proces start met rejection sampling SFT (Supervised Fine-Tuning) en wordt vervolgens verder verfijnd via versterkingsleren (Reinforcement Learning). Hierbij wordt gebruikgemaakt van de GRPO-techniek om verifieerbare beloningen toe te kennen aan het model, waardoor de output nauwkeuriger wordt afgestemd op de gewenste resultaten.
Het centrale element van deze innovatie is de introductie van Sphere, wat staat voor Spatial Heuristic Rewards. Dit betreft een deterministische verzameling beloningen die zijn gebaseerd op algemeen erkende conventies binnen de professionele muziekmixage. Het doel is om de AI te sturen richting resultaten die aansluiten bij de menselijke perceptie van een kwalitatieve mix. Het framework hanteert zes verschillende sub-beloningen om te waarborgen dat de uiteindelijke mix voldoet aan drie essentiële criteria: een correcte centrering, een gebalanceerde verhouding tussen de elementen en een passende mate van ruimtelijkheid in het geluidsbeeld. In de context van dit onderzoek wordt de term 'sphere' dus gebruikt als een afkorting voor deze beloningsstructuur, terwijl de term in een puur wiskundige context, zoals beschreven door mathmonks.com, verwijst naar de geometrische eigenschappen van een bol.
De implicaties van dit onderzoek reiken verder dan enkel de audiosector. De resultaten tonen aan dat domeinspecifieke expertise, zoals de technische regels van muziekproductie, kan worden omgezet in verifieerbare beloningen voor AI. Deze kennis kan vervolgens in taalmodellen worden gedistilleerd zonder dat er complexe, taakspecifieke architecturen nodig zijn. Dit suggereert dat soortgelijke methodieken ook in andere vakgebieden kunnen worden toegepast, mits de expertkennis kan worden geformaliseerd in een set regels voor training.
Het project is ingediend voor de conferentie EMNLP 2026 en markeert een belangrijke verschuiving in de training van AI voor creatieve en technische audio-taken. Door menselijke standaarden direct in het beloningsmechanisme te integreren, ontstaat er een efficiënter alternatief voor het handmatig ontwikkelen van gespecialiseerde audio-encoders, zoals verder uiteengezet in de documentatie op . De benadering van biedt hiermee een nieuwe weg naar automatisering in de muziekproductie die minder afhankelijk is van rigide, vooraf gedefinieerde systemen.