De toegang tot geavanceerde spraaktechnologie is wereldwijd nog steeds ongelijk verdeeld. Veel huidige modellen die gesproken instructies verwerken, zijn namelijk geoptimaliseerd voor een beperkt aantal talen waarvoor veel data beschikbaar is. Dit komt door een tekort aan specifieke meertalige datasets die nodig zijn voor de zogenaamde instructie-tuning van spraakmodellen.
Om deze digitale kloof te overbruggen, hebben Tolúlopé Ògúnrèmí en een team van onderzoekers MULTISPEECHQA ontwikkeld. Deze omvangrijke dataset bevat 10,8 miljoen paren van gesproken vragen en antwoorden, wat neerkomt op een totaal van 9.200 uur aan audio. De dataset bestrijkt 23 talen die typologisch sterk van elkaar verschillen. Volgens de publicatie arxiv.org is de data op een innovatieve wijze samengesteld: er is gebruikgemaakt van synthetisch gegenereerde data die vervolgens door mensen is gecontroleerd om de kwaliteit te garanderen. Het gebruik van dergelijke hoogwaardige synthetische sets wordt in het onderzoek gepresenteerd als een kostenefficiënte methode om de meertalige capaciteiten van modellen te vergroten.
Naast de dataset hebben de wetenschappers ook MULTISPEECH-BENCH geïntroduceerd. Dit is een benchmark die specifiek is ontworpen om de prestaties van Speech Language Models (SLM's) in de 23 ondersteunde talen te toetsen. In het kader van dit onderzoek is de effectiviteit van een 'cascading system' vergeleken met zowel closed-source als open-weight modellen. Uit de resultaten blijkt dat het cascading system superieur is aan de open-weight varianten, hoewel het niet elk closed-source model wist te verslaan. Een concreet succesverhaal is de verbetering van het model Qwen 2.5-Omni; door dit model te finetunen met de MULTISPEECHQA-dataset, werd een meetbare stijging in de prestaties op de benchmark vastgesteld. Zoals beschreven in de artikelen op , helpt deze aanpak om modellen te creëren die ook talen begrijpen die structureel afwijken van de dominante digitale talen.
Het onderzoek, dat werd gepresenteerd tijdens Interspeech 2026, telt experts zoals Chris Manning en Dan Jurafsky. De focus ligt hierbij op het verbeteren van de mens-machine interactie voor een breder publiek. De auteurs suggereren dat de afhankelijkheid van handmatig verzamelde spraakdata kan worden verminderd door de strategische inzet van synthetische generatie, mits er strikte menselijke verificatie plaatsvindt.
Interessant is dat de term 'turning', die in de titel van het onderzoek wordt gebruikt om de transformatie van modellen naar meertalige luisteraars aan te duiden, in andere technische vakgebieden een totaal andere betekenis heeft. In de wereld van de werktuigbouwkunde is 'turning' namelijk een specifiek subtractief productieproces. Volgens discoverengineering.org wordt bij dit proces een roterend werkstuk bewerkt met een snijtool om cilindrische vormen te creëren. Deze terminologische overlap benadrukt het contrast tussen de abstracte wereld van de computationele taalkunde en de fysieke processen in de engineering, zoals verder uitgediept op .
De resultaten van dit project openen de weg naar een toekomst waarin spraakgestuurde AI toegankelijk wordt voor een veel grotere groep mensen, ongeacht de taal die zij spreken of de hoeveelheid digitale data die voor hun taal beschikbaar is.