← Terug
AI worstelt met detectie van onzekerheid in stem van bedrijfstop

AI worstelt met detectie van onzekerheid in stem van bedrijfstop

In de financiële sector vormen 'earnings calls' — de gesprekken waarin directieleden hun resultaten toelichten aan analisten — een essentiële informatiebron. Hoewel systemen voor het detecteren van ontwijkend gedrag voorheen hoofdzakelijk vertrouwden op tekstuele transcripten, wijst recent onderzoek uit dat ontwijking in gesproken communicatie een complex en multidimensionaal proces is. De manier waarop een boodschap wordt overgebracht, kan namelijk cruciale informatie bevatten die niet uit de letterlijke woorden alleen naar voren komt.

Om dit fenomeen beter in kaart te brengen, hebben Mirae Kim, Seonghun Jeong en Youngjun Kwak van het Financial Tech Lab bij KakaoBank Corp de benchmark 'DualEvasion' ontwikkeld. Volgens de publicatie arxiv.org bestaat deze dataset uit 505 geannoteerde vraag-antwoordparen, afkomstig uit 60 verschillende earnings calls. Bij DualEvasion wordt er specifiek gekeken naar twee onafhankelijke labels: de tekstuele ontwijking (of een antwoord direct of ontwijkend is) en de vocale signalen (of de spreker zelfverzekerd of onzeker klinkt).

De resultaten van de experimenten tonen aan dat moderne multimodale AI-modellen aanzienlijke moeite hebben met het correct identificeren van vocale onzekerheid. Dit is vooral zichtbaar bij antwoorden die door mensen als onzeker zijn gelabeld. De onderzoekers stellen in hun arxiv.org dat deze modellen akoestische signalen vaak geïsoleerd beoordelen. Ze slagen er onvoldoende in om deze signalen te relateren aan de persoonlijke basislijn van de specifieke spreker. Hoewel het gebruik van referentiekaders op sprekerniveau enige verbetering opleverde, blijft er een aanzienlijk prestatieverschil bestaan tussen kunstmatige intelligentie en menselijke interpretatie.

De focus op manageriaal ontwijkend gedrag is onderdeel van een bredere trend binnen de financiële Natural Language Processing (NLP). Een ander relevant project is arxiv.org, dat zich richt op het creëren van een taxonomie voor ontwijking. Hierbij wordt een onderscheid gemaakt tussen directe, intermediaire en volledig ontwijkende antwoorden. Om bias te minimaliseren en de nauwkeurigheid van de annotaties te verhogen, maakt dit project gebruik van een consensus-aanpak met meerdere Large Language Models (LLM's).

De complexiteit van vocale analyse wordt verder onderstreept door biologische factoren. Een trillende stem is namelijk niet altijd een psychologisch signaal van nervositeit of een bewuste poging tot ontwijking. In een studie gepubliceerd in springer.com wordt beschreven hoe veroudering leidt tot structurele en functionele veranderingen in de stembanden. Dit kan resulteren in presbyfonie, wat zich uit als een zwakke of trillende stem. In dit onderzoek, waarbij 291 sprekers tussen de 18 en 94 jaar werden geanalyseerd, werd digitale signaalverwerking gebruikt om tremor in de fundamentele frequentie en amplitude te kwantificeren.

Deze medische context benadrukt de uitdaging voor AI-modellen: een stemtrilling kan een biologisch gevolg van ouderdom zijn, terwijl een model dit wellicht interpreteert als een teken van onzekerheid. De conclusie van het DualEvasion-onderzoek is dat het enkel analyseren van audiofragmenten onvoldoende is om de mentale staat van een spreker vast te stellen. Voor een accurate analyse van zakelijke communicatie is een integratie van tekstuele data, audio-analyse en individuele referentiekaders noodzakelijk.

Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!