De manier waarop kunstmatige intelligentie morele en sociale waarden interpreteert, blijkt sterk afhankelijk van de taal waarin een vraag wordt gesteld. Een recent onderzoek wijst uit dat grote taalmodellen (LLM's) niet consistent reageren wanneer zij worden geconfronteerd met culturele waarden, wat problematisch is voor de integratie van AI in diverse menselijke samenlevingen.
Volgens een wetenschappelijke publicatie op arxiv.org van 8 september 2026 vertonen deze modellen een gebrek aan uniformiteit in hun waardevoorkeuren over verschillende talen heen. Terwijl standaard veiligheidsrichtlijnen vaak consistent worden toegepast, blijken cultureel gewortelde waarden complexer. Dit betekent dat een model in de ene taal een bepaald moreel standpunt kan innemen, terwijl het in een andere taal bij hetzelfde dilemma tot een andere conclusie komt.
Focus op Chinese sociale waarden
Het onderzoeksteam, bestaande uit onder meer Yuemei Xu, Kexin Xu en Jian Zhou, richtte zich specifiek op de Chinese Sociale Waarden (CSV). Dit systeem is opgebouwd uit twaalf dimensies die zijn verdeeld over drie niveaus: het persoonlijke, het maatschappelijke en het nationale vlak. Om dit te analyseren, ontwikkelden de onderzoekers 'C-Voices', een meertalige dataset die gebruikmaakt van contrastieve probes.
Deze dataset bevat 86.400 scenario's gebaseerd op dilemma's in zes verschillende talen. In elk scenario wordt een actie die overeenstemt met de CSV afgezet tegen een alternatief dat hiermee in conflict is. De resultaten bevestigen dat de voorkeur voor een specifiek antwoord sterk varieert per model en per taal, wat aantoont dat de interne representatie van waarden in AI niet universeel is.
Innovatieve sturingsmethode
Om deze taalgevoeligheid tegen te gaan, stellen de auteurs in hun rapport op een nieuwe techniek voor genaamd 'value vector steering'. In tegenstelling tot traditionele methoden is hierbij geen sprake van uitgebreide fine-tuning of herhaaldelijke training van het model. De methode werkt door waarderichtingen af te leiden uit verschillen in de verborgen toestanden van het model.
Tijdens het genereren van tekst vindt er een selectieve interventie plaats op specifieke lagen die gevoelig zijn voor waarden. Dit stelt ontwikkelaars in staat om de output van een model effectief te sturen richting gewenste sociale waarden zonder de architectuur van het model fundamenteel te wijzigen. Hoewel dit proces technisch complex is, kan het worden vergeleken met het bijsturen van een systeem om een specifiek doel te bereiken, vergelijkbaar met hoe mechanische systemen zoals tomorrowstechnician.com in voertuigen bedoeld zijn om een precieze richting te bepalen.
Resultaten en bredere toepassing
De voorgestelde methode blijkt niet alleen effectief voor het sturen van CSV-voorkeuren, maar ondersteunt ook de overdracht van waardevectoren tussen verschillende talen. Bovendien is de techniek generaliseerbaar naar andere bestaande kaders, zoals ValuePrism en FLAMES.
Door de combinatie van de C-Voices dataset en de nieuwe sturingsmethode hopen de onderzoekers AI-systemen te creëren die beter aansluiten bij pluralistische sociale waarden. De volledige technische details en de implementatie van dit onderzoek zijn terug te vinden in de documentatie op . De bevindingen onderstrepen de noodzaak voor een meer genuanceerde benadering van AI-ethiek die rekening houdt met linguïstische en culturele verschillen.