← Terug
Bengalese taalvariaties omzeilen veiligheidssystemen van AI-modellen

Bengalese taalvariaties omzeilen veiligheidssystemen van AI-modellen

De veiligheid van grote taalmodellen (LLM's) vertoont aanzienlijke gebreken wanneer zij worden geconfronteerd met verzoeken in het Bengals. Terwijl de meeste veiligheidstesten zich concentreren op de Engelse taal, blijkt uit recent onderzoek dat deze focus een gevaarlijke blinde vlek creëert voor een van de meest gesproken talen ter wereld. Om deze tekortkomingen in kaart te brengen, is de benchmark 'BanglaSafe' ontwikkeld.

Volgens een wetenschappelijke publicatie via arxiv.org bestaat deze nieuwe evaluatiemethode uit een set van 879 Bengalese prompts. Deze verzameling bevat 309 oorspronkelijk geformuleerde teksten en 570 prompts die door experts zijn gevalideerd. Het doel van de benchmark is om te analyseren hoe AI-systemen reageren op schadelijke input die is geworteld in specifieke culturele contexten.

Risico's en culturele nuances

Het onderzoek richtte zich op zeventien verschillende categorieën van potentiële schade. Hierbij werd niet enkel gekeken naar de taal zelf, maar ook naar vijf specifieke condities. Deze condities omvatten variaties in de taal, de gehanteerde schrijfstijl en de wijze waarop autoriteit in de tekst wordt gepresenteerd. De resultaten van de tests, uitgevoerd op 18 geavanceerde taalmodellen, schetsen een zorgwekkend beeld.

Uit de verzamelde data blijkt dat meer dan de helft van alle reacties — specifiek 53,6% — onveilig of gedeeltelijk onveilig was. Nog alarmerender is dat 14,7% van de antwoorden strikt schadelijke inhoud bevatte. Dit wijst erop dat de huidige filters onvoldoende in staat zijn om risicovolle output in het Bengals te blokkeren.

De rol van taalkundige registers

Een opvallende conclusie uit de studie is dat de taalbarrière op zich niet de enige reden is voor het falen van de filters. De grootste impact wordt veroorzaakt door zogenaamde 'register shifts', wat verwijst naar de keuze van de schrijfstijl binnen de taal. In de taalkunde wordt een register.be gedefinieerd als de variatie in taalgebruik afhankelijk van de sociale context of de situatie.

Het onderzoek toont aan dat een schadelijk verzoek dat is vermomd als een formeel journalistiek onderzoek voor een krant, aanzienlijk vaker door de filters glipt. In vergelijking met een informeel bericht is de kans op succes bij een formele stijl maar liefst 17 procentpunten hoger. Opvallend is dat deze resultaten werden behaald zonder dat er gebruik werd gemaakt van complexe manipulatietechnieken of bewuste 'adversarial engineering' om de AI te misleiden.

Falende classificatiesystemen

Naast de kwetsbaarheid van de taalmodellen zelf, kampt de sector met problemen bij de controlemechanismen. De systemen die bedoeld zijn om de output van AI-modellen te classificeren en te filteren, blijken onbetrouwbaar bij het beoordelen van Bengalese content. Zelfs de meest geavanceerde classificatiemodellen faalden in bijna de helft van de geteste gevallen.

De auteurs van de studie, waaronder Sabik Bin Sultan en Naymul Islam, stellen in hun analyse op dat de huidige nadruk op Engelstalige veiligheidstesten AI-systemen kwetsbaar maakt voor misbruik in niet-Westerse contexten. De onderzoekers pleiten daarom voor een inclusievere aanpak van AI-veiligheid, waarbij rekening wordt gehouden met zowel culturele nuances als taalvariaties om wereldwijde risico's te beperken.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!