⚠️ KMI waarschuwing: Onweer in België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
Nieuwe methode versterkt veiligheid van taalmodellen via 'veiligheidscircuits'

Nieuwe methode versterkt veiligheid van taalmodellen via 'veiligheidscircuits'

Onderzoekers hebben een nieuwe techniek ontwikkeld om Large Language Models (LLM's) beter bestand te maken tegen kwaadaardige prompts door specifiek in te grijpen op de interne mechanismen die weigergedrag aansturen.

Ondanks uitgebreide inspanningen om kunstmatige intelligentie veiliger te maken, blijven grote taalmodellen kwetsbaar voor zogenaamde adversarial prompting. Dit zijn specifieke aanvalstechnieken waarbij gebruikers proberen de veiligheidsfilters van een model te omzeilen om onveilige of schadelijke content te genereren. In een recent onderzoek, dat is ingediend bij arxiv.org, werpen wetenschappers een nieuw licht op hoe deze modellen intern beslissen om een verzoek te weigeren.

De anatomie van weigergedrag

De onderzoekers, waaronder Kuan-Lin Chu, Chung-En Sun en Tsui-Wei Weng, hebben de veiligheid van LLM's bestudeerd vanuit het perspectief van mechanistische interpreteerbaarheid. Hierbij is een zogenaamd 'veiligheidscircuit' geïdentificeerd dat het weigergedrag van het model organiseert. Volgens de bestaat dit circuit uit drie cruciale fasen:

  1. Harmful Detection Heads: Deze componenten reageren op schadelijke input en detecteren de potentieel gevaarlijke aard van een vraag.
  2. Safety Neurons: Deze neuronen fungeren als bemiddelaars en stabiliseren de veiligheidssignalen binnen de zogenaamde residual stream van het model.
  3. Refusal Heads: Deze laatste fase vertaalt de verzamelde signalen naar de uiteindelijke generatie van een veilig antwoord (de weigering).

Door middel van gerichte interventies op het niveau van neuronen en attention-heads konden de onderzoekers aantonen dat dit circuit causaal verbonden is. Wanneer de upstream 'Harmful Detection Heads' worden onderdrukt, wordt het vermogen van het model om downstream te weigeren direct verstoord.

Resultaten en implementatie

De onderzoekers testten hun theorie met een methode genaamd circuit-guided weight scaling. Dit is een eenvoudige manier om de gewichten van het model aan te passen zonder de architectuur te veranderen, waardoor de functionele relevantie van het veiligheidscircuit kan worden getest.

De resultaten van deze methode zijn veelbelovend. Uit de blijkt dat deze aanpak over zes verschillende LLM's werd getest. De veiligheidsscores onder invloed van aanvallen verbeterden met gemiddeld 26,5%. Een belangrijk aspect hierbij is dat de algemene prestaties van de modellen nauwelijks achteruitgingen; er was slechts een daling van 1,7% in nauwkeurigheid te zien over vier standaard benchmarks.

Wetenschappelijke erkenning

Het onderzoek toont aan dat de decompositie van het veiligheidscircuit consistent is over verschillende modelarchitecturen en diverse aanvalsscenario's. Dit suggereert dat er stabiele en overdraagbare patronen bestaan die ten grondslag liggen aan het 'aligned' gedrag van AI-modellen.

Het werk is inmiddels geaccepteerd voor de , een prestigieuze conferentie op het gebied van natuurlijke taalverwerking. Hiermee krijgt de mechanistische benadering van AI-veiligheid een breder wetenschappelijk platform.

Door inzichtelijk te maken hoe detectie wordt omgezet in weigering, biedt dit onderzoek een fundament voor het bouwen van robuustere AI-systemen die minder vatbaar zijn voor manipulatie door kwaadwillende gebruikers.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!