← Terug
Blinde vlekken in AI-veiligheid: onderzoek waarschuwt voor onzichtbare systeemrisico's

Blinde vlekken in AI-veiligheid: onderzoek waarschuwt voor onzichtbare systeemrisico's

De huidige benadering van veiligheid bij kunstmatige intelligentie is volgens recent wetenschappelijk onderzoek te veel gericht op extreme scenario's. Terwijl de publieke en technische discussie vaak draait om catastrofale mislukkingen of dramatisch misbruik, blijven subtiele maar potentieel gevaarlijke systeemfouten vaak onopgemerkt. In de publicatie arxiv.org betogen onderzoekers Gjergji Kasneci en Enkelejda Kasneci dat juist deze 'stille' fouten een grote bedreiging vormen.

De onzichtbare erosie van veiligheid

In tegenstelling tot openlijke haatspraak of systeemcrashes, zijn de risico's waar de auteurs voor waarschuwen vaak verspreid over diverse componenten van een AI-ecosysteem. Het gevaar schuilt erin dat deze fouten binnen bestaande werkprocessen genormaliseerd worden, waardoor ze niet langer als afwijking worden herkend. Volgens de analyse op verschuift de kernvraag hiermee: het gaat niet langer enkel om de vraag of een model een schadelijk antwoord geeft, maar of het volledige socio-technische systeem in staat is om fouten zichtbaar en herstelbaar te houden.

Wanneer fouten onzichtbaar worden, verdwijnt de mogelijkheid voor menselijke interventie. Dit kan leiden tot een sluipende achteruitgang van de veiligheid, vooral in kritieke infrastructuren waar betrouwbaarheid essentieel is.

Een nieuw raamwerk voor integriteit

Om deze verborgen risico's meetbaar te maken, stellen de onderzoekers een diagnostisch model voor dat rust op vijf verschillende lagen van integriteit. Dit raamwerk helpt bij het identificeren van specifieke kwetsbaarheden in een AI-systeem:

  • Epistemische integriteit: De eerlijke weergave van bewijsvoering en onzekerheid, zodat gebruikers een realistisch beeld hebben van de betrouwbaarheid.
  • Controle-integriteit: De robuustheid van machtigingen en actiegrenzen, zeker onder druk van optimalisatie of externe aanvallen.
  • Temporele integriteit: Het waarborgen van de veiligheid over langere tijd, inclusief updates en de natuurlijke drift van het model tijdens gebruik.
  • Organisationele integriteit: Het vermogen van instellingen om effectief toezicht te houden, audits uit te voeren en verantwoordelijkheden toe te wijzen.
  • Ecosysteem-integriteit: De bescherming van de bredere informatieomgeving tegen aantasting door AI-systemen.

Onderbelichte risicopatronen

Binnen deze lagen identificeren Kasneci en Kasneci diverse patronen die momenteel onvoldoende aandacht krijgen. Een voorbeeld hiervan is het maskeren van onzekerheid in retrieval-processen om een antwoord legitiem te laten lijken. Daarnaast wijzen zij op technische risico's zoals memory poisoning, reward hacking en prompt injection.

Een bijzonder zorgwekkend fenomeen is wat de auteurs "fictional human oversight" noemen: een situatie waarin menselijk toezicht slechts een administratieve formaliteit is zonder werkelijke invloed op de uitkomst. Ook waarschuwen zij voor de vervuiling van informatiebronnen door synthetische data. Dit kan leiden tot model collapse, waarbij toekomstige AI-modellen degraderen omdat ze getraind worden op foutieve, door AI gegenereerde data in plaats van op authentieke menselijke input.

Focus op socio-technische betrouwbaarheid

De conclusie van het onderzoek, dat is ingediend onder de categorie , is dat de huidige evaluatiemethoden te model-centrisch zijn. De auteurs pleiten voor een transitie naar "socio-technische betrouwbaarheid". Dit houdt in dat niet alleen de code en de parameters van het model worden getest, maar het gehele proces inclusief de menselijke interactie en het institutionele toezicht.

Door deze verborgen risico's expliciet in kaart te brengen en te instrumenteren, hopen de onderzoekers een basis te leggen voor systemen die niet alleen minder vaak spectaculair falen, maar die in hun dagelijkse, onzichtbare werking fundamenteel veiliger zijn. Volgens de auteurs van is deze integrale aanpak noodzakelijk om de lange-termijnstabiliteit van AI-implementaties te garanderen.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!