Wetenschappers hebben een innovatieve methode ontwikkeld waarmee kunstmatige intelligentie in staat is om zelfstandig veiligheidslekken te identificeren en te repareren. Dit nieuwe systeem, dat bekendstaat als Recursive Safety Improvement (ReSI), is ontworpen om AI-modellen niet alleen bestand te maken tegen bekende dreigingen, maar ook veerkrachtig te maken tegen risico's die nog niet eerder zijn vastgesteld.
In een wetenschappelijke publicatie op arxiv.org leggen Jingnan Zheng en een team van twaalf medeauteurs uit hoe dit raamwerk functioneert. De kern van het project draait om het concept van recursieve zelfverbetering. Waar dit voorheen vooral als een theoretische mogelijkheid werd beschouwd, brengt ReSI dit proces naar de praktijk. Dit is cruciaal voor de zogenaamde 'safety alignment', aangezien AI-modellen door continue updates en evolutie constant nieuwe kwetsbaarheden kunnen ontwikkelen.
Volgens de onderzoekers is er een voortdurende strijd tussen de ontwikkeling van modellen en de methoden om deze te omzeilen. Terwijl modellen worden bijgewerkt, worden ook de 'red-teaming' technieken — waarbij men doelbewust probeert onveilige output uit een model te forceren — steeds geavanceerder. Het ReSI-raamwerk probeert dit probleem op te lossen door in te zetten op twee pijlers: resistentie tegen bestaande dreigingen en veerkracht tegen onvoorziene risico's. Meer informatie over de verkenning van deze technologie is te vinden via co.uk.
Het technische proces van ReSI verloopt via geautomatiseerd onderzoek in opeenvolgende rondes. In elke fase worden diverse red-teaming methoden ingezet om zwakke punten in het huidige model bloot te leggen. Zodra een lek is gevonden, genereert het systeem specifieke trainingsrecepten om deze fouten te corrigeren. Om te garanderen dat de algemene intelligentie en prestaties van het model niet achteruitgaan tijdens deze veiligheidsupdates, hanteert het systeem een 'Pareto gate'. Alleen verbeteringen die de veiligheid aanzienlijk verhogen zonder de functionele capaciteiten onaanvaardbaar te beperken, worden overgenomen in de volgende versie van het model.
De effectiviteit van deze aanpak is getest op vier verschillende typen modellen, waaronder 'mixture-of-experts' en 'dense' modellen. Uit de data in de blijkt dat ReSI op diverse veiligheidsbenchmarks vergelijkbare of zelfs betere resultaten behaalt dan toonaangevende frontier-modellen. Dit geldt voor zowel scenario's die al bekend waren als voor volledig nieuwe situaties.
Een specifiek succes van het systeem is zichtbaar bij de zogenaamde 'X-Teaming' aanvallen. Bij de vier geteste modellen zakte de succesrate van deze aanvallen van 86,01% naar 31,45%. Ter referentie scoorde het model GPT-5.6-Luna in deze test 56,69%, wat aantoont dat de recursieve methode van ReSI een superieure bescherming biedt tegen aanvallen die tijdens de initiële training niet waren voorzien. Voor een diepere duik in de implementatie van dit systeem kan men terecht op .
De conclusie van het onderzoeksteam is dat recursieve veiligheidsverbetering een levensvatbare en praktische route is naar AI-systemen die meegroeien met hun eigen technische capaciteiten. Door evaluatie en updates in een cyclus te organiseren, kan de veiligheid van AI-modellen gelijke tred houden met hun toenemende kracht. Het volledige rapport is gecategoriseerd onder Kunstmatige Intelligentie en Cryptografie en Beveiliging op het platform .