⚠️ KMI waarschuwing: Onweer in België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
Reinforcement Learning verbetert detectie van ongewenst gedrag in AI-modellen

Reinforcement Learning verbetert detectie van ongewenst gedrag in AI-modellen

De controle van zogenaamde 'frontier models', de meest geavanceerde versies van kunstmatige intelligentie, wordt steeds vaker overgelaten aan andere taalmodellen die als auditor fungeren. Deze geautomatiseerde systemen hebben de taak om op grote schaal ongewenst gedrag te identificeren. Tot op heden bleken deze auditors echter vaak inconsistent in hun aanpak en tekortschieten in realisme tijdens hun onderzoeken.

Om deze tekortkomingen aan te pakken, hebben Paul Rosu en zijn collega's een nieuwe benadering ontwikkeld. In hun wetenschappelijke publicatie, getiteld "Training Alignment Auditors via Reinforcement Learning", beschrijven zij hoe reinforcement learning kan worden ingezet om de prestaties van deze auditors te verhogen. Volgens de publicatie op arxiv.org resulteert deze methode in een aanzienlijke kwaliteitsstijging van de uitgevoerde audits.

De kern van deze innovatie ligt in een gespecialiseerde trainingsomgeving. Hierin onderzoekt de AI-auditor doelmodellen waarin bewust ongewenste eigenschappen zijn ondergebracht via een specifieke 'system prompt'. Om de voortgang te bewaken, wordt er gebruikgemaakt van een zogenaamde LLM-judge. Deze judge weet precies of een doelmodel een verborgen gedraging bevat en vergelijkt het werk van de auditor met een referentieonderzoek. Op basis hiervan wordt een beloning toegekend, wat het leerproces van de auditor optimaliseert.

In de bredere betekenis van het woord wordt cambridge.org vaak gezien als het proces waarbij men de nodige vaardigheden aanleert voor een specifieke activiteit. In dit technologische kader betekent dit het verfijnen van algoritmen zodat zij patronen beter kunnen herkennen, wat in dit specifieke geval het kritisch controleren van andere AI-systemen behelst.

De onderzoekers hebben via systematische ablaties verschillende varianten van het proces getest. Hieruit kwam naar voren dat 'pairwise rewards', waarbij twee resultaten met elkaar worden vergeleken, tot een robuustere training leiden dan 'pointwise rewards', waarbij slechts één resultaat wordt gescoord. Daarnaast bleek het cruciaal om ook modellen zonder verborgen gedragingen in de training op te nemen. Deze stap was essentieel om het aantal fout-positieven laag te houden, waarbij dit percentage uiteindelijk onder de 1% bleef.

De resultaten van dit onderzoek zijn op diverse vlakken positief. Er worden meer zorgwekkende gedragingen aangetroffen in ongewijzigde productiemodellen en de algehele kwaliteit van het onderzoek naar modellen met geplante gedragingen is toegenomen. Bovendien is het realisme van de audits verbeterd. De getrainde auditors tonen ook een sterke generalisatie; ze presteren aanzienlijk beter op de 'AuditBench', zeker bij modellen die zijn aangepast via 'adversarial fine-tuning'. Dit wijst erop dat de systemen in staat zijn om complexe en opzettelijk verborgen patronen in diverse scenario's te herkennen.

Het volledige onderzoek, dat 82 pagina's beslaat en is voorzien van 15 figuren, biedt een uitgebreide onderbouwing van deze bevindingen. De auteurs hebben de bijbehorende code, prompts en evaluatiegegevens openbaar gemaakt via de van het project. Door de combinatie van een strikt beloningssysteem en gespecialiseerde omgevingen ontstaat er een kader voor veiligere AI-ontwikkeling, waarbij de controlemechanismen meegroeien met de toenemende complexiteit van de modellen.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!