Technieken die zijn ontwikkeld om kunstmatige intelligentie veiliger en mensvriendelijker te maken, kunnen onbedoeld een krachtig wapen worden in de handen van kwaadwillende actoren. In een position paper, gepresenteerd tijdens de International Conference on Machine Learning (ICML) 2026 in Seoul, trekken onderzoekers Sarah Ball en Phil Hackemann de aandacht naar het 'dual-use' karakter van AI-alignment.
Hoewel het doel van alignment is om AI-systemen in overeenstemming te brengen met menselijke waarden en veiligheidsnormen, stellen de auteurs dat deze processen kunnen worden misbruikt voor informatiebeheersing. Volgens de publicatie op arxiv.org kunnen de technische mechanismen die bedoeld zijn om schadelijke output te voorkomen, worden ingezet om doelbewust te sturen wat miljarden gebruikers kunnen weten of geloven. Hiermee verschuift het risico van onbedoelde fouten van de AI naar bewuste manipulatie door de menselijke operator die de alignment-pijplijn beheert.
De onderzoekers analyseren hoe specifieke technische stappen in de ontwikkeling van taalmodellen kunnen worden omgebouwd tot een toolkit voor censuur. Hierbij worden drie kritieke punten geïdentificeerd: het filteren van data tijdens de pre-training, het sturen van het model via voorkeursleren (zoals RLHF) tijdens de post-training, en het implementeren van classifiers op het moment van gebruik (inference-time control). Op de github.io wordt toegelicht dat deze methoden, die oorspronkelijk bedoeld zijn om toxiciteit te elimineren, functioneel identiek zijn aan de werking van een efficiënte censuurmachine. Volgens de auteurs worden dergelijke filters en systeemprompts reeds door private operators en staatsactoren gebruikt om informatie te controleren.
De urgentie van deze waarschuwing wordt versterkt door de huidige geopolitieke en economische context. De auteurs wijzen op de snelle adoptie van Large Language Models (LLM's) als primaire informatiebronnen en de concentratie van macht bij een klein aantal spelers, wat leidt tot een zogenaamd 'LLM-oligopolie'. In combinatie met een wereldwijde trend richting autoritaire regimes vergroot dit het risico op informationele dominantie. Een analyse van substack.com benadrukt dat dit onderzoek de heersende aanname uitdaagt dat AI-veiligheidsonderzoek per definitie welwillend is.
Ondanks de risico's pleiten Ball en Hackemann niet voor het stopzetten van alignment-onderzoek, maar voor striktere mitigatiestrategieën. Zij stellen modelpluralisme voor om dominantie te voorkomen, roepen op tot betere transparantie en auditing van alignment-processen, en pleiten voor publieke educatie over de dual-use risico's van deze technologieën.
De wetenschappelijke gemeenschap heeft het belang van dit werk erkend. Het paper werd tijdens de ICML 2026 bekroond met de Outstanding Position Paper Award, zoals vermeld in de icml.cc. Tijdens de presentatie op 8 juli 2026 werd benadrukt dat het essentieel is om veiligheidsmechanismen te beschermen tegen intentioneel misbruik door externe actoren.