Wetenschappers hebben een doorbraak gerealiseerd waarbij geavanceerde AI-modellen niet langer enkel als assistent fungeren, maar als architecten van volledig autonome systemen. In een recent onderzoek is aangetoond dat deze modellen in staat zijn om spelers te programmeren die complexe strategische games winnen, waarbij de AI de volledige architectuur en strategie zelfstandig ontwikkelt zonder menselijke tussenkomst of ondersteuning tijdens het spelen.
In de publicatie arxiv.org leggen onderzoekers, waaronder Haonan Huang en Joey Xiao, uit hoe frontier-modellen voor het coderen winnende spelers kunnen creëren met minimale interactie. De methode draait om het concept van 'gecompileerde agency'. Hierbij krijgt een AI-agent een beschrijving van een game en een interface voor acties en observaties, maar geen vooraf gedefinieerde algoritmen of strategieën. De ervaring van het model wordt vervolgens omgezet in een permanent, uitvoerbaar programma.
Om deze capaciteiten objectief te meten, hebben de onderzoekers het 'Gauntlet'-framework ontwikkeld. Dit systeem hanteert een strikt proces van ontwikkeling, bevriezing en evaluatie. De AI-agent start met een leeg beleidsbestand en moet in één autonome sessie experimenteren om een zelfstandige controller te ontwerpen. Een essentieel onderdeel van dit proces is de 'bevriezing' van het programma. Tijdens de evaluatiefase is het verboden om opnieuw een taalmodel aan te roepen; de controller moet volledig op eigen kracht presteren in nieuwe scenario's.
De resultaten van dit onderzoek variëren van eenvoudige arcade-titels tot grootschalige commerciële games. Bij een niet-gepubliceerde procedurele roguelike game schommelde het succes op nieuwe instanties tussen de 0 en 86 procent. Volgens de was er een duidelijke generatiekloof zichtbaar, waarbij elke nieuwe generatie systemen beter presteerde dan de beste sessie van de voorgaande generatie.
De meest indrukwekkende prestaties werden behaald in strategische genres. In StarCraft II wist een door AI gebouwde controller alle standaard ingebouwde tegenstanders te verslaan, inclusief varianten die vals speelden. Ook in Freeciv (een variant van Civilization) slaagden programma's die in een enkele sessie waren geschreven erin om volledige games te winnen via totale verovering, zelfs bij onbekende startposities. Voor wie geïnteresseerd is in de technische implementatie van dergelijke systemen op Windows, biedt gamers.org relevante context over game-omgevingen.
Volgens de auteurs van het artikel op vormt dit een belangrijke mijlpaal. Voorheen hadden taal-agenten moeite om theoretische kennis over een spel om te zetten in daadwerkelijke competentie, zeker zonder handmatige tactische lagen. Het feit dat deze bevroren programma's winnen in genres die lange-termijnplanning vereisen, suggereert dat moderne codeeragenten complexe strategieën kunnen vertalen naar functionele code.
Omdat de resulterende programma's inspecteerbaar zijn, kunnen onderzoekers precies analyseren hoe de AI de logica van het spel heeft geïnternaliseerd. Hoewel de winstpercentages tegenover beginnende AI-tegenstanders nog bescheiden zijn, markeert dit een fundamentele verschuiving. De AI is niet langer een adviseur die tijdens het proces tips geeft, maar een ontwikkelaar die een onafhankelijk en functionerend systeem bouwt. Meer technische details over de methodiek zijn beschikbaar via de .