⚠️ KMI waarschuwing: Onweer in België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
Ouroboros: Zelfontwikkelende AI-agent verbetert eigen code en stelt nieuwe records op Terminal-Bench

Ouroboros: Zelfontwikkelende AI-agent verbetert eigen code en stelt nieuwe records op Terminal-Bench

Een nieuw onderzoekspaper dat op 8 augustus 2026 op arXiv verscheen, beschrijft een AI-systeem dat zijn eigen kerncode kan herschrijven en verbeteren. Het systeem, genaamd Ouroboros, behaalt volgens de onderzoekers de hoogste scores ooit op twee belangrijke benchmarks voor AI-agenten.

Zelfverbetering door middel van beoordeelde wijzigingen

Het team achter Ouroboros, bestaande uit Anton Razzhigaev en vijf collega-onderzoekers, presenteert in hun paper een "zelfontwikkelende agent-harness" waarbij tools, prompts, contextopbouw en de kernimplementatie worden verbeterd via beoordeelde commits die vervolgens de runtime vormen voor later werk. Dit betekent dat het systeem niet alleen leert van externe feedback, maar actief zijn eigen broncode aanpast en die aanpassingen gebruikt voor toekomstige taken.

Volgens de arxiv.org kent de kernevolutie twee modi. In de eerste modus, "recursieve vrije evolutie", is verbetering zelf een taak: het voltooien van één evolutiecyclus kan de volgende inplannen. In de tweede modus, "ervaringsgedreven kernevolutie", leiden gewone werkzaamheden en sociale interacties tot het blootleggen van bugs, ruwe randjes en inefficiënte contextopbouw, wat vervolgens leidt tot beoordeelde structurele wijzigingen.

Recordprestaties op benchmarks

De onderzoekers melden indrukwekkende resultaten op drie verschillende benchmarks. Op Terminal-Bench 2.1 behaalt een Opus 5-run een score van 86,74 procent, wat volgens het paper het beste gerapporteerde resultaat op deze benchmark is. Op OSWorld-Verified bereikt een Opus 5-run 90,69 procent, waarmee het eerder gerapporteerde beste resultaat wordt overtroffen. Een vijf-rollout CL-Bench-campagne behaalt een genormaliseerde beloning van 0,2301, wat een nieuw state-of-the-art resultaat oplevert.

Langlopend levend experiment

Een opvallend onderdeel van het onderzoek is "Hope", beschreven als de langstlopende publiekelijk gedocumenteerde Ouroboros-implementatie. Het betreft een 161-dagen durend levend agent-experiment in vrije evolutie onder begeleide menselijke communicatie over zeven verschillende oppervlakken. Menselijke interactie brengt volgens de onderzoekers fouten en voorstellen aan het licht, maar de agent beslist zelf welke wijzigingen hij doorvoert.

Veiligheidsvraagstukken

De onderzoekers benadrukken dat operationele veiligheid een primair ontwerpprobleem wordt wanneer een zelfontwikkelende agent zijn eigen code kan herschrijven en nieuwe model-API's kan selecteren. "Guardrails moeten gezaghebbend blijven onder evolutionaire en publieke sociale druk", stellen zij in het paper. Om deze reden gebruiken benchmarkcampagnes bevroren systeem-snapshots, terwijl Hope op een aparte lijn live blijft evolueren.

Symbolische naamgeving

De naam Ouroboros verwijst naar het eeuwenoude symbool van een slang die in zijn eigen staart bijt, een cirkel vormend die het begin en einde met elkaar verbindt. Zoals artwithsymbols.com beschrijft, is dit een van de meest diepzinnige en raadselachtige symbolen uit de menselijke geschiedenis, die ons uitdaagt om na te denken over begin en einde. De keuze voor deze naam lijkt bewust: het systeem voedt zichzelf met zijn eigen output om verder te groeien.

Het paper is ingediend onder de categorieën Software Engineering en Artificial Intelligence en is beschikbaar via met een DOI die nog geregistreerd moet worden. De onderzoekers hebben het paper op 8 augustus 2026 ingediend.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!