← Terug
Nieuw AI-framework MARS verbetert prestaties bij competitief programmeren

Nieuw AI-framework MARS verbetert prestaties bij competitief programmeren

Wetenschappers hebben een innovatief multi-agent systeem ontwikkeld dat de effectiviteit van grote taalmodellen (LLM's) bij het oplossen van complexe programmeeruitdagingen versterkt. Het systeem, dat de naam MARS draagt, richt zich specifiek op het overbruggen van de kloof tussen algemene codegeneratie en de strikte eisen die gesteld worden binnen competitief programmeren.

Traditionele multi-agent systemen maken vaak gebruik van brede, generieke rollen, zoals een planner of een debugger. Volgens een arxiv.org leidt deze aanpak er vaak toe dat de keuze voor een specifieke algoritmische techniek volledig afhankelijk is van het basismodel, wat de kans op fouten vergroot. Om dit te ondervangen, hebben Andrei Mikhailov, Mikhail Burtsev en Alsu Sagirova gekozen voor een benadering waarbij agenten gespecialiseerd zijn in specifieke domeinen, zoals geometrie, strings, grafen of dynamisch programmeren.

Het framework, voluit de Multi-Agent Relay of Specialized LLMs, hanteert een relay-structuur. Hierbij wordt gebruikgemaakt van retrieval-augmented generation (RAG) over een verzameling algoritmische theorieën om voor elk specifiek probleem een team van relevante specialisten samen te stellen. Het proces begint bij een 'starter' die een initiële oplossing in C++17 schrijft. Deze code wordt vervolgens in een sandbox getest aan de hand van publieke voorbeelden. De actieve specialist kan de code vervolgens optimaliseren, repareren of doorsturen naar de volgende expert in de keten. Een 'infrastructure-fixer' zorgt in de laatste fase voor de correcte normalisatie van de boilerplate-code.

De prestaties van MARS zijn geëvalueerd met behulp van het model Gemma 4 op de CodeContests-dataset. Uit de blijkt dat het systeem een pass-rate van $0,624 \pm 0,006$ behaalt. Dit vertegenwoordigt een stijging van 14,4 procentpunten in vergelijking met directe prompting. Hoewel de pass-rate lager ligt dan die van CodeSIM, dat op $0,731$ uitkomt, is MARS aanzienlijk kostenefficiënter. De wall-clock kostprijs ligt 3,3 keer lager en er is sprake van een kleinere variatie in het tokenverbruik per taak. Gemiddeld doorloopt een opdracht 2,3 fasen binnen de pipeline.

Hoewel de naam van het systeem doet denken aan de britannica.com, is de focus van dit project puur computationeel en gericht op kunstmatige intelligentie. Het onderzoek is ingediend voor EMNLP 2026 en omvat dertien pagina's met uitgebreide figuren om de methodologie te illustreren. De auteurs hebben besloten de broncode via GitHub openbaar te maken, zodat de wetenschappelijke gemeenschap de resultaten kan valideren en verder kan ontwikkelen.

Door de verschuiving van generieke rollen naar domeinspecifieke expertise biedt MARS een nieuwe route naar hogere precisie in softwareontwikkeling. Meer technische details over de implementatie en de gebruikte datasets zijn terug te vinden in de op arXiv.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!