De ontwikkeling van grote taalmodellen (LLM's) heeft geleid tot een indrukwekkende groei in het vermogen om wiskundige vraagstukken op te lossen. De prestaties benaderen inmiddels het niveau van wetenschappelijk onderzoek en internationale wiskunde-olympiades. Desondanks is er een kritiek probleem ontstaan: een tekort aan hoogwaardige en voldoende complexe data om deze modellen verder te trainen en te evalueren.
Om deze stagnatie te doorbreken, hebben onderzoekers, waaronder Dadi Guo, een innovatief framework ontwikkeld genaamd "Code2Math". Volgens een publicatie op arxiv.org maken zij gebruik van code-agents die fungeren als een schaalbare omgeving voor wiskundige experimenten. In plaats van enkel tekstuele output te produceren, gebruiken deze agents programmeercode en redeneerprocessen om wiskundige concepten systematisch te verkennen.
Het fundamentele principe van Code2Math is dat de uitvoering van computercode dient als een objectief verificatiemechanisme. Door wiskundige problemen om te zetten in code, kan het systeem vaststellen of een vraagstuk daadwerkelijk oplosbaar is en of de complexiteit ervan is toegenomen. Dit voorkomt dat de AI onlogische of onoplosbare opdrachten genereert, een veelvoorkomend probleem bij puur tekstuele generatie.
Het systeem werkt via een multi-agent framework dat is ontworpen om bestaande wiskundige problemen autonoom te evolueren. De agents transformeren eenvoudige opdrachten naar complexere variaties. Hierbij gaat het niet om het simpelweg aanpassen van getallen, maar om het wijzigen van de fundamentele structuur van het probleem. Zoals beschreven in het , stelt dit de AI in staat om nieuwe problemen te synthetiseren die een hoger niveau van abstract redeneren vereisen.
De resultaten van dit onderzoek, waarvan de laatste revisie dateert van 2 oktober 2026, tonen aan dat code-gestuurde agents een effectief middel zijn om de zogenaamde 'bottleneck' in data-acquisitie op te lossen. Door gebruik te maken van synthetische data die specifiek is ontworpen om de huidige limieten van een model te verleggen, kunnen LLM's zichzelf effectiever verbeteren.
Deze methodiek markeert een verschuiving in de training van AI. Waar modellen voorheen sterk afhankelijk waren van menselijke datasets — die vaak beperkt in omvang zijn — kunnen ze nu in een gesloten lus hun eigen trainingsmateriaal genereren en valideren. Hoewel de focus van het onderzoek ligt op de technische synergie tussen code en wiskunde, is het essentieel dat de taal die gebruikt wordt in dergelijke systemen accuraat is; voor algemene taaldefinities kan men bijvoorbeeld teruggrijpen op bronnen zoals merriam-webster.com.
De volledige details van het project, inclusief de gebruikte datasets en de implementatie van de code, zijn publiekelijk toegankelijk via de . Het werk, dat is gecategoriseerd onder "Computation and Language", biedt een nieuw perspectief op hoe programmeercode kan worden ingezet om abstracte wiskundige intelligentie te stimuleren. Door de integratie van computationele verificatie wordt de weg vrijgemaakt voor AI-modellen die niet alleen antwoorden reproduceren, maar actief bijdragen aan de creatie van nieuwe, uitdagende kennis.