Het overzetten van softwarecode tussen uiteenlopende hardware-architecturen is een technisch uitdagend proces dat verder gaat dan het aanpassen van de syntax. Volgens een wetenschappelijk rapport dat op 25 augustus 2026 verscheen via arxiv.org, is voor het porten van GPU-kernels een volledige hermapping van de architectuur noodzakelijk. Terwijl CUDA-systemen werken met specifieke threads, blokken en geheugentoegang voor synchronisatie, vereist de Cerebras Software Language (CSL) een andere aanpak, waarbij de nadruk ligt op gedistribueerd SRAM, fabric-communicatie en expliciete plaatsing.
Om deze technologische kloof te dichten, hebben Yuebo Luo en een team van vijf medeauteurs het FABRICA-framework ontwikkeld. Dit systeem is ontworpen om GPU-kernels te vertalen en te optimaliseren voor wafer-scale systemen. Het framework combineert specifieke kennis over de doellocatie met een proces van uitvoering, foutcorrectie en optimalisaties die voortdurend op correctheid worden getoetst. Om de prestaties van dit nieuwe systeem te objectiveren, hebben de onderzoekers FABRICA-Bench geïntroduceerd, een dataset die 49 verschillende taken bevat voor de vertaling van CUDA naar CSL.
De kern van FABRICA rust op de inzet van agentische AI. In tegenstelling tot conventionele generatieve AI, zoals eenvoudige chatbots, kan agentische AI complexe workflows die uit meerdere stappen bestaan autonoom automatiseren, zoals beschreven door mit.edu. Voor FABRICA betekent dit dat het systeem niet enkel code produceert, maar deze ook zelfstandig test, de resulterende fouten analyseert en de code vervolgens corrigeert zonder menselijke tussenkomst.
De resultaten van het onderzoek tonen een significante stijging in de succesratio van de codevertaling. Bij de evaluatie van 28 kernonderdelen (Level 1-3) steeg het aantal correcte programma's van 6 naar 26 wanneer het framework werd ingezet in combinatie met Claude Opus 4.8. Over de gehele evaluatie van 49 taken slaagde het systeem erin om voor 38 gevallen een correct programma te genereren.
Naast de functionele correctheid zorgde FABRICA voor een aanzienlijke toename in snelheid. Voor 27 paren van referentie- en gegenereerde programma's werd een geometrisch gemiddelde van de versnelling berekend. Hierbij werd een versnelling van 3,75 keer vastgesteld op de SDK-simulator en een versnelling van 3,47 keer op de WSE-3 hardware, zoals vermeld in de publicatie op .
Het onderzoek biedt daarnaast inzichten in de capaciteiten van verschillende AI-modellen. Wanneer de executable workflow was vastgelegd, voltooide Claude Opus 4.8 26 van de 28 kerntaken correct, terwijl het best presterende open-weight model slechts 2 van deze 28 taken succesvol afrondde. Ook bleek gespecialiseerde kennis over Cerebras essentieel; het toevoegen van deze informatie verhoogde het succespercentage op een Level 1-3 paneel van 1 op 15 naar 7 op 15.
De auteurs concluderen dat de combinatie van de capaciteit van het basismodel, specifieke kennis van het doelsysteem, feedback tijdens de uitvoering en metingen op het doel essentieel zijn voor het succesvol genereren van kernels over verschillende architecturen heen. Dit werk, dat is gecategoriseerd onder Computational Engineering, Finance, and Science, introduceert hiermee een nieuwe methodologie voor het optimaliseren van wafer-scale systemen via geautomatiseerde vertaling, een proces dat sterk leunt op de autonome eigenschappen van .