← Terug
Reinforcement Learning ingezet voor optimalisatie van MEV-extractie op Polygon

Reinforcement Learning ingezet voor optimalisatie van MEV-extractie op Polygon

Binnen de wereld van blockchain-netwerken is de strategische volgorde van transacties in blokken uitgegroeid tot een lucratieve bron van inkomsten. Dit proces, bekend als Maximal Extractable Value (MEV), is recentelijk het onderwerp geweest van een wetenschappelijk onderzoek waarin een nieuwe methode wordt gepresenteerd om de winstgevendheid hiervan te maximaliseren op de Polygon-blockchain.

Volgens een publicatie op arxiv.org is de dynamiek van winstextractie aanzienlijk veranderd door de overgang van Priority Gas Auctions (PGA) naar het Polygon Atlas-mechanisme. Waar PGA's vaak leidden tot netwerkspam door open biedingsoorlogen, introduceerde Atlas een systeem van gesloten biedingen (sealed-bid competities). In dit nieuwe regime blijven biedingen geheim en moeten ze onder extreme tijdsdruk worden ingediend, wat nieuwe strategische hindernissen opwerpt voor zogenaamde 'searchers' die op zoek zijn naar arbitragekansen.

De uitdaging voor deze searchers is dat zij binnen een tijdvenster van minder dan een seconde een optimaal bod moeten formuleren, zonder inzicht in de strategieën of de aanwezigheid van concurrenten. In het rapport wordt gesteld dat traditionele speltheoretische modellen hier tekortschieten. Deze modellen gaan vaak uit van een stationair evenwicht en bekende waardeverdelingen, terwijl de realiteit van sub-seconde veilingen op de blockchain juist wordt gekenmerkt door snel evoluerende strategieën.

Om deze complexiteit aan te pakken, hebben de onderzoekers een raamwerk ontwikkeld dat gebruikmaakt van reinforcement learning. Dit is een vorm van machine learning waarbij een agent leert optimale beslissingen te nemen door interactie met een omgeving, waarbij acties worden gestuurd door beloningen of straffen. Zoals beschreven door verywellmind.com, stelt deze methode een systeem in staat om door middel van vallen en opstaan te ontdekken welke strategieën het beste resultaat opleveren.

Het voorgestelde systeem bestaat uit drie hoofdonderdelen. Ten eerste is er een simulatieomgeving die de stochastische aankomst van arbitragekansen en de concurrentie binnen Atlas nabootst. Ten tweede is er een agent gebaseerd op Proximal Policy Optimization (PPO), die specifiek is geoptimaliseerd voor real-time beperkingen. Deze agent kan adaptieve strategieën formuleren in continue actieruimtes, terwijl de snelheid van de inferentie laag genoeg blijft voor praktisch gebruik in productie. Ten slotte is de effectiviteit van dit systeem empirisch gevalideerd in scenario's met actieve concurrentie.

De resultaten van deze AI-gestuurde aanpak zijn opvallend. De geschiedenis-geconditioneerde agent wist een 'Maximum-Profit Capture' van 49% te realiseren wanneer deze samen met andere searchers opereerde. Daarnaast meldt de studie via een relatieve winstverbetering van 43% ten opzichte van de historische marktleider in een specifiek vervangingsscenario. Hiermee presteert het model aanzienlijk beter dan de statische biedstrategieën die voorheen dominant waren.

Het onderzoek, dat oorspronkelijk op 16 oktober 2025 werd ingediend en op 20 augustus 2026 in een herziene versie verscheen, toont aan hoe geavanceerde machine learning-technieken kunnen worden ingezet om complexe, hoogfrequente financiële interacties op gedistribueerde grootboeken te optimaliseren.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!