Een team van onderzoekers heeft een kunstmatige intelligentie ontwikkeld die satellieten autonoom kan laten manoeuvreren om botsingen met ruimtepuin te vermijden. De methode, gebaseerd op reinforcement learning, behaalt in simulaties een succespercentage van 97,5 procent en overtreft daarmee ruimschoots de traditionele controlesystemen.
Het onderzoek, uitgevoerd door Logan Luna van het Georgia Institute of Technology en Juan Ortiz Couder en Raul Alejandro Vargas-Acosta van de Embry-Riddle Aeronautical University, is gepubliceerd in het wetenschappelijke tijdschrift IEEE Access. De onderzoekers stellen dat het aantal botsingswaarschuwingen in een baan om de aarde snel toeneemt naarmate de orbitale congestie verergert door de lancering van megaconstellaties, zo blijkt uit de arxiv.org.
Huidige methoden schieten tekort
Volgens de onderzoekers zijn de huidige praktijken voor het vermijden van botsingen, die vaak handmatig of op regels gebaseerd zijn, moeilijk op te schalen naar de steeds dynamischer wordende omgeving. Ruimtepuin vormt een groeiend probleem voor zowel satellieten in een lage baan om de aarde (LEO) als in een geostationaire baan (GEO). Fragmentatiegebeurtenissen, waarbij botsingen of explosies ruimtepuin creëren, komen steeds vaker voor.
Een satelliet is elk object dat in een baan om een planeet of ster draait, legt nasa.gov uit. Naast natuurlijke satellieten zoals de maan, draaien er duizenden kunstmatige satellieten rond de aarde. Die worden onder meer gebruikt voor weersvoorspellingen, communicatie en navigatiesystemen zoals GPS.
Reinforcement learning als oplossing
De onderzoekers stellen een beleid voor dat gebruikmaakt van reinforcement learning, getraind via Proximal Policy Optimization (PPO). Daarbij wordt een open-source simulator met hoge nauwkeurigheid gebruikt voor zowel de training als de evaluatie van het systeem. De simulator modelleert de Newtoniaanse tweelichamen-dynamica, inclusief verstoringen door de zwaartekracht van de zon en de maan, brandstofafhankelijke stuwkracht en configureerbare puinvelden.
In 1.000 deterministische GEO-scenario's behaalde de AI-agent een succespercentage van 97,5 procent bij het vermijden van botsingen. Ter vergelijking: een op regels gebaseerde basislijn haalde slechts 20,7 procent succes, en een impulsieve delta-v-planner kwam niet verder dan 27,5 procent. De resultaten tonen volgens de auteurs aan dat reinforcement learning een aanzienlijke verbetering kan betekenen ten opzichte van de huidige aanpak.
Training met curriculum learning
Het agentschap werd getraind met behulp van curriculum learning en beloningsfuncties die gericht zijn op het stimuleren van overleving, voldoende geprojecteerde missie-afstand en het behoud van brandstof (delta-v). De evaluatie bestond uit een volledig deterministische pijplijn, inclusief gedeelde seeds, per-episode-logs en telemetrie-export.
Het volledige raamwerk is openbaar beschikbaar gesteld, waardoor andere onderzoekers de methode kunnen reproduceren en verder kunnen ontwikkelen. Het onderzoek omvat 18 pagina's en 16 figuren en is gepubliceerd in IEEE Access, volume 14, pagina's 18138-18154, 2026.