Wetenschappers hebben een innovatieve methode ontwikkeld om de nauwkeurigheid van causale gevolgtrekking in kunstmatige intelligentie te verhogen. Het nieuwe model, dat bekendstaat als CIDER-FM (Foundation Models for Causal Inference from Diverse Experimental Regimes), is specifiek ontworpen om de impact van experimenten op bepaalde variabelen beter te kunnen voorspellen. Dit wordt bereikt door het gebruik van causale basismodellen die processen automatiseren via synthetische structurele causale modellen.
Een fundamenteel probleem bij traditionele causale analyse is de beperking van observationele gegevens. Volgens een wetenschappelijke publicatie op arxiv.org blijkt dat louter observationele data vaak onvoldoende zijn, omdat meerdere causale modellen compatibel kunnen zijn met dezelfde bewijslast. Hierdoor is het voor onderzoekers lastig om met zekerheid vast te stellen welk model de werkelijkheid daadwerkelijk representeert.
In de praktijk is het bovendien vaak onmogelijk om experimentele data te verzamelen waarbij exact de gewenste variabele wordt beïnvloed. CIDER-FM lost dit op door gebruik te maken van zogenaamde 'surrogaat-interventies'. Door beperkte observationele datasets te combineren met gegevens uit surrogaat-experimenten, kan het model een doel-conditionele interventional distribution (CID) preciezer voorspellen dan systemen die enkel op observationele data steunen. Deze technische benadering is uitvoerig beschreven in het onderzoek op .
De architectuur van CIDER-FM bevat een specifieke innovatie genaamd 'hierarchical three-axis attention'. Dit mechanisme stelt het systeem in staat om informatie uit te wisselen over drie verschillende dimensies: de variabelen, de individuele samples en de diverse experimentele regimes. Door deze gelaagde structuur kan het model contextuele informatie uit verschillende experimenten integreren, wat leidt tot een scherpere analyse van causale effecten.
Om de effectiviteit van het model te bewijzen, is CIDER-FM getest tegen diverse baselines. De evaluatie omvatte verschillende families van synthetische grafen en mechanismen. Daarnaast is het model getoetst aan de hand van gesimuleerde data en reële gegevens afkomstig van de 'Causal Chambers'. De resultaten, zoals gedocumenteerd in de , tonen aan dat het betrekken van experimentele context de voorspellingen van de CID significant verbetert.
Het onderzoek is op 30 september 2026 ingediend door een team van experts, waaronder Yuche Gao, Arik Reuter, Siyuan Guo, Anish Dhir, Bernhard Schölkopf en Adrian Weller. Het volledige document, dat 31 pagina's beslaat, is gecategoriseerd onder Machine Learning binnen de computerwetenschappen. Het werk biedt een theoretisch kader voor de inzet van surrogaat-experimenten en vertaalt dit naar een praktisch toepasbaar model.
Hoewel de naam 'CIDER' ook voorkomt in de commerciële sector, zoals bij de kledingcollecties op shopcider.com, is er geen enkele link tussen de modebranche en dit AI-project. De focus van CIDER-FM ligt uitsluitend op de wiskundige en computationele aspecten van causale inferentie. Met deze ontwikkeling zet het team een stap richting AI-systemen die niet enkel correlaties herkennen, maar ook de onderliggende oorzaak-gevolgrelaties in complexe datasets kunnen begrijpen.