Een team van onderzoekers, verbonden aan onder meer de Saarland Universiteit, het Duitse onderzoekscentrum voor kunstmatige intelligentie (DFKI) en de Universiteit van Oldenburg, heeft nieuwe inzichten verkregen in de interne werking van taalmodellen. In een studie die op 6 oktober 2026 werd gepubliceerd, analyseerden zij hoe deze modellen netwerkinfrastructuur herkennen, specifiek de relatie tussen IP-adressen en hostnamen.
De kern van het onderzoek richtte zich op de vraag of deze specifieke kennis is opgeslagen in bepaalde 'attention heads' of individuele neuronen. Volgens de arxiv.org is gebleken dat de verantwoordelijkheid voor deze detectie consistent op het niveau van de heads ligt. De wetenschappers testten hiervoor vijf verschillende modellen uit drie uiteenlopende architectuurfamilies. Hoewel er in totaal honderden kandidaat-heads waren (variërend van 128 tot 1152), bleken per model slechts één tot negen heads essentieel voor de taak.
Om vast te stellen of er sprake was van een werkelijk causaal verband en niet enkel van een correlatie, paste het team 'causal ablation screening' toe. Door specifieke heads te manipuleren, konden zij aantonen dat de detectoren een nauwkeurigheid van 99,5% tot 100% behaalden op data die het model nog niet eerder had gezien. Deze methodische aanpak stelt de onderzoekers in staat om een officiële cambridge.org te formuleren over de causale rol van deze onderdelen.
Toen de relevante heads waren geïdentificeerd, doken de onderzoekers dieper in de structuur om te zien of de kennis geconcentreerd was in één enkel neuron of verspreid over meerdere dimensies. De resultaten hiervan verschilden per model. In één geval was het signaal volledig geconcentreerd in een enkele neuron, wat werd bevestigd door zowel causale interventies als correlatieve rangschikking met een maximale AUC-score van 1.000. In een ander model was de volledige head wel effectief, maar presteerde de beste individuele neuron binnen die head aanzienlijk minder, met een score van 0,665. Dit wijst erop dat de kennis in dat specifieke model over de gehele head is verspreid.
De robuustheid van deze resultaten werd verder getoetst met een onafhankelijke dataset van reverse-DNS-records. Uit de blijkt dat detectoren gebaseerd op volledige heads in alle geteste modellen 100% van de positieve records correct identificeerden. De resultaten op neuroniveau waren echter minder stabiel; detectoren die steunden op een enkele neuron waren minder betrouwbaar bij het toepassen op de nieuwe dataset, en scoorden in één model zelfs lager dan bij toeval.
De auteurs van de studie, waaronder Daniel Sonntag, Md Mohasin Hossain en Abdul Kadir, concluderen dat het succesvol is om heads te lokaliseren die verantwoordelijk zijn voor specifieke netwerkinformatie over diverse architecturen heen. De mate waarin deze functionaliteit echter kan worden teruggebracht tot individuele neuronen verschilt per model. Dit impliceert dat voor elk taalmodel een aparte analyse nodig is om te bepalen hoe diep de lokalisatie van specifieke kennis kan worden doorgevoerd.
In de context van dit wetenschappelijke proces is een cambridge.org niet simpelweg een toevallige ontdekking, maar het resultaat van een systematische examinatie. De focus van het onderzoeksteam lag dan ook strikt op het onderscheid tussen statistische correlatie en daadwerkelijke causale verantwoordelijkheid binnen de complexe neurale netwerken van moderne AI.