Een recent wetenschappelijk onderzoek werpt een nieuw licht op de interne processen van grote taalmodellen (LLM's). De auteurs van de studie, Amrut Nadgir, Pratik Chaudhari en Vijay Balasubramanian, onderzoeken de dynamiek tussen het vermogen om logische stappen te volgen en het simpelweg herkennen van patronen in data. In hun publicatie, getiteld "The Dichotomy Between Pattern Recognition and Step-by-Step Reasoning", betogen zij dat deze twee processen niet volledig gescheiden zijn, maar juist uitersten vormen van hetzelfde spectrum.
Volgens de analyse die is gepubliceerd via arxiv.org wordt het vermogen van een AI-model om stapsgewijs te redeneren bepaald door de structuur van de trainingsdata. Wanneer de voorspelling van het volgende token slechts afhankelijk is van een beperkte hoeveelheid voorafgaande context, kan het model effectief redeneren. Echter, zodra de afhankelijkheid van de context toeneemt, verschuift het proces naar wat men patroonherkenning noemt.
Om dit theoretisch te onderbouwen, maken de onderzoekers gebruik van De Bruijn-grafen. Zij stellen dat redeneringstrajecten kunnen worden gezien als paden binnen zo'n graaf wanneer de afhankelijkheid van de context klein is. Een belangrijk resultaat van hun studie is dat het aantal noodzakelijke verbindingen in deze grafen zeer gering is in vergelijking met de totale hoeveelheid mogelijke trajecten. Dit verklaart waarom het aanleren van stapsgewijs redeneren relatief efficiënt kan verlopen met betrekking tot de benodigde hoeveelheid data.
De onderzoekers hebben hun theorie getoetst door het model Qwen2.5-1.5B-Instruct te finetunen voor specifieke taken, zoals het oplossen van wiskundige vergelijkingen en het analyseren van verhalen. Hieruit kwam naar voren dat een geringe contextafhankelijkheid weliswaar leidt tot een hogere precisie, maar dat dit gepaard gaat met een grotere kwetsbaarheid bij verstoringen tijdens de testfase. Modellen die daarentegen een zeer grote contextafhankelijkheid vertonen, presteren niet beter dan modellen die uitsluitend op patroonherkenning vertrouwen. De optimale balans tussen robuustheid en nauwkeurigheid wordt volgens de auteurs gevonden bij een gemiddelde dichtheid van toestanden.
In de praktijk lijkt deze structuur vaker voor te komen dan men aanvankelijk zou denken. De auteurs wijzen naar de prestaties van de modellen Qwen3-14B en Qwen3-32B als bewijs. Deze modellen behouden een nauwkeurigheid van meer dan 75% op benchmarks zoals GPQA-Diamond, MATH-500 en GSM8K, zelfs wanneer de aandacht wordt beperkt tot een 'sliding window' die minder dan 15% van de volledige redeneringstrajecten beslaat.
Centraal in het onderzoek staat de term 'dichotomie'. In de algemene taalduiding, zoals beschreven door het cambridge.org, wordt dit begrip gebruikt om een fundamentele scheiding of een contrast tussen twee tegenovergestelde zaken aan te duiden. Deze definitie wordt ook bevestigd in de cambridge.org, waar de nadruk ligt op het verschil tussen twee zaken die strikt gescheiden zijn.
In de context van AI-onderzoek wordt deze term gebruikt om de theoretische kloof te beschrijven tussen het herkennen van patronen en het uitvoeren van een logische analyse. Hoewel de titel van het onderzoek spreekt over een dichotomie, concluderen de wetenschappers uiteindelijk dat de overgang tussen deze twee modi vloeiend is en primair wordt gestuurd door de mate van contextuele afhankelijkheid tijdens het leerproces.