⚠️ KMI: Hitte in België De waarschuwingsfase van het hitteplan is geactiveerd vanwege temperaturen die woensdag en donderdag de 30 graden zulle… 28/07 00u – 30/07 00u KMI ↗ Kaart ↗ Artikel →
← Terug
AI-modellen vertonen voorspelbaar patroon bij mislukte redeneerprocessen

AI-modellen vertonen voorspelbaar patroon bij mislukte redeneerprocessen

Onderzoekers hebben ontdekt dat Chain-of-Thought AI-modellen een duidelijk bimodaliteits-patroon vertonen bij het oplossen van complexe problemen. Wanneer een model niet tot een conclusie komt binnen het toegewezen token-budget, is dit vaak al vroeg in het proces detecteerbaar via interne activaties.

In een recent wetenschappelijk onderzoek, gepubliceerd op het platform arxiv.org, is gekeken naar de manier waarop geavanceerde taalmodellen, zoals DeepSeek-R1-Distill-Qwen-7B, redeneerprocessen uitvoeren. De auteurs, waaronder Renuka Oladri, Niveda Jawahar en Abdirisak Mohamed, stellen vast dat er een scherp onderscheid bestaat tussen generaties die succesvol convergeren naar een antwoord en generaties die dat niet doen.

Convergentie en nauwkeurigheid

Het onderzoek richtte zich op het fenomeen waarbij modellen een vastgesteld 'token-budget' gebruiken. Een token is in de context van taalmodellen een basiseenheid van tekstverwerking, wat fundamenteel verschilt van de digitale activa die in de cryptowereld als tokens worden aangeduid, zoals beschreven door opensea.io.

De resultaten tonen een opvallend contrast in prestaties. Wanneer een model binnen het budget convergeert naar een oplossing, is de nauwkeurigheid op de AIME-dataset (1983-2024) maar liefst 90,3%. Echter, bij de zogenaamde 'non-converged' generaties — waarbij het model het budget volledig verbruikt zonder een conclusie te bereiken — daalt de nauwkeurigheid naar slechts 6,6%. De algemene convergentiesnelheid van het geteste model lag op 62,0%, volgens de data uit de .

Vroegtijdige detectie via interne representaties

De kernvraag van de onderzoekers was of het lot van een redeneerketen al vroegtijdig voorspeld kan worden. Door gebruik te maken van 'linear probes' op de verborgen activaties van het model tussen token-positie 50 en 300, probeerden zij te bepalen of het model intern al 'weet' of het tot een oplossing zal komen.

De bevindingen wijzen erop dat dit inderdaad mogelijk is. Specifiek bij de activaties van laag 20 op token 150 werd een AUC (Area Under the Curve) van 0,608 behaald. Hoewel dit een bescheiden signaal is, bleek dit resultaat consistent boven de kansberekening te liggen, zelfs al bij token 50. Volgens de presteren deze activatie-probes structureel beter dan gedragsmatige baselines, zoals statistieken over herhalingen of token-entropie.

Implicaties voor efficiëntie en rekenkracht

Hoewel een permutatietest een p-waarde van 0,063 opleverde — wat betekent dat het signaal niet volledig bevestigd kan worden bij de meest strikte conventionele drempelwaarden — suggereren de data dat de uitkomst van een redeneerproces gedeeltelijk gecodeerd is in de tussenliggende representaties van het model.

Dit inzicht heeft potentieel grote gevolgen voor de manier waarop AI-inferentie wordt uitgevoerd. Als een systeem vroegtijdig kan detecteren dat een redeneerketen niet zal convergeren, kan dit leiden tot:
- Early-exit inference: Het voortijdig stopzetten van zinloze berekeningen.
- Adaptieve toewijzing van rekenkracht: Het toewijzen van meer middelen aan complexe taken en het besparen van energie bij onoplosbare paden.

De studie concludeert dat het begrijpen van deze mechanische patronen een weg opent naar efficiëntere AI-systemen die minder verspilling van rekenkracht vertonen wanneer een oplossing onbereikbaar blijkt. De volledige technische details en methodologie zijn terug te vinden in het .

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!