⚠️ KMI waarschuwing: Onweer in Noordwest-België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
Nieuwe analyse werpt licht op lengte-generalisatie bij Transformers

Nieuwe analyse werpt licht op lengte-generalisatie bij Transformers

Wetenschappers hebben een nieuwe theoretische benadering ontwikkeld om een hardnekkig probleem in kunstmatige intelligentie aan te pakken: lengte-generalisatie. Dit fenomeen beschrijft het vermogen van een neuraal netwerk om taken correct uit te voeren op gegevensreeksen die langer zijn dan de voorbeelden die het model tijdens de trainingsfase heeft gezien.

In een recent onderzoek, gepubliceerd via arxiv.org, presenteren Yijia Jessica Zhu and David Chiang het concept van het 'normalized exact-solution volume' (NESV). Met deze methode kunnen zij de theoretische capaciteit van Transformer-modellen kwantificeren. De NESV meet in feite welk deel van het parametergebied van een model leidt tot een exacte oplossing voor een specifieke inputlengte. Wanneer dit volume sterk krimpt naarmate de input langer wordt, is de kans groter dat het model faalt bij het verwerken van langere sequenties.

Om de theorie te toetsen, analyseerden de auteurs single-layer Transformers op vier verschillende taken. De resultaten tonen aan dat de complexiteit van een taak direct samenhangt met de snelheid waarmee het oplossingsvolume afneemt. Zo bleek de 'FIRST'-taak relatief eenvoudig te generaliseren vanwege een constant volume. De 'PARITY'-taak bleek daarentegen extreem moeilijk, aangezien het volume daar nul was. Bij de 'INDEX'-taak identificeerden de onderzoekers specifieke foutbronnen die toenamen bij langere inputs. Door het model structureel aan te passen om een van deze fouttermen te elimineren, steeg de nauwkeurigheid bij sequenties die tien keer langer waren dan de trainingsdata van 60% naar 85%.

Dit onderzoek sluit aan bij een bredere wetenschappelijke zoektocht naar de grenzen van Transformer-architecturen. Zo werd tijdens icml.cc door Andy Yang en collega's betoogd dat er voor bepaalde klassen van talen, zoals C-RASP, geen berekenbare grenzen bestaan voor lengte-generalisatie, hoewel zij wel mogelijkheden zagen voor het zogenaamde 'positive fragment' van deze talen.

Ook vanuit de industrie wordt gezocht naar oplossingen voor dit probleem. apple.com introduceerde een framework om causal transformers met absolute positionele encoderingen te analyseren. Hun focus lag op het identificeren van functies die standhouden bij zeer lange inputs, wat helpt om het succes van algoritmische taken beter te voorspellen.

Daarnaast hebben onderzoekers via arxiv.org geëxperimenteerd met 'Universal Transformers for Circuit Computations'. In plaats van enkel te analyseren waarom modellen falen, richtten zij zich op het bouwen van compacte modellen die perfecte lengte-generalisatie bereiken. Dit deden zij door gebruik te maken van specifieke technieken zoals gated residual updates en type-constrained token routing.

De gecombineerde inzichten uit deze studies suggereren dat de strijd tegen de beperkingen van inputlengte zowel via theoretische volume-analyse als via structurele modelaanpassingen kan worden gewonnen. Door precies in kaart te brengen waar de parameterruimte tekortschiet, kunnen ontwikkelaars robuustere AI-systemen bouwen die niet langer beperkt worden door de omvang van hun initiële trainingsset.

Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!