← Terug
Nieuwe methode voor efficiëntere Transformer-modellen met 'Infinite Capacity'

Nieuwe methode voor efficiëntere Transformer-modellen met 'Infinite Capacity'

Wetenschappers hebben een innovatieve benadering voor kernel-attention ontwikkeld die de computationele last van Transformer-modellen aanzienlijk vermindert. De methode, die bekend staat als "Quasi Linear Kernel Attention with Infinite Capacity", pakt een hardnekkig probleem aan in de huidige AI-architectuur: de kwadratische groei van rekenkosten bij het gebruik van standaard softmax attention naarmate de invoersequentie langer wordt.

In een publicatie op arxiv.org leggen Nicolaj Rux, Johannes Hertrich en Sebastian Neumayer uit dat deze kwadratische schaling het verwerken van omvangrijke datasets technisch complex en kostbaar maakt. Om dit te omzeilen, wordt vaak gebruikgemaakt van kernel attention, waarbij de softmax-functie wordt vervangen door een kernel-functie. Het doel van de onderzoekers was om kernels te vinden die de rekenkracht van een quasi-lineaire berekening bieden, terwijl de uitdrukkingskracht van het oorspronkelijke model behouden blijft.

Om de effectiviteit van deze kernels te kwantificeren, introduceerden de auteurs het begrip 'capaciteit'. Dit concept meet de maximale lengte van een sequentie waarbij de attention-matrix de identiteitsmatrix kan benaderen. Een hogere capaciteit correleert direct met een grotere expressiviteit van het model. Volgens de beschikken bekende kernels zoals Laplace, Gauss en softmax over een oneindige capaciteit. Veel huidige quasi-lineaire kernels, die gebaseerd zijn op feature maps met een eindige dimensie, hebben echter een beperkte capaciteit, wat hun nut bij zeer lange sequenties inperkt.

Als oplossing stellen de onderzoekers het gebruik van additieve kernels voor. Deze specifieke constructie is opgebouwd uit polynomiale exponentiële kernels en univariate splines. De auteurs tonen aan dat deze aanpak een oneindige capaciteit behoudt, terwijl de berekeningen quasi-lineair blijven dankzij het toepassen van sorteerprocessen. In praktische benchmarks presteerde deze implementatie van 'additive sorting kernels' significant beter dan moderne softmax-backends, vooral bij het verwerken van lange sequenties.

Het onderzoek, dat op 28 september 2026 is ingediend, is geclassificeerd onder de vakgebieden Numerieke Analyse en Machine Learning. De technische details en bewijsvoering zijn opgenomen in de . Door de complexiteit te verschuiven van kwadratisch naar quasi-lineair, wordt het mogelijk om AI-modellen te bouwen die veel grotere hoeveelheden informatie gelijktijdig kunnen analyseren zonder dat de hardwarevereisten exponentieel toenemen.

Het is overigens belangrijk om een onderscheid te maken tussen deze academische terminologie en commerciële merknamen. Hoewel de term "Quasi" ook wordt gebruikt door officialquasi.com, een bedrijf dat gespecialiseerd is in huidverzorgingsproducten zoals collageenmaskers, bestaat er geen enkele link tussen deze commerciële organisatie en het genoemde onderzoek naar neurale netwerken. De focus van de publicatie ligt uitsluitend op de optimalisatie van algoritmen binnen de kunstmatige intelligentie.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!