Nieuw onderzoek wijst uit dat sparse architecturen, zoals Mixture-of-Experts (MoE), gevoeliger zijn voor prestatieverlies wanneer trainingsdata herhaald wordt dan traditionele dense Transformers.
Nu de voorraad aan door mensen geschreven teksten voor het trainen van taalmodellen uitgeput raakt, is het een gangbare praktijk geworden om bestaande trainingsdata te herhalen. Hoewel de effecten hiervan bij dicht geactiveerde Transformers al eerder zijn bestudeerd, bleef de impact op sparse architecturen grotendeels onbekend. Een recent onderzoek, gepubliceerd via arxiv.org, werpt nu een licht op de risico's van deze praktijk voor Mixture-of-Experts modellen.
Versnelde degradatie van prestaties
De onderzoekers, waaronder Atindra Jha en Margaret Li, hebben geëxperimenteerd met modellen variërend van 80 miljoen tot 1 miljard actieve parameters (met een totaal van 8,5 miljard parameters). Uit de resultaten blijkt dat MoE-modellen aanzienlijk sneller in kwaliteit achteruitgaan bij data-repetitie dan hun dense tegenhangers.
Volgens de kunnen dense modellen met 80 miljoen parameters data tot wel acht keer herhalen met minimale negatieve effecten. MoE-modellen beginnen echter al bij een viervoudige herhaling tekenen van degradatie te vertonen. Wanneer de data 32 keer wordt herhaald, presteren deze sparse modellen zelfs slechter dan dense modellen, waardoor het oorspronkelijke voordeel van de MoE-architectuur in scenario's met unieke data volledig verdwijnt.
Het onderzoek benadrukt dat dit effect toeneemt naarmate de mate van sparsity groter wordt. Opvallend is dat deze verslechtering wordt bepaald door het totaal aantal parameters in plaats van enkel de actieve parameters.
Oorzaken en mechanismen
De wetenschappers hebben geanalyseerd welke interne mechanismen bijdragen aan dit overfitten in regimes met hoge repetitie. Zij stelden vast dat de routing binnen MoE-modellen — het proces dat bepaalt welke 'expert' een bepaalde taak uitvoert — zeer vroeg in de training stabiliseert.
Bovendien is er een directe correlatie tussen de specialisatie van experts en het overfitten van herhaalde data. Dit suggereert dat de modellen patronen gaan memoriseren in plaats van generaliseren, wat leidt tot een verminderde effectiviteit bij nieuwe informatie. In de context van machine learning wordt cambridge.org gedefinieerd als informatie, vaak in de vorm van feiten of cijfers, die wordt verzameld om onderzocht te worden en besluitvorming te ondersteunen. In dit specifieke geval leidt de herhaling van deze informatie tot een ongewenste specialisatie van de modelparameters.
Mogelijke oplossingen
Om dit probleem aan te pakken, hebben de auteurs verschillende bestaande regularisatiemethoden getest. Uit hun experimenten bleek dat bepaalde technieken, zoals dropout, het overfitten kunnen verzachten.
In het bijzonder stelde de vast dat sterke regularisatie op basis van masking ervoor kan zorgen dat MoE-modellen zelfs bij een herhaling van meer dan 64 keer nog beter presteren dan dense modellen. Desondanks concludeerden de onderzoekers dat geen enkele methode de prestaties volledig kan herstellen naar het niveau van training met volledig unieke data.
De auteurs suggereren dat toekomstige methoden zich moeten richten op het verstoren van memorisatiepatronen om over-specialisatie in modelparameters te verminderen. Hiermee hopen ze de negatieve interactie tussen model-sparsity en datatekorten tegen te gaan.