Onderzoekers hebben een methode ontwikkeld waarmee uitgebreide systeemprompts in grote taalmodellen (LLM's) kunnen worden vervangen door een enkel geleerd token. Deze techniek vermindert de rekenkosten bij het genereren van antwoorden aanzienlijk zonder dat het gedrag van het model merkbaar verslechtert.
Het sturen van grote taalmodellen gebeurt vaak via zogenaamde systeemprompts: lange sets instructies die het model vertellen hoe het zich moet gedragen, welke toon het moet aanslaan of welke regels het moet volgen. Hoewel deze prompts effectief zijn, vormen ze een technische uitdaging. Omdat deze instructies bij elke nieuwe interactie opnieuw door het model verwerkt moeten worden, kost dit veel rekenkracht en neemt het kostbare ruimte in beslag binnen het contextvenster van het model.
In een recent wetenschappelijk artikel, gepubliceerd op het platform arxiv.org, presenteren Jiancheng Dong en collega's een oplossing voor dit probleem. Zij stellen een lichtgewicht trainingsraamwerk voor dat in staat is om de volledige effectiviteit van een lange systeemprompt te comprimeren tot één enkel token, door hen het 'Behavior-Equivalent Token' of [BE]-token genoemd.
Werking van het [BE]-token
De voorgestelde methode werkt in twee hoofdfasen. In de eerste fase wordt het [BE]-token getraind om de semantische inhoud van de oorspronkelijke systeemprompt te coderen via een proces van reconstructie. Vervolgens wordt in een tweede fase het specifieke gedrag dat de prompt teweegbrengt, gedestilleerd in dit enkele token.
Een cruciaal aspect van deze benadering is de minimale impact op de bestaande infrastructuur van het taalmodel. Volgens de publicatie op zijn er voor deze methode geen updates nodig aan de reeds getrainde gewichten van het LLM. Daarnaast is er geen gebruik gemaakt van aanvullende compressiemodellen of gelabelde responsen tijdens het proces.
Significante winst in efficiëntie
De resultaten van de empirische evaluaties, uitgevoerd op drie verschillende datasets, tonen een drastische verbetering in efficiëntie. De onderzoekers melden dat het vervangen van lange prompts door het [BE]-token kan leiden tot een compressieratio van wel 3000 keer. Dit betekent dat een enorme hoeveelheid tekst wordt teruggebracht tot een minimale representatie.
Ondanks deze extreme compressie blijft de prestatie van het model nagenoeg gelijk. De data uit het onderzoek op wijzen uit dat ongeveer 98% van de prestaties van de oorspronkelijke systeemprompts behouden blijft. Hierdoor kan het model bijna het volledige contextvenster gebruiken voor de feitelijke input van de gebruiker en de gegenereerde output, in plaats van een groot deel van de capaciteit te verspillen aan vaste instructies.
Impact op inferentiekosten
De praktische implicaties van dit onderzoek zijn groot, vooral voor commerciële toepassingen van LLM's waarbij kosten en snelheid van essentieel belang zijn. Door de hoeveelheid tokens die tijdens de inferentiefase (het genereren van een antwoord) verwerkt moeten worden drastisch te verlagen, dalen de operationele kosten.
Het onderzoek, waarvan de laatste revisie op 28 augustus 2026 verscheen via , biedt hiermee een oplossing voor de balans tussen nauwkeurige sturing van AI-modellen en de technische beperkingen van het geheugen en de rekenkracht van huidige hardware.