Onderzoekers hebben een nieuwe techniek ontwikkeld genaamd dLLM-SetScore, waarmee discrete diffusion language models kunnen worden ingezet voor multi-label tekstclassificatie zonder dat daarvoor specifieke training of fine-tuning nodig is.
In een recent wetenschappelijk artikel, dat is ingediend bij arxiv.org, beschrijft auteur Pawan Kumar hoe discrete masked-diffusion language models kunnen fungeren als classifiers voor teksten met meerdere labels. De kern van deze benadering, dLLM-SetScore, is dat het model geen taakspecifieke training vereist op tekstuele datasets voor entailment, wat het proces aanzienlijk efficiënter maakt.
Werking van dLLM-SetScore
De methode werkt door voor elk potentieel label een korte ja/nee-vraag te stellen aan het model. Vervolgens worden de waarschijnlijkheden van de twee mogelijke antwoordtokens op één gemaskeerde positie met elkaar vergeleken. Om de optimale instellingen te bepalen, zoals de temperatuur, de formulering van de prompts en de drempelwaarden, wordt gebruikgemaakt van een kleine validatieset van 200 gelabelde voorbeelden.
Een belangrijk aspect van het onderzoek is de aanpak van de positionering van labels. Volgens de leidt het plaatsen van alle labels in één enkele prompt tot een sterke asymmetrie in de positie van de slots. Dit fenomeen zorgde ervoor dat het eerste antwootslot in 100% van de Reuters-voorbeelden en in 99,4% van de GoEmotions-voorbeelden als positief werd voorspeld. Om dit artefact te vermijden, hanteert dLLM-SetScore een per-label scoring, waarbij elk label in dezelfde syntactische positie wordt geplaatst. Hierdoor worden de voorspellingen onafhankelijk van de volgorde van de labels.
Evaluatie en resultaten
De effectiviteit van de methode is getest met de modellen LLaDA-8B en Dream-7B op zes verschillende datasets. Deze resultaten zijn afgezet tegen diverse alternatieven, waaronder autoregressieve LLM's, NLI-modellen, supervised classifiers en SetFit.
Uit de data blijkt dat 'Instruct'-checkpoints een significante verbetering bieden. Op de vijf datasets die door beide diffusion-families werden gedeeld, verbeterden deze checkpoints de macro-F1 score in 9 van de 10 vergelijkingen en de micro-F1 score in 8 van de 10 gevallen. Binnen het gehanteerde protocol behaalde LLaDA-Instruct de hoogste training-vrije waarden voor de metrieken van zowel Reuters als het Europees Hof voor de Rechten van de Mens (ECtHR), zoals vermeld in de .
Theoretische onderbouwing en beperkingen
Naast de empirische resultaten biedt het onderzoek theoretische bewijzen voor permutatie-invariantie. De auteurs karakteriseren beslissingen op basis van drempelwaarden onder een gewogen Hamming-verlies en leiden plafonds af voor recall en F1-scores.
Niet alle experimenten waren succesvol. Een verkennende stap genaamd 'local Joint Set Refinement' werd getest om de resultaten te verbeteren. Echter, deze stap verlaagde de F1-score bij zowel bevooroordeelde als onbevooroordeelde initialisaties. Vanwege dit resultaat is deze specifieke stap in het uiteindelijke model niet opgenomen en wordt het in de gepresenteerd als een negatief resultaat.
Het artikel is officieel geaccepteerd voor de SIAM SDM 2026 en beslaat in totaal 39 pagina's. De volledige details over de implementatie en de gebruikte datasets zijn beschikbaar via de .