Om de veiligheid van grote taalmodellen (LLM's) te waarborgen, is HiveTraceGuard-Pro ontwikkeld. Dit compacte generatieve 'guardrail'-model is specifiek ontworpen om kwaadaardige inputs, zoals prompt-injecties en jailbreaks, te identificeren en te blokkeren voordat ze het hoofdmodel bereiken. De noodzaak voor dergelijke systemen is groot, aangezien gebruikers voortdurend nieuwe methoden zoeken om veiligheidsfilters te omzeilen.
Een bekend voorbeeld van deze pogingen zijn de zogenaamde 'DAN'-prompts. Op platforms zoals github.com zijn repositories te vinden die zich richten op het verspreiden van jailbreak-instructies om de ingebouwde restricties van AI-assistenten te neutraliseren. HiveTraceGuard-Pro is bedoeld om precies dit type adversariële aanvallen systematisch te herkennen.
Technische architectuur en training
Het model is gebaseerd op een LoRA-tuning van Qwen3-0.6B en beschikt over 0,6 miljard parameters. Het is getraind om inputs in zowel het Engels als het Russisch te analyseren en te voorzien van een binaire score: 'veilig' of 'onveilig'.
Om de robuustheid tegen versluiering (obfuscatie) te verhogen, heeft het onderzoeksteam een specifieke trainingsmethode gehanteerd. Hierbij werden schadelijke voorbeelden gekoppeld aan onschadelijke data uit hetzelfde domein, waarbij acht verschillende transformaties werden toegepast. Volgens een publicatie op arxiv.org was dit noodzakelijk omdat er tot nu toe een gebrek was aan wetenschappelijk bewijs en onderzoek naar prompt-injecties en oppervlakkige versluiering specifiek voor de Russische taal.
Prestaties en benchmarks
In een uitgebreide testomgeving is HiveTraceGuard-Pro vergeleken met 34 andere beveiligingsmodellen over 19 benchmarkgroepen. Uit de blijkt dat het model een geaggregeerde score van 0,7432 behaalde. Op de zestien publiek toegankelijke benchmarkgroepen scoorde het model 0,7153, waarmee het slechts door vier andere modellen werd overtroffen.
De resultaten voor de Russische taal zijn bijzonder sterk. In een vergelijking met vijftien modellen behaalde HiveTraceGuard-Pro de hoogste 'clean Russian robustness combined-F1' met een score van 0,88. Daarnaast werd een recall van 0,999 gerapporteerd voor Russische prompt-injecties. De onderzoekers merken hierbij wel op dat er een overlap van ten minste 27,1% bestaat tussen de trainingsset en de evaluatieset voor deze injecties.
Efficiëntie en beschikbaarheid
Naast de nauwkeurigheid onderscheidt het model zich door zijn snelheid. Met een mediane latentie van 14,3 milliseconden was het de snelste van de vijftien geteste modellen tijdens de betreffende run. De foutmarges over de gehele suite werden vastgesteld op een False Positive Rate (FPR) van 0,268 en een False Negative Rate (FNR) van 0,156.
De ontwikkelaars hebben de samengevoegde gewichten van het model publiekelijk vrijgegeven via Hugging Face onder de Apache-2.0 licentie. Echter, de specifieke code, de evaluatiesets en de gebruikte trainingscorpus blijven intern eigendom van het team, zoals vermeld in de .