In de sector van live e-commerce is de snelheid waarmee digitale AI-avatars kunnen reageren op consumenten en veranderende zakelijke richtlijnen van cruciaal belang. Een team van onderzoekers van TaoLive heeft een nieuwe technische aanpak ontwikkeld om deze interacties te optimaliseren. Het doel is om avatars te creëren die niet alleen feitelijk correcte antwoorden geven, maar ook flexibel genoeg zijn om direct aan te passen aan nieuwe campagnes of wettelijke regels.
Volgens een arxiv.org kampen huidige AI-agenten vaak met een conflict tussen reactiesnelheid en aanpassingsvermogen. Terwijl grote 'zero-shot' modellen vaak te traag zijn voor live-interacties, hebben kleinere, specifiek getrainde modellen de neiging om vaste patronen en templates te memoriseren. Dit maakt ze minder effectief wanneer de externe configuratie of de instructies plotseling wijzigen.
Om dit probleem aan te pakken, heeft het team een systeem genaamd 'Harness' geïntroduceerd. Deze architectuur scheidt de specifieke vaardigheden, tools en systeem-prompts van de eigenlijke modelgewichten. Hierdoor kan het gedrag van een avatar tijdens de uitvoering worden aangepast zonder dat het onderliggende model opnieuw getraind moet worden. In de context van taalgebruik is het essentieel dat dergelijke systemen accuraat communiceren, waarbij termen zoals 'flexibiliteit' in een technische context duiden op het vermogen om zich aan te passen aan nieuwe omstandigheden, een concept dat ook in cambridge.org wordt beschreven.
Een kernonderdeel van deze innovatie is de zogenaamde Harness-Aware Training (HAT). Deze methode zorgt ervoor dat de status van het Harness wordt opgenomen in de trainingsdistributie. Zoals beschreven in de , maakt HAT gebruik van Harness-State Augmentation (HSA). Hierbij worden variaties in prompt-structuren en interactiebeperkingen toegepast tijdens de training. Dit proces verloopt in drie fasen: supervised fine-tuning, algemene on-policy distillatie en agentic reinforcement learning in een simulator die echte live-scenario's nabootst.
De resultaten van deze aanpak zijn veelbelovend. Bij tests met meer dan 4.500 casussen presteerde een compact model van 35 miljard parameters superieur in specifieke scenario's. Bij vragen en antwoorden tijdens live-streams behaalde dit model een score van 94,8, wat hoger is dan de score van 80,3 van het basismodel en de 93,0 van het sterkste algemene taalmodel dat werd geëvalueerd. Ook bij wijzigingen in het Harness bleef het model stabiel met een score van 94,6.
Naast de nauwkeurigheid is de latentie, oftewel de vertraging in de reactietijd, een kritieke factor. In tests op een NVIDIA H20 GPU met Multi-Token Prediction (MTP) bereikte het systeem een P50-latentie van 3,407 seconden en een P95-latentie van 8,114 seconden. Dit bewijst dat compacte agenten effectief kunnen blijven bij configuratiewijzigingen zonder dat dit ten koste gaat van het vermogen om instructies te volgen.
Het onderzoek, dat op 16 augustus 2026 werd ingediend door auteurs zoals Yuhan Sun, Wenhao Lin en Yongdong Luo, biedt een concrete oplossing voor de commerciële sector om AI-interacties te optimaliseren. Meer technische details over de implementatie van deze methode zijn beschikbaar in het volledige .