← Terug
Nieuwe methode verbetert betrouwbaarheid van AI door beweringen per stuk te toetsen

Nieuwe methode verbetert betrouwbaarheid van AI door beweringen per stuk te toetsen

Wetenschappers hebben een innovatieve benadering ontwikkeld om de accuraatheid van Large Language Models (LLM's) te verbeteren. De nieuwe methode richt zich op het nauwkeuriger detecteren van fouten in AI-gegenereerde teksten door de zekerheid van het model niet langer voor het gehele antwoord te bepalen, maar specifiek per individuele bewering.

In een wetenschappelijke publicatie van 23 augustus 2026 beschrijven Toghrul Abbasli en zijn team een framework voor zogenaamde 'claim-level confidence calibration'. Dit onderzoek pakt het probleem van hallucinaties aan, waarbij AI-modellen feitelijk onjuiste informatie presenteren met een overtuigende mate van zelfvertrouwen. Volgens de publicatie op arxiv.org is de gangbare praktijk om betrouwbaarheid op responsniveau te meten te onnauwkeurig. Omdat een enkel antwoord vaak een mengeling is van correcte en incorrecte feiten, biedt een algemene score onvoldoende houvast voor gebruikers die specifieke informatie willen verifiëren.

Analyse op atomair niveau

De voorgestelde oplossing draait om de decompositie van antwoorden. Een volledige tekst wordt opgesplitst in 'atomaire, verifieerbare claims'. Elke bewering krijgt vervolgens een eigen gekalibreerde score voor betrouwbaarheid. Hierbij wordt gebruikgemaakt van technieken tijdens de inferentiefase, waaronder zelfverificatie door het model en de consistentie tussen verschillende gegenereerde samples.

Een cruciaal aspect van dit systeem is de 'closed-box' uitvoering. Dit houdt in dat er geen toegang nodig is tot de interne logits van het model en dat er geen aanvullende training of fine-tuning vereist is. De kalibratie vindt achteraf plaats. Dit stelt systemen in staat om beweringen met een lage score automatisch te markeren voor menselijke controle of te koppelen aan externe bewijsvoering. De bredere werking van deze ibcom is gebaseerd op het voorspellen van tokens, waarbij het begrijpen van onzekerheid essentieel is voor de betrouwbaarheid.

Resultaten en modeltesten

Om de effectiviteit van het framework te valideren, hebben de onderzoekers zeven baselines getest op zes verschillende taalmodellen. Hierbij werden onder andere GPT-4, GPT-4o, Llama-3.1, Mistral, Qwen2.5 en DeepSeek-R1 gebruikt. De evaluatie vond plaats met de datasets TruthfulQA en TriviaQA.

Uit de resultaten blijkt dat de combinatie van post-hoc kalibratie en decompositie op beweringsniveau de 'expected calibration error' bij feitelijke vragen significant verlaagt. De methode legde juist faalmodi bloot bij vragen met een onjuiste premisse, waarbij besluitvormers juist een precieze schatting van de onzekerheid nodig hebben om misleiding door de AI te voorkomen. De details van deze statistische resultaten zijn opgenomen in het document op .

Veiligheid en context

De behoefte aan dergelijke precisie neemt toe naarmate LLM's vaker worden ingezet in risicovolle omgevingen. Zo benadrukt dat onzekerheidskwantificering en de balans tussen bias en variantie fundamenteel zijn voor de ontwikkeling van veilige systemen. Gezien de stijging van AI-gestuurde aanvallen is het vermogen van een model om eigen onzekerheid correct aan te geven niet enkel een technische optimalisatie, maar een noodzakelijke veiligheidsmaatregel.

Het onderzoek werd gepresenteerd tijdens de 5e Workshop on Uncertainty Reasoning and Quantification in Decision Making in Jeju, Korea, in samenwerking met ACM SIGKDD 2026. De volledige technische implementatie is raadpleegbaar via .

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!