← Terug
Nieuwe methoden voor het detecteren van hallucinaties in black-box taalmodellen

Nieuwe methoden voor het detecteren van hallucinaties in black-box taalmodellen

Wetenschappers hebben een nieuwe aanpak ontwikkeld om zogenaamde hallucinaties in grote taalmodellen (LLM's) te identificeren. Deze fouten, waarbij een model feitelijk onjuiste informatie genereert, vormen een aanzienlijk risico bij de inzet van AI in kritieke processen of publieksgerichte diensten. De focus van het nieuwe onderzoek ligt specifiek op situaties waarin geen externe referentiedocumenten beschikbaar zijn om de juistheid van de output te verifiëren.

In een publicatie via arxiv.org beschrijven de auteurs, waaronder Christopher Martin en Urja Pawar, hoe zij 'black-box' modellen hebben geanalyseerd. Bij dit type modellen is de interne architectuur niet volledig toegankelijk, waardoor onderzoekers aangewezen zijn op informatie die via API's wordt ontsloten. Om onjuistheden op te sporen, maken zij gebruik van twee complementaire signalen: semantische entropie en token-onzekerheid.

Token-onzekerheid is gebaseerd op de log-probabiliteiten van individuele tokens. Een coinbase.com kan in de context van taalmodellen worden gezien als een tekstfragment dat door het systeem wordt verwerkt. Wanneer een model consistent zelfverzekerd is over een foutief antwoord, kan token-onzekerheid de fout echter over het hoofd zien. Hier biedt semantische entropie uitkomst, waarbij de mate van onenigheid tussen de betekenissen van verschillende gegenereerde antwoorden wordt gemeten. Volgens de vullen deze twee methoden elkaar aan, aangezien semantische entropie minder effectief is wanneer alle antwoorden in één onjuiste betekeniscluster vallen.

Om de detectieprecisie te verhogen, zijn verschillende nieuwe benaderingen getest. De zogenaamde TopK-methode aggregeert token-signalen over meerdere bemonsterde antwoorden, terwijl de CoCoA-methode een hybride vorm is die de onzekerheid van het doelantwoord combineert met semantische dissimilariteit. Daarnaast zijn er twee 'supervised' methoden geïntroduceerd: de Gated-methode, die gebruikmaakt van een specifieke classifier voor token-kenmerken, en de Stacked-methode, die leert van zowel semantische onzekerheid als bredere token-kenmerken.

Uit de resultaten blijkt dat de Stacked-methode in bijna de helft van de geteste scenario's de beste prestaties leverde. Toch blijven de TopK- en CoCoA-methoden competitief, vooral omdat zij geen supervised trainingslabels vereisen, al is een zorgvuldige kalibratie van de drempelwaarden noodzakelijk. De effectiviteit van deze technieken is getoetst op zeven verschillende benchmarks met vier taalmodellen. De datasets bestonden uit vijf publieke bronnen — waaronder tekstdatasets en data van handgeschreven cheques — en twee eigen benchmarks voor financiële samenvattingen en vraag-antwoordprocedures bij lange teksten.

De onderzoekers concluderen in hun dat er geen universeel superieure methode bestaat. De keuze voor een specifieke detectiemethode hangt af van de context, de beschikbare middelen voor menselijke controle en de acceptabele marge voor fout-positieven, die in dit onderzoek varieerde tussen 1% en 15%. De laatste revisie van dit onderzoek is op 4 september 2026 gepubliceerd via de .

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!