← Terug
Nieuw framework combineert LLM's met logica voor nauwkeuriger data-extractie

Nieuw framework combineert LLM's met logica voor nauwkeuriger data-extractie

Onderzoekers hebben een nieuwe methode ontwikkeld om de betrouwbaarheid van Large Language Models (LLM's) bij het extraheren van gegevens uit ongestructureerde teksten te verhogen. Door de generatieve kracht van LLM's te koppelen aan Answer Set Programming (ASP), een vorm van declaratieve logica, kunnen complexe redeneringen en globale consistentie beter worden gewaarborgd.

De beperkingen van huidige taalmodellen

Hoewel LLM's zeer effectief zijn in het verwerken van natuurlijke taal, kampen ze vaak met onbetrouwbaarheid bij taken die complex combinatorisch redeneren vereisen. Volgens een recent onderzoek gepubliceerd op arxiv.org blijken deze modellen onvoldoende in staat om globale consistentie te handhaven wanneer zij relationele feiten uit teksten moeten extraheren. Dit betekent dat de modellen weliswaar informatie kunnen vinden, maar deze informatie niet altijd logisch consistent weten te ordenen of te valideren.

De hybride aanpak: LLM en ASP

Het voorgestelde framework introduceert een synergie waarbij de LLM en ASP verschillende rollen vervullen. De LLM wordt ingezet voor het genereren van kandidaat-feiten op basis van de tekst, terwijl ASP fungeert als de controlerende laag. In dit proces voert ASP taken uit zoals validatie, inferentie en consistentiecontrole.

Een cruciaal verschil met bestaande systemen is de manier waarop de LLM wordt aangestuurd. In plaats van het model onafhankelijk te bevragen voor alle gewenste gegevens, gebruikt het nieuwe systeem ASP-redeneringen om te bepalen welke predicaten op een specifiek moment logisch toelaatbaar zijn. Hierdoor worden extractievragen gericht gestuurd. Door LLM-aanroepen af te wisselen met ASP-afleidingen kan het systeem feiten afleiden die logisch impliciet zijn, zonder dat daarvoor opnieuw een LLM-aanroep nodig is.

Efficiëntie en optimalisatie

Om de rekenkracht te optimaliseren, hebben de auteurs een caching-mechanisme geïntroduceerd voor logische controlevragen. Dit maakt gebruik van de monotonie van conjunctieve queries over incrementeel opgebouwde verzamelingen van feiten, wat het aantal benodigde solver-invocaties vermindert.

De onderzoekers, waaronder Mario Alviano en Fabrizio Lo Scudo van de Universiteit van Calabrië, stellen dat dit framework onder milde aannames gelijkwaardig is aan baseline-benaderingen wat betreft de uiteindelijke geëxtraheerde feiten, maar wel met aanzienlijk minder LLM-aanroepen. Experimenten op specifieke benchmarks tonen aan dat de kwaliteit van de extractie verbetert doordat foutieve of "spurious" outputs worden gemitigeerd.

Bredere context van neuro-symbolische AI

Deze ontwikkeling past in een bredere trend van neuro-symbolische AI, waarbij de statistische kracht van neurale netwerken wordt gecombineerd met de strikte regels van symbolische logica. Eerdere studies op arxiv.org hebben reeds aangetoond dat LLM's effectief kunnen helpen bij het genereren van Answer Set Programs zelf, mits er gebruik wordt gemaakt van zorgvuldig ontworpen prompts en in-context learning.

Daarnaast is er eerder onderzoek gedaan naar het koppelen van LLM's aan logische programmering voor robuustere redeneringen uit tekst. Zo is aangetoond in een studie via arxiv.org dat LLM's kunnen dienen als semantische parsers die natuurlijke taal omzetten in logische vormen. Deze combinatie bleek superieur in het oplossen van specifieke vraag-antwoordtaken en robotplanningstaken die een LLM alleen niet kon oplossen.

Publicatie en beschikbaarheid

Het onderzoek naar de logic-guided data extraction is gepresenteerd op de 42e International Conference on Logic Programming en zal verschijnen in de publicatie Theory and Practice of Logic Programming (TPLP). De volledige details en de formele onderbouwing van de pipeline zijn beschikbaar via de Cambridge University Press portal. Hoewel sommige academische platforms zoals researchgate.net soms beperkte toegang bieden, blijft de preprint via open-access repositories beschikbaar voor de wetenschappelijke gemeenschap.

Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!