Een nieuw onderzoeksmodel genaamd BatchDAG probeert de beperkingen van Large Language Models (LLM's) bij het analyseren van enorme bedrijfsdatasets op te lossen door gebruik te maken van dynamische executiegrafieken.
Large Language Models zijn zeer effectief in het analyseren van individuele documenten, maar lopen vaak vast bij complexe vragen die gegevens over meerdere entiteiten in grote datasets vereisen. Volgens een recent onderzoek gepubliceerd op arxiv.org leiden deze uitdagingen vaak tot context-overflow, het verlies van toeschrijving per entiteit en een trage reactietijd door opeenvolgende tool-aanroepen. Om dit te verhelpen, introduceert onderzoeker Anupreet Walia het systeem BatchDAG.
Van sequentiële acties naar executiegrafieken
BatchDAG verschilt van traditionele AI-agenten door de manier waarop taken worden gepland. In plaats van stap voor stap acties uit te voeren, genereert het LLM een zogenaamde 'typed directed acyclic graph' (DAG). Dit is in feite een blauwdruk van operaties die in een specifieke volgorde moeten worden uitgevoerd. Deze operaties kunnen variëren van SQL-queries en semantische zoekopdrachten tot in-memory transformaties en parallelle fan-outs.
Een deterministische engine voert deze grafiek vervolgens uit met behulp van topologische-wave parallellisme en een gestructureerde JSON-datastroom. Een cruciaal onderdeel van dit proces is 'entity-aware batching'. Hierbij worden rijen gegroepeerd per logische entiteit voordat ze worden verwerkt, wat volgens de publicatie op het aantal benodigde LLM-aanroepen met wel 47 keer kan verminderen.
Prestaties en nauwkeurigheid
Het doel van BatchDAG is niet zozeer om de nauwkeurigheid van handmatig geoptimaliseerde pijplijnen te overtreffen, maar om te dienen als een algemene orchestratielaag. Het systeem vervangt meerdere handmatige workflows door één enkel systeem dat op basis van natuurlijke taal de juiste uitvoerstrategie bepaalt.
In gecontroleerde experimenten met twaalf queries op transcript-zware data behaalde BatchDAG een kwaliteitsscore van 3,74 op 5. Ter vergelijking: een door experts ontworpen pijplijn scoorde 3,25 en een ReAct-agent scoorde 3,09. Daarnaast vertoonde BatchDAG een superieure herleidbaarheid; 77% van de resultaten kon worden onderbouwd met bewijs uit de transcripten, tegenover 46% tot 60% bij de baselines, zoals beschreven in het document op .
Reductie van hallucinaties en kosten
Een belangrijk aspect van het onderzoek is de impact van datastructuren op de betrouwbaarheid van de AI. Uit een ablatie-studie blijkt dat het gebruik van gestructureerde JSON-tussenstappen hallucinaties met 27% vermindert in vergelijking met het gebruik van proza-samenvattingen. De planner zelf is zeer stabiel, met een validatiegraad van 98,8% over 300 planningsaanroepen, meldt de auteur via .
In een productieomgeving is BatchDAG in staat om queries over meer dan 50.000 vergaderingen te verwerken in minder dan 60 seconden. De kosten per query liggen, gebaseerd op de prijzen van GPT-5.1, tussen de $0,02 en $0,24.
Conclusie over schaalbaarheid
BatchDAG biedt een schaalbare oplossing voor ad-hoc analyses binnen ondernemingen. Door de planning los te koppelen van de uitvoering en gebruik te maken van parallelle verwerking, omzeilt het systeem de lineaire latentie die vaak gepaard gaat met traditionele AI-agenten. De volledige details van de methodologie en de resultaten zijn beschikbaar in de wetenschappelijke publicatie op .