De integratie van kunstmatige intelligentie in softwareontwikkeling heeft geleid tot de opkomst van 'vibe coding'. Bij deze werkwijze beschrijven programmeurs hun wensen in natuurlijke taal, waarna AI-tools de initiële code genereren. Hoewel dit de snelheid van ontwikkeling verhoogt, brengt het risico's met zich mee wanneer AI-gegenereerde database-queries zonder grondige menselijke controle worden geïmplementeerd.
Om dit probleem aan te pakken, hebben onderzoekers Muhammad Aziz Ullah en Abdul Serwadda een methode ontwikkeld waarbij een groep taalmodellen fungeert als een jury. In hun publicatie arxiv.org leggen zij uit hoe een systeem van unanieme goedkeuring kan helpen om de betrouwbaarheid van SQL-code te waarborgen. De focus van deze aanpak ligt op maximale veiligheid: het voorkomen van een foutieve acceptatie van code wordt beschouwd als belangrijker dan het onterecht afwijzen van correcte code.
Testmethode en selectieproces
Voor het valideren van deze methode voerden de auteurs een uitgebreide benchmark uit met 15 verschillende open modellen. Hierbij werden 82 diverse MySQL-taken gebruikt om tekstuele instructies om te zetten naar functionele queries. Op basis van een specifiek executieprotocol werden de zes best presterende modellen geïdentificeerd.
Met deze topmodellen werden commissies samengesteld van verschillende groottes, variërend van één tot zes leden. De regel binnen deze jury's is strikt: een SQL-query wordt pas goedgekeurd als elk individueel lid van de commissie, na analyse van de prompt, het databaseschema en de voorgestelde code, bevestigt dat de oplossing correct is. Volgens de details in de is deze unanieme benadering essentieel om de foutmarge te verkleinen.
Resultaten van het onderzoek
De analyse van de operationele kenmerken van deze AI-jury's leidde tot enkele belangrijke inzichten. Ten eerste bleek dat individuele modellen als enige beoordelaar inconsistent presteren. Ten tweede konden kleine commissies van sterke modellen het aantal 'false accepts' — waarbij foutieve code onterecht als correct wordt bestempeld — aanzienlijk verminderen, zonder dat dit ten koste ging van de acceptatie van kwalitatief goede queries.
Daarnaast stelden de onderzoekers vast dat de specifieke samenstelling van de jury een grote impact heeft op de uiteindelijke nauwkeurigheid. Om deze effectiviteit objectief te meten, maakten de auteurs gebruik van statistische instrumenten zoals de Youden J-index, de false positive rate en de true positive rate, zoals beschreven in het .
Bredere context van AI-agents
Deze wetenschappelijke ontwikkeling vindt plaats in een klimaat waarin AI-modellen evolueren van passieve tekstgeneratoren naar actieve agents die zelfstandig taken uitvoeren. Deze trend wordt ondersteund door commerciële innovaties. Zo heeft mistral.ai met hun 'Vibe' technologie coding agents ontwikkeld die direct in de terminal of IDE kunnen opereren om programmeurs bij complexe taken te ondersteunen.
Het onderzoek naar de AI-jury is ingediend bij de IEEE International Conference on Semantic Computing 2026. De conclusie van de auteurs is dat rigoureuze controlemechanismen onontbeerlijk zijn naarmate AI-systemen meer autonomie krijgen bij het beheren van kritieke database-operaties.