← Terug
AutoData: AI-agent automatiseert selectie van trainingsdata voor taalmodellen

AutoData: AI-agent automatiseert selectie van trainingsdata voor taalmodellen

Onderzoekers hebben een nieuw systeem genaamd AutoData ontwikkeld dat gebruikmaakt van autonome agenten om de meest effectieve datasets voor het pre-trainen van grote taalmodellen (LLM's) te selecteren.

In de ontwikkeling van kunstmatige intelligentie is de kwaliteit van de trainingsdata cruciaal voor de uiteindelijke prestaties van een model. Tot op heden werd de selectie van deze data vaak handmatig beheerd door menselijke experts of via eenvoudige statistische methoden. Volgens een recent wetenschappelijk artikel dat op 17 september 2026 is gepubliceerd via arxiv.org, probeert het project AutoData dit proces te automatiseren door data-engineering te benaderen als een autonoom optimalisatieprobleem.

Van handmatige curatie naar agentic search

De kern van AutoData is het idee dat de selectie van pre-training data kan worden beschouwd als 'heuristic engineering'. Hierbij kijkt het systeem naar specifieke kenmerken per document, zoals lexicale statistieken, categorische labels en perplexiteit. Waar traditionele methoden vaak werken met vaste gewichten voor verschillende domeinen, gaat AutoData een stap verder door direct te zoeken naar uitvoerbare selectiealgoritmen.

De AI-agent in AutoData doorzoekt een uitgebreide ruimte van programma's die regels bevatten voor scoring, stratificatie en stochastische selectie. Door iteratief algoritmen te verfijnen op basis van feedback van een zogenaamd 'proxy-model', kan de agent automatisch ontdekken welke interacties tussen verschillende kenmerken van de data het meest effectief zijn.

Resultaten en schaalbaarheid

De effectiviteit van deze aanpak bleek tijdens de tests zeer groot. In een zoekproces dat slechts één nacht in beslag nam, slaagde AutoData erin een selectiealgoritme te ontdekken dat beter presteerde dan bestaande curatie-pipelines die door mensen waren ontworpen.

Een belangrijk aspect van het onderzoek is de overdraagbaarheid van de resultaten. Hoewel de optimalisatie plaatsvond op een klein proxy-model, bleek het gevonden 'recept' voor dataselectie ook op grotere schaal effectief te zijn. Dit leidde tot een verbetering van de downstream-metriek CORE, wat aantoont dat de door de agent gevonden strategieën robuust zijn.

Context van autonome machine learning

De ontwikkeling van AutoData past in een bredere trend waarbij LLM-agenten steeds vaker worden ingezet om machine learning engineering te automatiseren. Voorheen richtten dergelijke agenten zich vooral op het bewerken van modelarchitecturen of trainingscode op basis van feedback tijdens de uitvoering. De introductie van AutoData breidt dit autonome onderzoek uit naar de data-laag, waardoor ook de input van het model onderdeel wordt van de agentische optimalisatielus.

De auteurs van het onderzoek, waaronder Yan Meng, Dhruv Srikanth en Bingchen Zhao, suggereren dat data-engineering hiermee definitief kan worden behandeld als een agentisch machine learning-probleem.

Bronnen en verificatie

De technische details van dit systeem zijn vastgelegd in de publicatie , waarin de methodologie rondom de zoekruimte van programma's en de validatie via proxy-modellen wordt toegelicht. Hoewel er online diverse domeinen bestaan met gelijknamige termen, zoals auto-data.net (een catalogus voor voertuigspecificaties) of autodata-group.com, hebben deze geen relatie met het AI-onderzoek naar dataselectie. De informatie over AutoData is uitsluitend gebaseerd op de wetenschappelijke indiening bij .

Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!