Een team van onderzoekers heeft Qwen-Drive-1.0 gepresenteerd, een nieuw visueel-talig basismodel dat specifiek is ontwikkeld voor autonome rijfuncties. Het model probeert complexe taken zoals 3D-perceptie, visuele vraagbeantwoording en bewegingsplanning te integreren in één enkel framework. Volgens een publicatie op arxiv.org vormt dit project een eerste stap naar een fundamenteel model dat zowel visuele informatie als taal begrijpt om voertuigen veiliger en intelligenter te laten navigeren.
Geïntegreerde architectuur en 3D-perceptie
Qwen-Drive-1.0 behoudt de basisstructuur van een vooraf getraind visueel-taalmodel (VLM), maar voegt gespecialiseerde componenten toe voor de verkeersomgeving. Een cruciaal onderdeel hiervan is de externe 'bird's-eye-view' (BEV) perceptie-head. Deze component stelt het systeem in staat om gelijktijdig 3D-objectdetectie uit te voeren, semantische bezettingsvoorspellingen te doen en BEV-kaarten te segmenteren.
Deze BEV-interface fungeert als een sonde die de 3D-informatie uit de gedeelde representaties van het model haalt. Hierdoor ontstaat een inspecteerbare interface die inzichtelijk maakt hoe het model de structuur van de 3D-scène interpreteert. Naast deze waarneming bevat het systeem een zogenaamde 'Planning Expert'. Deze module maakt gebruik van de gedeelde VLM-representaties om toekomstige trajecten voor het voertuig te genereren.
Trainingsmethode en prestaties
Om de specifieke vaardigheden voor het rijden aan te leren zonder de algemene intelligentie van het model te verliezen, is er gekozen voor een getrapsde trainingsmethode. Hierbij wordt rij-specifieke supervisie gecombineerd met algemene visueel-talige data. Dit zorgt ervoor dat het model competent wordt in het begrijpen van verkeerssituaties, terwijl het vermogen om instructies op te volgen en brede visuele concepten te begrijpen behouden blijft.
Uit experimenten blijkt dat Qwen-Drive-1.0 sterke prestaties levert in 3D-perceptie en het begrijpen van rijscènes. De evaluaties, die zijn uitgevoerd in open-loop, pseudo-closed-loop en closed-loop omgevingen, tonen aan dat het model zeer competitief is in bewegingsplanning.
Context van de Qwen-familie
Qwen-Drive-1.0 is onderdeel van een bredere ontwikkeling van AI-modellen door het Qwen-team van Alibaba Cloud. De organisatie, die actief is op platforms zoals huggingface.co, richt zich op het continu uitbrengen van grote taalmodellen (LLM) en multimodale modellen (LMM).
De technologische basis van dergelijke projecten rust vaak op eerdere iteraties. Zo is onlangs de Qwen 3.8-serie geïntroduceerd, waarbij de openlai versie tot 2,4 biljoen parameters schaalt voor complexe taken in onderzoek en codering. Daarnaast is er de Qwen3.8-Flash-Next, een multimodale MoE-model dat dient als voorbode voor de architectuur van Qwen4. Deze modellen leggen de nadruk op autonome planning en betere interactie met omgevingsfeedback, wat direct aansluit bij de behoeften van systemen zoals Qwen-Drive.
De bredere toegankelijkheid van deze technologie wordt ondersteund door open-source initiatieven. De ontwikkeling van de Qwen-serie wordt nauwgezet gevolgd op github.com, waar de community toegang heeft tot de implementaties van de taalmodellen. Voor Qwen-Drive-1.0 is in de wetenschappelijke publicatie aangegeven dat de bijbehorende code beschikbaar zal worden gesteld.