← Terug
Nieuw framework VIA stelt AI-agenten in staat robots te besturen via visuele interface

Nieuw framework VIA stelt AI-agenten in staat robots te besturen via visuele interface

Wetenschappers hebben een innovatieve methode ontwikkeld waarmee algemene AI-modellen direct fysieke robotarmen kunnen aansturen. In plaats van het gebruik van complexe, robot-specifieke programmeercodes, maakt dit nieuwe systeem gebruik van een visuele interface om acties in de fysieke wereld uit te voeren. Het framework, dat bekend staat als de Visual Interface Agent (VIA), behandelt de besturing van robotica als een agent-taak, vergelijkbaar met hoe AI-modellen momenteel software bedienen.

De theoretische basis van dit systeem is beschreven in een wetenschappelijk document op arxiv.org, waarbij onderzoekers zoals Hengyuan Hu en Dorsa Sadigh uitleggen hoe fundatiemodellen (FMs) hun vaardigheid in het begrijpen van digitale interfaces kunnen toepassen op fysieke hardware. De kern van de benadering is dat moderne AI-modellen reeds zeer bekwaam zijn in het navigeren door visuele menu's en softwareomgevingen. Door de robotbesturing te vertalen naar een soortgelijke visuele werkruimte, kan de AI de robotarm bedienen zonder dat er nieuwe, specifieke training voor de hardware nodig is.

Binnen deze virtuele werkruimte kan de AI-agent interactieve visuele componenten gebruiken om relevante pixels te analyseren, vergelijkbaar met de werking van een computermuis. De agent stuurt een virtuele 'end-effector' aan om doelposities in te stellen via een beperkte set algemene instrumenten. Volgens de publicatie over de stelt dit de AI in staat om fysieke manipulaties uit te voeren op basis van visuele feedback in plaats van hardgecodeerde instructies.

De effectiviteit van het VIA-framework is uitvoerig getest in zowel gesimuleerde omgevingen als in de echte wereld. In simulaties voerden agenten diverse taken op een tafel uit, waarbij bleek dat de prestaties direct verbeterden naarmate het gebruikte fundatiemodel krachtiger werd. Ook op een fysieke, mobiele manipulatierobot werden succesvolle resultaten behaald bij taken die een combinatie van navigatie en fysieke handelingen vereisten. Een opvallend aspect van deze resultaten is dat er sprake was van 'zero-shot' uitvoering; de robot had geen voorafgaande training nodig en er hoefden geen specifieke actie-primitieven te worden ontwikkeld, zoals uiteengezet in het onderzoek op .

Deze doorbraak suggereert dat de beperking voor robotbesturing tot nu toe niet lag in de cognitieve capaciteiten van AI-agenten, maar in de interface tussen de software en de hardware. Terwijl softwareontwikkelingstools zoals visualstudio.com zich concentreren op het optimaliseren van AI voor het schrijven van code en digitale extensibiliteit, bewijst het VIA-onderzoek dat dezelfde logica van interface-interactie kan worden overgedragen naar fysieke machines.

De auteurs van het onderzoek, waaronder Satvik Sharma en Priya Sundaresan, concluderen dat een passende visuele interface de noodzakelijke brug slaat tussen digitale cognitie en fysieke uitvoering. Dit opent de deur naar een toekomst waarin algemene AI-modellen veel eenvoudiger kunnen worden ingezet voor complexe robotische taken, zonder dat elke individuele machine een eigen, intensief trainingsproces moet doorlopen. De meest recente versie van dit onderzoek is op 7 oktober 2026 bijgewerkt in de database van .

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!