⚠️ KMI waarschuwing: Onweer in België Laatste update van KMI waarschuwingen voor België. KMI ↗ Kaart ↗ Artikel →
← Terug
LAION introduceert LAION-BVD: Open dataset met 10 miljoen uur aan videomateriaal

LAION introduceert LAION-BVD: Open dataset met 10 miljoen uur aan videomateriaal

Een internationaal onderzoeksteam heeft LAION-BVD gelanceerd, een grootschalige open dataset die is ontworpen voor multimodale pre-training. De collectie bevat 80 miljoen video's met een totale duur van 10 miljoen uur, wat een aanzienlijke uitbreiding betekent voor de publiek toegankelijke data voor AI-onderzoek.

De dataset is ontwikkeld om het trainen van modellen over verschillende modaliteiten — video, audio en beeld — te faciliteren. Volgens een publicatie op arxiv.org is de basis van LAION-BVD een verzameling van 1,3 miljard platformspecifieke video-URL's die zijn verzameld via CommonCrawl. Vanuit deze enorme hoeveelheid links zijn uiteindelijk 80 miljoen video's succesvol gedownload.

Methodiek en synthetische bijschriften

Om de data bruikbaar te maken voor machine learning, hebben de onderzoekers gebruikgemaakt van content-bewuste scènedetectie. Hiermee zijn specifieke clips uit de langere video's geëxtraheerd. Voor deze clips zijn vervolgens synthetische bijschriften gegenereerd voor zowel het visuele aspect als het audioportie.

Volgens een analyse van paperiunet stelt deze aanpak modellen in staat om effectiever te leren van de interactie tussen beelden en geluid. De resultaten laten zien dat modellen die op deze data zijn getraind, concurrerende prestaties leveren op standaard benchmarks voor video-tekst en audio-tekst koppelingen. Bovendien is er een consistente verbetering zichtbaar naarmate de schaal van het model of de trainingsduur toeneemt.

Alternatieve bron voor beeldata

Naast de video- en audioclips hebben de auteurs van het onderzoek ook gekeken naar het gebruik van individuele videoframes. Door frames te extraheren op momenten dat er een scèneverandering plaatsvindt, is een alternatieve bron voor beeld-tekstdata gecreëerd.

Zoals vermeld in de arxivtldr.org, vertonen deze frames een visuele distributie die wezenlijk verschilt van standaard corpora van webafbeeldingen. Modellen die met deze specifieke frames zijn getraind, vertonen sterke prestaties bij het terugvinden van afbeeldingen op basis van tekstuele beschrijvingen.

Democratisering van AI-onderzoek

De release van LAION-BVD wordt gezien als een belangrijke stap in het democratiseren van multimodale AI. In een bericht van aiweekly.co wordt benadrukt dat grote video-tekstcorpora die door commerciële AI-labs worden gebruikt, doorgaans niet publiekelijk beschikbaar zijn. Dit maakte grootschalige pre-training voor onafhankelijke onderzoekers voorheen vrijwel onmogelijk.

Een cruciaal aspect van deze release is de licentie. De dataset is beschikbaar onder de CC-BY-4.0 licentie, wat betekent dat het materiaal niet alleen voor academisch onderzoek, maar ook voor commerciële doeleinden mag worden gebruikt, mits er een correcte bronvermelding plaatsvindt.

Technische details en beschikbaarheid

Het project is een samenwerking tussen diverse onderzoekers, waaronder Andreas Hochlehnert, Marianna Nezhurina en Christoph Schuhmann. De dataset is bedoeld om de kloof in datavolume en modaliteitsuitlijning in multimodale leerprocessen te overbruggen. Volgens een samenvatting op Hakky Handbook helpt de dataset bij het oplossen van bottlenecks waarbij het simpelweg uitbreiden van beeld-tekstparen naar video's vaak te kostbaar en complex is.

De code en verdere details over de implementatie zijn beschikbaar gesteld via een publieke repository op GitHub onder de naam LAION-AI/bvd.

Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!