Jina AI heeft jina-vlm gelanceerd, een compact vision-language model (VLM) met 2,4 miljard parameters. Het model is specifiek ontwikkeld voor meertalige visuele vraag-antwoordtaken (VQA) en claimt een leidende positie in te nemen onder de open modellen van vergelijkbare schaal.
Architectuur en technische specificaties
Het model is opgebouwd uit een combinatie van een SigLIP2-So400M vision encoder, bestaande uit 449 miljoen parameters, en een Qwen3-1.7B language backbone. Deze twee componenten zijn verbonden via een zogenaamde attention-pooling connector. Volgens informatie van jina.ai zorgt deze connector ervoor dat het aantal visuele tokens met een factor vier wordt verminderd, terwijl de ruimtelijke informatie behouden blijft.
Om afbeeldingen van willekeurige resolutie tot maximaal 4K te kunnen verwerken, maakt jina-vlm gebruik van image tiling. Hierbij worden twaalf overlappende tegels gecombineerd met een globale thumbnail. Deze aanpak maakt het model token-efficiënt bij het analyseren van complexe visuele data.
Prestaties en benchmarks
In vergelijking met andere open 2B-scale modellen presteert jina-vlm sterk op diverse benchmarks. In de resultaten van de MMMB-benchmark scoort het model hoger dan concurrenten zoals Qwen2-VL-2B, Qwen3-VL-2B en verschillende versies van InternVL3. Specifiek behaalt jina-vlm een gemiddelde score van 72,3 op VQA en 78,8 op MMMB, zoals vermeld in de technische documentatie op .
Een belangrijk kenmerk van het model is de meertaligheid. Het is getraind op data in 29 verschillende talen en biedt ondersteuning voor in totaal 93 talen. De trainingsset bestond uit ongeveer 5 miljoen multimodale samples en 12 miljard teksttokens. Ongeveer de helft van deze data is Engelstalig, terwijl de rest is verdeeld over talen met een hoge en gemiddelde beschikbaarheid van bronnen, waaronder Arabisch, Chinees, Duits en Spaans.
Wetenschappelijke onderbouwing en open source
De ontwikkeling van het model is gedocumenteerd in een wetenschappelijk artikel dat is ingediend bij arxiv.org. In dit onderzoek is onder andere een 'leave-one-out' data mixture ablation study uitgevoerd. Hierbij zijn systematisch verschillende categorieën van taken, domeinen, modaliteiten en talen verwijderd om te bepalen welke datatypes essentieel zijn en welke redundant zijn.
Het project is daarnaast gepresenteerd tijdens de ICLR 2026 conferentie, specifiek binnen de context van de 3e Workshop on Navigating and Addressing Data Problems For Foundation Models (DATA-FM), zoals aangegeven op iclr.cc.
Om de democratisering van kunstmatige intelligentie te bevorderen, heeft Jina AI de modelgewichten en de bijbehorende code publiekelijk beschikbaar gesteld. Gebruikers kunnen het model downloaden via het platform huggingface.co. Dankzij de compacte omvang van 2,4 miljard parameters is het model efficiënt genoeg om te draaien op consumentenhardware, inclusief ondersteuning voor Apple Silicon via MLX.
Integratie en beschikbaarheid
Naast de open-source release is jina-vlm beschikbaar via de Jina API. De technologie van Jina AI is inmiddels geïntegreerd binnen het ecosysteem van elastic.co, waardoor hun modellen voor embeddings en rerankers, samen met de nieuwe VLM-capaciteiten, kunnen worden ingezet binnen Elasticsearch voor geavanceerde zoektoepassingen en context engineering.