Een nieuw AI-model genaamd Jina-OCR-v1 is ontwikkeld om complexe documenten snel en nauwkeurig te analyseren, waarbij specifiek is ingezet op optimalisatie voor grafische kaarten met een beperkt budget.
Onderzoekers hebben Jina-OCR-v1 gepresenteerd, een end-to-end model voor documentparsing dat is ontworpen om toegankelijk te zijn voor gebruikers zonder high-end hardware. Het model combineert geavanceerde architecturale keuzes om een balans te vinden tussen snelheid, nauwkeurigheid en rekenkracht. Volgens een publicatie op arxiv.org is het model specifiek gebouwd om te kunnen draaien op zogenaamde 'low-budget GPUs'.
Architectuur en technische samenstelling
De technische basis van Jina-OCR-v1 rust op een combinatie van bestaande technologieën en nieuwe optimalisaties. Het model maakt gebruik van een compressed-vision encoder en een mixture-of-experts (MoE) decoder van 3 miljard parameters, afkomstig van DeepSeek-OCR. Een kenmerk van deze MoE-structuur is dat er per token slechts ongeveer 570 miljoen parameters worden geactiveerd, wat bijdraagt aan de efficiëntie van het systeem.
Om de verwerkingssnelheid verder te verhogen, is het model uitgerust met een FastMTP-speculatieve decoding-head. Deze technologie maakt het mogelijk om een enkel draft-blok recursief over drie voorspellingsstappen te delen. De onderzoekers stellen in hun dat het gebruik van 'greedy verification' ervoor zorgt dat het decodingsproces verliesvrij blijft, wat betekent dat de snelheidswinst niet ten koste gaat van de accuratesse.
Training en optimalisatie
Het trainingsproces van Jina-OCR-v1 is opgebouwd uit verschillende fasen om de robuustheid van het model te vergroten. De post-training omvat onder meer instructie-uitlijning en specifieke fine-tuning op basis van uitdagende documenten. Daarnaast is er gebruikgemaakt van Group Relative Policy Optimization (GRPO) onder 'dense verifiable rewards'. Hierbij worden deterministische controles uitgevoerd op structuren, tabellen en formules, waarbij het model gedeeltelijke credits ontvangt voor correcte elementen.
Voor de dataset is gekozen voor een mix van geschoonde publieke corpora en specifiek gegenereerde synthetische pagina's. Deze aanpak helpt het model om beter om te gaan met diverse lay-outs en complexe visuele informatie in documenten.
Prestaties en benchmarks
In tests heeft Jina-OCR-v1 sterke resultaten laten zien op erkende benchmarks. Bij de standaardinstelling voor dynamische resolutie behaalde het model een score van 91,14 op OmniDocBench v1.6 en 83,4 op olmOCR-Bench.
Wat betreft de snelheid presteert het model opvallend goed in vergelijking met andere systemen. De hoogste pagina-doorvoer die in de vergelijking werd bereikt, bedroeg 2,57 pagina's per seconde. De praktische impact hiervan is duidelijk zichtbaar op toegankelijke hardware; zo verdubbelt de FastMTP-technologie de decodingsnelheid op een NVIDIA L4 GPU ten opzichte van standaard greedy autoregressive decoding, zoals beschreven in de .
Beschikbaarheid
Het model is publiekelijk beschikbaar gesteld om breder gebruik en evaluatie mogelijk te maken. De ontwikkeling is gelinkt aan github.com, een organisatie die zich richt op het superchargen van zoekfundamenten. Hoewel de technische details uitgebreid zijn beschreven in de , is de implementatie gericht op een brede toegankelijkheid voor ontwikkelaars en bedrijven die geen toegang hebben tot enorme compute-clusters.