← Terug
Lichtgewicht AI-modellen bieden alternatief voor commerciële OCR-systemen in erfgoedsector

Lichtgewicht AI-modellen bieden alternatief voor commerciële OCR-systemen in erfgoedsector

Onderzoekers hebben aangetoond dat compacte, open-source Vision-Language Models (VLMs) een krachtig en privacyvriendelijk alternatief vormen voor omvangrijke commerciële AI-systemen bij de digitalisering van historische documenten. In een wetenschappelijke publicatie van 8 oktober 2026 presenteren Uddipan Basu Bir en zijn team een methode om documentafbeeldingen efficiënt om te zetten in gestructureerde data.

Het onderzoek, getiteld "From Pixels to Structure", richt zich op de specifieke problematiek binnen erfgoedcollecties en institutionele archieven. In deze sector blijkt traditionele Optical Character Recognition (OCR) vaak ontoereikend wanneer er sprake is van complexe lay-outs of historisch handschrift. Volgens de publicatie op arxiv.org ervaren veel instellingen knelpunten bij het gebruik van gesloten, massale AI-modellen. De afhankelijkheid van commerciële API's roept vragen op over de autonomie van data, brengt terugkerende kosten met zich mee en zorgt voor een grote ecologische impact door het extreme rekenvermogen van hyperscale computing. Dit is extra problematisch bij documenten met domeinspecifieke termen over onderwerpen zoals prehistorie, architectuur of juwelen.

Om een oplossing te vinden, voerden de onderzoekers een vergelijkende analyse uit met acht open-source VLMs die maximaal 7 miljard parameters bevatten. Het doel was om tekst uit beelden te extraheren en deze direct te transformeren naar schema-conforme JSON-bestanden, wat automatische validatie van de data mogelijk maakt. De kwaliteit van deze modellen werd getoetst via verschillende scenario's, waaronder zero-shot, few-shot en fine-tuning. Hierbij werden specifieke meetwaarden gehanteerd, zoals de Character Error Rate (CER) en de mean Average Precision F1 (mAP-F1). Ook werd onderzocht in hoeverre klassieke beeldverwerking, zoals belichtingscorrectie en ruisonderdrukking, de resultaten beïnvloedde.

De studie concludeert dat zorgvuldig geoptimaliseerde modellen met een beperkt aantal parameters een duurzaam en privaat alternatief bieden voor handmatige transcriptie of de zogenaamde "black-box" systemen van commerciële aanbieders. De resultaten bieden concrete richtlijnen voor erfgoedinstellingen die hun eigen OCR-to-JSON extractie willen beheren zonder tussenkomst van externe cloudproviders.

Deze ontwikkelingen passen in een bredere trend van AI-onderzoek in België. Zo worden er aan de Universiteit van Namur conferenties georganiseerd zoals de unamur.be, waar experts als Decebal Mocanu en Anna Rogers spreken over deep learning en vertrouwenwaardige AI. Ook andere academische centra dragen bij aan deze technologische groei. Aan de kuleuven.be richt de ACRO-onderzoeksgroep zich bijvoorbeeld op geavanceerde robotperceptie en 6D-objectpose-estimatie voor logistieke toepassingen.

Om deze complexe technologieën te beheersen, is er een groeiende behoefte aan gespecialiseerde opleidingen. De vub.be biedt in dat kader een Master in Computerwetenschappen met een specifieke focus op artificiële intelligentie.

Het onderzoek naar lichtgewicht VLMs is officieel gepubliceerd in de context van de Document Analysis and Recognition - ICDAR 2026 en is opgenomen in de LNCS-reeks van Springer. De auteurs stellen dat joint training over diverse datasets ervoor zorgt dat één enkel model effectief kan opereren over verschillende collecties heen, hoewel dit incidenteel kan leiden tot prestatieverschillen per specifieke dataset.

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!