Een team onderzoekers heeft een innovatieve methode ontwikkeld om educatieve video's over natuurkunde te transformeren tot toegankelijke PDF-documenten. Deze aanpak is ontworpen om de toegankelijkheid van de content te vergroten, waarbij complexe wiskundige formules en visuele elementen worden omgezet in een formaat dat door ondersteunende technologieën kan worden geïnterpreteerd.
Het proces van het omzetten van video naar tekst is inherent complex, zeker wanneer het gaat om wetenschappelijke content waarbij visuele informatie vaak essentieel is voor het begrip. In een publicatie van 21 augustus 2026 beschrijven Craig W. Looney en Christopher L. Duston een geautomatiseerde workflow die gebruikmaakt van gratis beschikbare instrumenten. De kern van hun systeem is gebaseerd op het AI-model Google Gemini, dat via specifieke systeeminstructies wordt aangestuurd om video-inhoud direct te transcriberen naar LaTeX-code.
Een van de grootste uitdagingen bij natuurkundevideo's is de aanwezigheid van niet-verbale informatie, zoals formules op een whiteboard of digitale schermen. Volgens de wetenschappelijke publicatie op arxiv.org is het AI-model in staat om deze vergelijkingen te herkennen en ze naadloos in de tekstuele transcriptie te integreren. Naast de wiskundige taal beschrijft de AI ook grafieken, diagrammen en relevante interacties van de docent, waardoor de visuele context behouden blijft in het uiteindelijke document.
Voor het verkrijgen van een accuraat tekstueel verslag van audio- en videobestanden kunnen diverse tools worden ingezet, zoals de diensten van turboscribe.com, die gespecialiseerd zijn in het omzetten van spraak naar tekst. In de specifieke workflow van Looney en Duston wordt de LaTeX-output van de AI echter gecombineerd met een vooraf gedefinieerde 'preamble' die SE-tagging ondersteunt. De uiteindelijke PDF wordt gegenereerd via een LuaLaTeX-engine, wat essentieel is voor het voldoen aan internationale toegankelijkheidsnormen.
De technische validatie van deze methode is uitgebreid getest. In het rapport op wordt vermeld dat de transcripties consistent foutloos compileren. De resulterende documenten zijn succesvol getoetst aan de PDF/UA-2 en ISO 32005 standaarden met behulp van de software PDFix Desktop Lite (versie 3.2.0). Deze certificeringen garanderen dat schermlezers de inhoud correct kunnen reproduceren voor de eindgebruiker.
Om de adoptie van deze technologie in het onderwijs te stimuleren, hebben de auteurs hun ontwikkelingen openbaar gemaakt. Zij stellen niet alleen de volledige transcripties van hun testcases beschikbaar, maar ook de exacte systeeminstructies en de technische preamble. Hierdoor kunnen andere instellingen het framework overnemen of verder optimaliseren voor hun eigen behoeften.
Door de combinatie van geavanceerde AI en strikte typesetting-standaarden bieden de onderzoekers een betrouwbare oplossing voor een langlopend probleem in het wetenschappelijk onderwijs. De volledige details over de implementatie en de resultaten van de validatietests zijn te vinden in het document op , waar de nadruk ligt op het democratiseren van toegang tot complexe natuurkundige kennis. Voor wie zelf experimenteert met het omzetten van media naar tekst, bieden platforms zoals aanvullende mogelijkheden om audio-inhoud efficiënt te digitaliseren.