Onderzoekers hebben OntoBook ontwikkeld, een innovatieve methode die complexe medische structuren transformeert naar leesbare teksten om de prestaties van taalmodellen in de gezondheidszorg te verbeteren.
In een recent wetenschappelijk artikel, gepubliceerd via arxiv.org, presenteren Rian Touchent en Éric de la Clergerie van ALMAnaCH een nieuwe aanpak om encoder-gebaseerde taalmodellen effectiever te trainen voor medische toepassingen. De methode, genaamd OntoBook, richt zich op het overbruggen van de kloof tussen gestructureerde medische kennis (ontologieën) en de natuurlijke taal die AI-modellen gebruiken om informatie te verwerken.
Van grafieken naar tekst
Het kernprobleem dat OntoBook aanpakt, is dat medische kennis vaak is opgeslagen in strikte hiërarchische codes en grafieken, terwijl taalmodellen het best presteren op vloeiende tekst. De ontwikkelde methode werkt in drie specifieke fasen. Allereerst worden 'random walks' uitgevoerd door medische ontologiegrafieken. Hiermee worden de hiërarchische en causale relaties tussen verschillende medische codes in kaart gebracht.
In de tweede fase wordt een groot taalmodel (LLM) ingezet om deze technische wandelingen door de grafieken te herschrijven. De LLM transformeert de ruwe data naar vloeiende, proza-achtige teksten die lijken op hoofdstukken uit een medisch leerboek. In de laatste fase wordt deze synthetische tekst gebruikt om een specifiek model te trainen: ModernCamemBERT, een Franse encoder met 149 miljoen parameters.
Dubbele trainingsdoelstellingen
Volgens de is het model getraind met twee gelijktijdige doelstellingen op dezelfde dataset. Enerzijds wordt gebruikgemaakt van masked language modeling (MLM), waarbij het model ontbrekende woorden in een zin moet voorspellen. Anderzijds wordt het model getraind op het voorspellen van relaties tussen paren van medische codes.
Een cruciale ontdekking tijdens dit proces was de noodzaak van uitlijning tussen deze twee taken. De onderzoekers stelden vast dat wanneer de training 'misaligned' is — wat betekent dat elke taak verschillende data gebruikt — de prestaties van het model drastisch kelderen. In dergelijke gevallen werd een degradatie van maar liefst 30 punten waargenomen, wat onderstreept dat de synergie tussen tekstbegrip en relationele kennis essentieel is.
Significante verbeteringen in benchmarks
De effectiviteit van OntoBook is getest op drie Franse benchmarks voor medische codering: FRACCO, Cantemist-FR en Distemist-FR. De resultaten tonen aan dat de methode aanzienlijk beter presteert dan traditionele pretraining die enkel op MLM vertrouwt. Zo behaalde het model een verbetering van +2,5 micro-F1 op de FRACCO-benchmark en een stijging van +8,0 micro-F1 op Distemist.
Om het onderzoek reproduceerbaar te maken en de medische AI-gemeenschap te ondersteunen, hebben de auteurs van een dataset vrijgegeven van 1,3 miljoen door LLM's geformuleerde medische leerboekteksten. Deze data zijn gebaseerd op drie prominente Franse ontologieën: CIM-10 (diagnoses), CCAM (medische handelingen) en ATC (anatomische, therapeutische en chemische classificatie van geneesmiddelen).
Context en presentatie
Het onderzoek is oorspronkelijk gepresenteerd tijdens de Proceedings of Knowledge Graphs and Large Language Models Workshop in mei 2026 in Palma de Mallorca, Spanje. De volledige details over de architectuur en de resultaten zijn beschikbaar via de , waar het werk is ingediend onder de categorie Kunstmatige Intelligentie (cs.AI). De releasedatum van de huidige versie van het document is 21 juli 2026.