← Terug
AI-gestuurde evaluatie van praktische vaardigheden maakt constructieve toetsing schaalbaar

AI-gestuurde evaluatie van praktische vaardigheden maakt constructieve toetsing schaalbaar

Het beoordelen van het praktische inzicht van studenten is van oudsher een tijdrovende klus voor docenten. Vooral bij constructieve toetsvormen, waarbij studenten fouten in complexe scenario's moeten opsporen en onderbouwen, is de werklast hoog. Een recent onderzoek van Satoshi Takahashi en zijn team, gepubliceerd op 22 september 2026, stelt voor om dit proces te stroomlijnen door middel van geavanceerde prompt-technieken en grote taalmodellen (LLM's).

Centraal in dit onderzoek staat het concept van 'Hierarchical Diagnostic Reasoning' (HDR). Dit is een specifieke methode om hogere cognitieve vermogens te toetsen. Hierbij krijgen studenten casestudy's voorgelegd waarin bewuste fouten zijn verwerkt; de opdracht is om deze onjuistheden te identificeren en met argumenten te onderbouwen. Hoewel deze aanpak zeer effectief is om praktische competenties te meten, vergt het creëren van dergelijke casussen en de daaropvolgende correctie veel expertise en tijd.

Om dit proces schaalbaar te maken, hebben de onderzoekers een systeem ontwikkeld dat drie kernfasen automatiseert. Volgens een publicatie op arxiv.org gaat het hierbij om het genereren van casusvragen die nauw aansluiten bij de leerdoelen, het scoren van de open antwoorden van studenten en het formuleren van gestructureerde feedback op basis van de gemaakte fouten.

Een belangrijk resultaat van de studie is dat deze automatisering is bereikt zonder dat het taalmodel specifiek getraind of gefinetuned hoefde te worden; de resultaten zijn puur het gevolg van zorgvuldig geformuleerde prompts. De validiteit van de gegenereerde opdrachten werd getoetst via de scoreverdeling en de Cronbach's alpha, die op 0,78 uitkwam. Dit duidt op een sterke interne consistentie van de methode. De betrouwbaarheid van de AI-beoordeling was in sommige scenario's zelfs optimaal, met een overeenstemming van 100% tussen de automatische scores en de oordelen van menselijke experts. Bovendien gaven studenten aan dat de door AI gegenereerde feedback net zo nuttig en overtuigend was als die van menselijke instructeurs, zoals beschreven in het .

De auteurs stellen dat de implementatie van dit raamwerk grote voordelen biedt op het gebied van kosten, snelheid en reproduceerbaarheid. Door de flexibiliteit van LLM's kunnen onderwijsinstellingen nu gemakkelijker longitudinale assessments uitvoeren. Dit stelt hen in staat om de groei van een student over een langere periode consistent te monitoren zonder dat de structuur van de toetsing verandert.

Hoewel dit specifieke onderzoek zich richt op de methodologie van HDR, maakt het deel uit van een bredere trend in de AI-sector. De ontwikkeling van krachtige taalmodellen gaat razendsnel, waarbij diverse series wereldwijd worden uitgerold. Een voorbeeld hiervan is de Qwen-serie van de Alibaba Group, waarvan de technische details en broncodes beschikbaar zijn gesteld via github.com.

Door de inzet van dergelijke technologieën kan de drempel voor het gebruik van complexe diagnostische redenering in het onderwijs worden verlaagd. Hierdoor krijgen meer studenten toegang tot gedetailleerde en constructieve feedback op hun praktische vaardigheden. De volledige methodologie, inclusief uitgebreide tabellen en figuren, is te raadplegen via de en aanvullende modelinformatie is te vinden op .

Geraadpleegde bronnen
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!