← Terug
Nieuwe benchmark onthult beperkingen van AI bij genomische surveillance van pathogenen

Nieuwe benchmark onthult beperkingen van AI bij genomische surveillance van pathogenen

Een team van onderzoekers heeft BioSecBench-Surveillance ontwikkeld, een nieuwe meetlat om te testen of kunstmatige intelligentie (AI) betrouwbaar kan helpen bij het analyseren van genetische data van ziekteverwekkers. Uit de eerste resultaten blijkt dat zelfs de meest geavanceerde AI-modellen momenteel slechts ongeveer de helft van de complexe analysetaken correct kunnen uitvoeren.

Binnen de genomische surveillance verschuift de grootste uitdaging momenteel van het genereren van data naar de feitelijke analyse ervan. Terwijl sequencingtechnologieën steeds sneller en goedkoper worden, blijft het interpreteren van deze enorme hoeveelheden genetische informatie een knelpunt. In een recent onderzoek, gepubliceerd via arxiv.org, presenteren wetenschappers een methode om te bepalen of AI-agenten in staat zijn om de juiste analysepijplijnen af te leiden uit ruwe sequencingdata en de specifieke context van surveillance.

De opzet van BioSecBench-Surveillance

BioSecBench-Surveillance bestaat uit 100 specifieke evaluaties. Bij elke test krijgt een AI-agent uitsluitend de informatie en data die ook beschikbaar zouden zijn voor een menselijke analist. De prestaties van de AI worden vervolgens op een deterministische manier beoordeeld op basis van gestructureerde antwoorden.

De taken binnen deze benchmark zijn breed gespreid over zeven verschillende categorieën. Deze variëren van de taxonomische classificatie van organismen tot het detecteren van genetische manipulaties. Om de realiteit van het veld te weerspiegelen, zijn de tests uitgevoerd over diverse monster-types en verschillende sequencingtechnologieën. Volgens de dient dit als een standaard om te meten of AI-systemen vertrouwd kunnen worden wanneer er een nieuwe uitbraak plaatsvindt.

Prestaties van topmodellen

Het onderzoek omvatte in totaal 3.962 beoordeelbare pogingen, uitgevoerd door zestien verschillende combinaties van modellen en 'harnesses'. De resultaten laten zien dat de huidige generatie AI nog aanzienlijke moeite heeft met deze specialistische taken. De sterkste configuraties haalden slechts ongeveer 50 procent van de evaluaties correct.

De hoogste scores werden behaald door Opus 4.8 met PI en GPT-5.5 met Codex, die beiden een score van 50,2 procent behaalden. Andere sterke prestaties kwamen van Opus 4.7 met PI (49,6 procent) en Sonnet 4.6 met PI (48,6 procent). Deze cijfers zijn gebaseerd op de , waarbij rekening is gehouden met betrouwbaarheidsintervallen van 95 procent.

Knelpunten in de analyse

Een opvallende bevinding uit de studie is dat de fouten van de AI-agenten niet alleen voortkomen uit het onvermogen om de juiste workflow te identificeren. Zelfs wanneer een model de correcte analysepijplijn koos, traden er vaak fouten op bij de specifieke parameters.

De onderzoekers merkten op dat de AI-systemen moeite hadden met cruciale keuzes rondom:
- De selectie van de juiste referentiegenomen.
- Het instellen van correcte drempelwaarden (thresholds).
- Het toepassen van filters.
- De juiste normalisatie van de data.

Deze details zijn echter essentieel voor een accurate diagnose en surveillance van pathogenen. De onderstreept hiermee dat het simpelweg kunnen aanroepen van een tool niet voldoende is; het gaat om de precisie van de configuratie binnen de biologische context.

Toekomstige impact

De introductie van BioSecBench-Surveillance biedt een noodzakelijk kader voor de ontwikkeling van veiligere en effectievere AI-hulpmiddelen in de biotechnologie. Door de tekortkomingen van huidige modellen zoals GPT-5.5 en Opus 4.8 bloot te leggen, kunnen ontwikkelaars zich richten op de specifieke zwaktes in genomische analyse.

Het uiteindelijke doel is om systemen te creëren die menselijke analisten kunnen ondersteunen of versnellen zonder dat dit ten koste gaat van de nauwkeurigheid, wat cruciaal is voor de wereldwijde biosurveillance en het tijdig reageren op pandemieën. De volledige details van de methodologie en de resultaten zijn beschikbaar in de .

Geraadpleegde bronnen
PexelsThirdmanvia Pexels
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!