Slechts 3 van 1.357 medische AI-tools getest op patiënten
De Amerikaanse toezichthouder FDA heeft inmiddels 1.357 medische hulpmiddelen met kunstmatige intelligentie toegelaten. Van al die apparaten en softwarepakketten zijn er precies drie onderzocht op de vraag die voor patiënten het meest telt: leven ze er langer of beter door? Dat blijkt uit een analyse van onderzoekers van de University of Toronto en MIT in het vakblad PLOS Digital Health, die deze week opnieuw de aandacht trok via Earth.com.
Wat de onderzoekers telden
Het team onder leiding van Rawan Abulibdeh (University of Toronto) en Sebastián Andrés Cajas Ordóñez (MIT Critical Data) nam alle AI-hulpmiddelen die tot 5 december 2025 door de FDA waren goedgekeurd of toegelaten. Daarna zochten ze in ClinicalTrials.gov naar geregistreerde prospectieve studies. Die vonden ze bij 34 hulpmiddelen, ofwel 2,5 procent. Van die 34 hadden er twaalf resultaten gepost en twaalf een wetenschappelijke publicatie, meldt EurekAlert.
Radiologie is verreweg de grootste categorie. Het gaat om 1.059 hulpmiddelen die artsen helpen bij het lezen van mammogrammen, CT-scans en andere beelden. Daar hoorden slechts drie geregistreerde studies bij. Cardiologie telt 126 hulpmiddelen en twaalf studies, neurologie 62 hulpmiddelen en zes studies. Voor de 22 AI-tools in de anesthesiologie vonden de onderzoekers geen enkele studie.

Waarom de toelating zo weinig zegt
De verklaring zit vooral in de 510(k)-procedure. Via die route hoeft een fabrikant alleen aan te tonen dat een nieuw product lijkt op iets wat al op de markt is. Of het patiënten echt helpt, is geen voorwaarde. De studies die wel bestaan, zijn vaak klein en eenzijdig. Volgens het artikel werd 94 procent door de fabrikant zelf uitgevoerd, vond 68 procent alleen in de Verenigde Staten plaats en had driekwart minder dan 500 deelnemers.
Ook de samenstelling van die groepen schiet tekort. Alle radiologie- en cardiologiestudies sloten kinderen uit. Zwangere vrouwen werden geweerd uit 42 procent van de cardiovasculaire studies en een derde van de radiologiestudies. Maar drie studies splitsten hun uitkomsten uit naar etniciteit. Hoe slecht dat kan uitpakken, laat een voorbeeld uit 2021 zien dat Earth.com aanhaalt: een sepsisdetector die in meer dan de helft van de Amerikaanse ziekenhuizen draaide, miste bij onafhankelijk onderzoek 67 procent van de echte sepsisgevallen.
Een voorstel in drie fasen
De auteurs willen dat toezichthouders de toelating anders inrichten. Hun kader bestaat uit drie fasen, waarbij een fabrikant stap voor stap moet aantonen dat een hulpmiddel werkt in verschillende patiëntgroepen en zorgomgevingen. Hun kernboodschap vatten ze zelf samen: van de 1.357 toegelaten AI-hulpmiddelen zijn er maar drie getest op de vraag of patiënten langer of beter leven.
Het onderzoek past in een bredere discussie. Eerder schreven we al over artsen die op de rem trappen bij medische AI, terwijl bedrijven als OpenEvidence miljarden ophalen en OpenAI met ChatGPT Health aansluit op patiëntendossiers.
Wat betekent dit
Een FDA-stempel betekent voor AI in de zorg vooral dat een product technisch lijkt op een eerder product. Het zegt weinig over gezondheidswinst. Ziekenhuizen die AI aanschaffen, ook in Nederland, doen er goed aan zelf naar klinisch bewijs te vragen. Nieuwe modellen, zoals het AI-model voor hersenscans op basis van ziekenhuisdata, worden steeds beter in het herkennen van afwijkingen. Of patiënten daar beter van worden, moet voor bijna alle toegelaten tools nog blijken.
