AI-uitleg helpt de arts, misleidt de leek
3 mins read

AI-uitleg helpt de arts, misleidt de leek

Een AI die uitlegt waarom een plekje op de huid verdacht is, klinkt als winst voor iedereen die meekijkt. Onderzoek dat op 4 augustus in Nature Medicine verscheen laat zien dat diezelfde uitleg heel anders uitpakt afhankelijk van wie hem leest. Huisartsen komen er goed uit. Leken raken de weg kwijt zodra het model ernaast zit.

Wat de onderzoekers testten

Aan het experiment deden 623 leken en 153 huisartsen mee. Ze kregen foto’s van huidaandoeningen voorgelegd, eerst zonder hulp en daarna met vier verschillende vormen van AI-ondersteuning: een voorspelling met alleen een zekerheidsscore, vergelijkbare voorbeeldfoto’s, een heatmap die aangeeft waar het model naar kijkt, en een uitleg in gewone taal van een multimodaal taalmodel. Eerste auteur is Orson Xu van Columbia University, met onder anderen Marzyeh Ghassemi (MIT) en dermatoloog Roxana Daneshjou (Stanford) als co-auteurs. Het onderliggende classificatiemodel was getraind met een fairness-beperking, om de bekende zwakte van huidmodellen bij donkere huidtypen te dempen.

Iemand fotografeert thuis met een smartphone een plekje op de eigen arm

Leken volgen de uitleg, ook als die fout is

Bij de leken ging de nauwkeurigheid omhoog wanneer de AI het goed had, en omlaag wanneer de AI zich vergiste. MIT News, dat het onderzoek toelicht, noemt dat gedrag deference: deelnemers legden hun eigen inschatting opzij zodra er een vlot geschreven onderbouwing onder stond. Een detail uit dezelfde toelichting maakt het ongemakkelijker. Vage, algemene uitleg werd overtuigender gevonden dan precieze uitleg. Wie de vakkennis mist om een argument te wegen, leest soepel taalgebruik als betrouwbaarheid. Dat mechanisme kwam eerder terug in het debat over chatbots die warm en meelevend klinken in een zorgcontext.

Artsen hebben genoeg aan de kale voorspelling

De huisartsen hielden hun eigen oordeel wel overeind. Zij profiteerden van de AI ongeacht of het model gelijk had, en haalden hun beste resultaat met alleen de voorspelling, zonder toelichting eronder. De uitleg voegde voor deze groep weinig toe. Voor ontwikkelaars van klinische software is dat een lastige uitkomst, want uitlegbaarheid geldt in de zorg juist als voorwaarde voor vertrouwen. Ziekenhuizen bouwen ondertussen door aan eigen modellen, zoals het gezamenlijke zorgmodel van Mayo Clinic en Microsoft en het NeuroVFM-model voor hersenscans.

Wat betekent dit

De praktische conclusie: een interface die werkt voor een arts is niet zomaar geschikt voor een patiënt. Een symptoomchecker die zijn diagnose netjes beargumenteert, kan iemand met een verdacht plekje ervan overtuigen om geen afspraak te maken. Dat risico groeit nu gratis gebruikers onbeperkt met ChatGPT kunnen chatten en medische vragen bij zulke assistenten belanden zonder tussenkomst van een zorgverlener. De transparantieregels uit de EU AI Act verplichten aanbieders om te melden dat je met AI praat. Deze studie suggereert dat zo’n melding het probleem niet dekt. Het gaat om de vorm van de uitleg zelf, en die is voor een leek overtuigender naarmate hij minder concreet wordt.