Harvard-studie: OpenAI-model presteert beter dan SEH-artsen bij eerste diagnoses
3 mins read

Harvard-studie: OpenAI-model presteert beter dan SEH-artsen bij eerste diagnoses

Een nieuw, Harvard-geleid onderzoek zet de discussie over AI in de zorg opnieuw op scherp. Volgens recente berichtgeving van The Guardian, NPR en Harvard Magazine presteerde OpenAI’s redeneermodel o1 preview in meerdere tests even goed of beter dan artsen op de spoedeisende hulp. Dat is groot nieuws, omdat juist triage en eerste diagnose behoren tot de meest tijdkritische momenten in een ziekenhuis.

Wat onderzocht Harvard precies?

De onderzoekers van Harvard Medical School en Beth Israel Deaconess Medical Center testten het model op echte spoedeisende-hulpgevallen, klinische casussen en managementbeslissingen. In een deel van het onderzoek kreeg de AI dezelfde tekstuele patiëntinformatie als artsen: vitale waarden, demografische gegevens en korte notities uit het elektronisch patiëntendossier. Volgens The Guardian kwam de AI bij 67% van de eerste triagegevallen tot de exacte of een bijna exacte diagnose, tegenover ongeveer 50% tot 55% voor menselijke artsen.

NPR schrijft dat het model ook op latere momenten in het zorgproces sterk scoorde, van eerste beoordeling tot opname in het ziekenhuis. Harvard Magazine benadrukt daarnaast dat het systeem opvallend goed presteerde bij zeldzame of complexe aandoeningen, juist omdat redeneermodellen beter over meerdere mogelijke oorzaken kunnen nadenken dan eerdere generaties chatbots.

Waarom dit AI-nieuws ertoe doet

Deze doorbraak draait niet alleen om één indrukwekkende benchmark. Het laat zien dat AI verschuift van assistent naar serieuze tweede lezer in situaties waar snelheid en nauwkeurigheid letterlijk levens kunnen beïnvloeden. Dat sluit aan bij een bredere ontwikkeling waarin OpenAI zijn positie steeds verder uitbouwt, bijvoorbeeld met GPT-5.5, Codex en Managed Agents op Amazon Bedrock. Tegelijk wordt duidelijk dat redeneermodellen niet meer alleen nuttig zijn voor tekst of code, maar ook voor domeinen met hoge risico’s.

Voor AI Feiten past dit ook in de trend van steeds autonomere systemen. Eerder zagen we al hoe de sector inzet op agentic AI bij OpenAI, Google en Anthropic en hoe bedrijven investeren in infrastructuur voor zwaardere AI-workloads, zoals in ons artikel over Google’s TPU 8t en 8i voor training en inference. In sectoren als farmacie zagen we bovendien al dat AI sneller richting praktijk beweegt, bijvoorbeeld bij AI voor medicijnontwikkeling bij Johnson & Johnson.

De belangrijkste nuance: AI vervangt de arts nog niet

De onderzoekers zijn zelf voorzichtig. De tests waren gebaseerd op tekstuele input, terwijl echte artsen ook lichaamstaal, scans, geluiden en context meenemen in hun beoordeling. Dat betekent dat deze resultaten niet bewijzen dat een chatbot zelfstandig patiënten kan behandelen. Wel suggereren ze dat een goed redeneermodel artsen kan ondersteunen bij complexe diagnostiek, second opinions en behandelplanning.

Juist daarom is dit nieuws zo relevant: de vraag is niet langer óf AI iets in de kliniek kan betekenen, maar hoe ziekenhuizen deze systemen veilig in bestaande workflows opnemen. Denk aan validatie, aansprakelijkheid, menselijke eindverantwoordelijkheid en transparantie richting patiënt.

Wat betekent dit voor de AI-markt?

Als vervolgonderzoek deze resultaten bevestigt, kan medische AI sneller verschuiven van pilotproject naar kernonderdeel van zorgprocessen. Voor OpenAI is het bovendien een krachtig signaal dat redeneermodellen commerciële waarde hebben buiten chatinterfaces. Voor ziekenhuizen en toezichthouders begint nu het lastigste deel: bewijzen dat zulke systemen niet alleen slim, maar ook veilig, uitlegbaar en eerlijk genoeg zijn voor dagelijks gebruik.

Bronnen