Microsoft's CARE-X: AI die röntgenfoto's leest én meet

TL;DR

  • Wat: Microsoft Research presenteert CARE-X, een AI-model dat thoraxfoto's niet alleen beschrijft maar ook klinisch relevante metingen uitvoert en betrouwbaarheidsscores meegeeft.
  • Waarom relevant: AI in de radiologie verschuift van 'rapport genereren' naar 'klinisch bruikbaar advies' — dat verandert wat zorgaanbieders en toeleveranciers mogen verwachten.
  • Wat je ermee kunt: Volg hoe meetgerichte radiologie-AI zich ontwikkelt, vooral als je levert aan zorginstellingen of overweegt AI-oplossingen in te kopen.

Ik stuitte op een publicatie van Microsoft Research die me aan het denken zette. Niet omdat AI en röntgenfoto's nieuw zijn — dat verhaal kennen we inmiddels — maar omdat dit model iets doet wat de meeste voorgangers niet deden: het meet, het geeft een betrouwbaarheidsscore, en het combineert die twee met tekstgeneratie. Dat klinkt technisch, maar de implicaties zijn behoorlijk concreet.

Wat is CARE-X precies?

CARE-X staat voor Clinically Aligned Radiology Expertise en is ontwikkeld door Microsoft Research in samenwerking met Medha AI en Narayana Health, een groot Indiaas ziekenhuisnetwerk. Het is een zogenaamd vision-language model — een AI dat zowel beelden als tekst kan verwerken — specifiek gebouwd voor het interpreteren van thoraxfoto's (röntgenfoto's van de borstkas).

Wat CARE-X onderscheidt van eerdere modellen is dat het meer dan tien taken combineert in één systeem. Het genereert radiologieverslagen, beantwoordt klinische vragen over een foto, classificeert aandoeningen, en — dit vind ik het meest opvallende — het voert metingen uit. Denk aan het berekenen van de cardiothoracale ratio, een maat die radiologen gebruiken om te bepalen of een hart vergroot is. In plaats van visueel te schatten ("het hart lijkt groot"), meet het model daadwerkelijk.

Het model draait op 3,8 miljard parameters, gebaseerd op Microsofts Phi-4-mini. Dat is relatief compact voor wat het doet. Ter vergelijking: veel grote taalmodellen hebben tientallen tot honderden miljarden parameters.

Waarom metingen ertoe doen

Hier wordt het interessant voor wie niet dagelijks in een ziekenhuis rondloopt. De meeste AI-systemen voor radiologie zijn tot nu toe gericht op het genereren van tekst: een beschrijving van wat er op een röntgenfoto te zien is. Dat is nuttig, maar het mist iets cruciaals.

Een radioloog die naar een thoraxfoto kijkt, doet méér dan beschrijven. Hij of zij meet verhoudingen, beoordeelt of een waarde boven of onder een drempel valt, en koppelt daar een klinisch oordeel aan. Dat meetaspect ontbrak grotendeels bij eerdere AI-modellen.

De resultaten van CARE-X op dit punt zijn opvallend. Bij het detecteren van een vergroot hart (cardiomegaly) verbeterde de F1-score — een maat die zowel nauwkeurigheid als volledigheid combineert — met 21,4 punten wanneer het model zijn meetgereedschap gebruikte. Bij het opsporen van een verwijde aorta was die verbetering zelfs 60,7 F1-punten. Bij een validatiestudie op Indische ziekenhuisdata detecteerde de meetvariant 40 van de 43 gevallen van milde aortaverwijding (93% gevoeligheid), tegenover slechts 5 van de 43 (12%) bij de initiële beoordeling zonder meettools.

Ik vind die sprong eerlijk gezegd indrukwekkend. Het laat zien dat "meten" niet zomaar een extra functie is, maar een fundamenteel verschil maakt in klinische bruikbaarheid.

Betrouwbaarheidsscores: weten wanneer je het model kunt vertrouwen

Een ander element dat mijn aandacht trok: CARE-X levert gekalibreerde betrouwbaarheidsscores. Dat betekent dat het model niet alleen zegt "ik zie een afwijking", maar ook aangeeft hoe zeker het daarvan is — en dat die zekerheid ook daadwerkelijk klopt met de werkelijkheid.

Waarom is dat belangrijk? Stel dat je als zorginstelling een AI-systeem inzet om röntgenfoto's voor te screenen. Als dat systeem bij elke foto zegt "90% zeker" terwijl het in werkelijkheid maar in 60% van de gevallen gelijk heeft, heb je een probleem. Gekalibreerde scores betekenen dat een score van 90% ook echt overeenkomt met 90% correctheid. Dat maakt het mogelijk om drempelwaarden in te stellen: boven een bepaalde score automatisch doorzetten, daaronder altijd naar een radioloog.

Op de ReXVQA-benchmark — een vraag-en-antwoordtest met ruim 41.000 vragen over röntgenfoto's — scoorde CARE-X 94% nauwkeurigheid en staat het bovenaan het klassement, boven modellen als CheXOne-R1 en Googles MedGemma.

Wat betekent dit voor de Nederlandse situatie?

Nederland is geen onbekende met AI in de radiologie. Uit de AI Monitor Ziekenhuizen 2026 blijkt dat een groeiend aantal Nederlandse ziekenhuizen AI inzet, al is dat bij 53% nog kleinschalig. Het Reinier de Graaf ziekenhuis gebruikt AI voor het beoordelen van botbreuken, het Maasstad Ziekenhuis zet AI-software in om MRI-onderzoeken te versnellen, en het landelijke AIfi-project onderzoekt of de infrastructuur voor beelduitwisseling tussen ziekenhuizen geschikt gemaakt kan worden voor AI-toepassingen.

Wat mij opvalt is dat de Nederlandse implementaties voornamelijk gericht zijn op detectie — het opsporen van breuken, longknobbeltjes, of afwijkingen. CARE-X gaat een stap verder door detectie, meting, en rapportage te combineren. Dat is een ander ambitieniveau.

Voor ondernemers die leveren aan de zorgsector — of het nu gaat om IT-diensten, medische apparatuur, of softwareoplossingen — is dit relevant om twee redenen. Ten eerste verschuift de verwachting: zorginstellingen zullen steeds vaker vragen om AI die niet alleen signaleert maar ook kwantificeert. Ten tweede worden de kwaliteitseisen hoger. Een model dat gekalibreerde scores levert, legt de lat hoger voor concurrenten die dat niet doen.

Een belangrijke kanttekening

CARE-X is nadrukkelijk een onderzoeksmodel. Het is niet FDA-goedgekeurd, niet CE-gemarkeerd, en niet gevalideerd voor klinisch gebruik. De resultaten zijn retrospectief — getest op bestaande data, niet in een live klinische omgeving. Microsoft benadrukt dat zelf ook. De validatiestudie op het gebied van metingen richtte zich bovendien vooral op recall (gevoeligheid); uitgebreidere studies naar specificiteit lopen nog.

Dat betekent niet dat het irrelevant is. Het betekent dat we kijken naar waar de technologie naartoe beweegt, niet naar wat morgen in het ziekenhuis staat.

Wat me bijblijft

Ik denk dat het meest veelzeggende aan CARE-X niet de benchmarkscores zijn, hoe indrukwekkend die ook zijn. Het is de verschuiving in wat we van radiologie-AI verwachten. We gaan van "de AI kan een verslag schrijven" naar "de AI kan meten, wegen, en aangeven hoe zeker het is". Dat is een wezenlijk ander gesprek.

Kun je je voorstellen wat dat betekent als je een radiologieafdeling runt met personeelstekort? Of als je een zorgverzekeraar bent die nadenkt over kwaliteitsstandaarden voor AI-ondersteunde diagnostiek?

Voor mij is dit vooral een signaal dat de lat voor medische AI snel omhoog gaat. Niet in de zin van spectaculaire doorbraken, maar in de zin van bruikbaarheid — het verschil tussen een AI die een mooi verhaal schrijft en een AI die een arts daadwerkelijk helpt beslissen.

80% van de AI-projecten haalt productie nooit.

Ik bouw de 20% — van prototype naar draaiend systeem, binnen weken.