Ein neuer Standard für medizinische künstliche Intelligenz
Jahrelang wurde das Gebiet der medizinischen künstlichen Intelligenz (KI) von einer einzigen Frage bestimmt: Können Algorithmen die Leistung von Expertenklinikern erreichen? Dutzende Studien haben Deep-Learning-Modelle mit Radiologen, Pathologen und Dermatologen verglichen, oft mit beeindruckenden Ergebnissen an retrospektiven Datensätzen. Doch ein aktueller Kommentar in Nature Medicine argumentiert, dass diese erste Generation medizinischer KI den falschen Maßstab gesetzt hat. Die nächste Generation, so wird behauptet, sollte nicht danach beurteilt werden, ob Maschinen menschliche Expertise reproduzieren können, sondern ob sorgfältig gestaltete Mensch-KI-Systeme die Behandlungsergebnisse der Patienten verbessern können.
Der Kommentar, verfasst von Dr. Kristina Lång von der Abteilung für diagnostische Radiologie der Universität Lund, zieht Lehren aus einer der ersten randomisierten Studien zu KI in der Medizin, um für einen tiefgreifenden Wandel in der Bewertung und Implementierung klinischer KI zu plädieren. Es ist ein Aufruf, über Genauigkeitsmetriken hinauszugehen und sich auf Maßnahmen zu konzentrieren, die wirklich zählen: Morbidität, Mortalität, Lebensqualität sowie Effizienz und Gerechtigkeit der Versorgung.
Die erste Generation: Algorithmen, die Kliniker nachahmen
Die frühe medizinische KI-Forschung wurde von der Idee dominiert, dass der Wert eines Modells durch den direkten Vergleich seiner Ausgabe mit der von menschlichen Experten festgestellt werden könnte. Studien berichteten über Sensitivität, Spezifität und die Fläche unter der Receiver-Operating-Characteristic-Kurve und kamen oft zu dem Schluss, dass das KI-System mit Klinikern „gleichwertig“ oder „überlegen“ sei. Diese Ergebnisse erzeugten enorme Begeisterung und führten zu behördlichen Zulassungen für Hunderte von KI-Tools in Radiologie, Kardiologie und anderen Fachgebieten.
Doch algorithmische Gleichwertigkeit ist nicht dasselbe wie klinischer Nutzen. Ein Modell, das einen Radiologen bei der Interpretation eines Bildes übertrifft, kann dennoch den gesamten diagnostischen Prozess nicht verbessern, sobald es in einen geschäftigen Krankenhausablauf integriert ist. Es könnte Warnungen erzeugen, die ignoriert werden, die Arbeitsbelastung erhöhen oder neue Fehler im Patientenmanagement einführen. Die kontrollierte Umgebung einer retrospektiven Studie kann diese realen Komplexitäten nicht erfassen. Wie Lång schreibt, beurteilte die erste Generation KI danach, ob sie Klinikern ebenbürtig ist; die nächste Generation sollte sie danach beurteilen, ob sie Patienten helfen kann.
Der Aufstieg randomisierter Studien in der KI
Randomisierte kontrollierte Studien (RCTs) sind der Goldstandard für die Bewertung medizinischer Interventionen. Sie eliminieren Störfaktoren, berücksichtigen menschliches Verhalten und liefern das Evidenzniveau, das erforderlich ist, um die klinische Praxis zu ändern. In der Welt der KI waren RCTs jedoch selten. Der größte Teil der Evidenz für KI-Tools stammt aus retrospektiven oder prospektiven einarmigen Studien mit begrenzter externer Validität. Dies beginnt sich zu ändern, und Lång hebt die Entstehung von RCTs als eine entscheidende Entwicklung hervor.
Eines der bemerkenswertesten Beispiele ist die MASAI-Studie, eine randomisierte Studie, die in Schweden durchgeführt wurde und den Einsatz von KI-gestütztem Mammographie-Screening untersuchte. Diese Studie, die 2023 in The Lancet Oncology veröffentlicht wurde, gehört zu den ersten, die Patienten randomisiert entweder einem KI-gestützten Screening oder dem standardmäßigen Doppelbefund zuwies. Die Studie maß nicht nur die Krebserkennungsrate des Algorithmus, sondern auch Ergebnisse wie screening-entdeckte Karzinome, Intervallkarzinome, Rückrufraten und Arbeitsbelastung. Die Ergebnisse deuteten darauf hin, dass KI die Arbeitsbelastung für Radiologen reduzieren und gleichzeitig die Krebserkennung aufrechterhalten oder möglicherweise verbessern könnte, aber die eigentliche Lehre war umfassender: Nur ein randomisiertes Design konnte glaubwürdige Antworten über das gesamte Mensch-KI-System liefern.
Långs Kommentar zitiert zusätzliche aktuelle RCTs, darunter eine Studie aus dem Jahr 2025 in The Lancet Digital Health und eine Studie aus dem Jahr 2026 in The Lancet, als Teil einer aufkommenden Evidenzbasis. Diese Studien repräsentieren eine neue Welle der Forschung, die KI nicht als eigenständige Technologie behandelt, sondern als Intervention, die in einen klinischen Pfad eingebettet ist und an patientenorientierten Endpunkten bewertet wird.
Lehren von der Front
Aus ihrer Perspektive als Radiologin und leitende Prüfärztin bei KI-Screening-Studien identifiziert Lång wichtige Lehren, die über statistische Signifikanz hinausgehen. Erstens sind Patientenergebnisse von größter Bedeutung. Es reicht nicht zu zeigen, dass ein KI-System Bilder schneller oder genauer klassifizieren kann; es muss nachgewiesen werden, dass es den Weg des Patienten verbessert, von der Früherkennung über die Behandlung bis zum Überleben.
Zweitens ist die Gestaltung der Mensch-KI-Interaktion entscheidend. Ein Algorithmus ist nur so gut wie das System um ihn herum. Wie Warnungen präsentiert werden, wie Kliniker im Umgang damit geschult werden und wie Verantwortlichkeiten verteilt werden, beeinflusst das Endergebnis. Långs Betonung auf „sorgfältig gestalteten Mensch-KI-Systemen“ weist auf eine Verlagerung des Fokus vom Modell selbst auf das soziotechnische Umfeld hin, in dem es operiert.
Drittens ist die Implementierungswissenschaft wichtig. Eine erfolgreiche Studie garantiert keine erfolgreiche Umsetzung. Die Herausforderungen der Integration von KI in bestehende klinische Arbeitsabläufe, der Sicherstellung der Erstattung und der Aufrechterhaltung des Vertrauens von Klinikern und Patienten sind ebenso wichtig wie jeder algorithmische Fortschritt. Lång, die die schwedischen nationalen Richtlinien zum Brustkrebsscreening leitet und in Beiräten von Unternehmen wie Siemens Healthineers tätig war, kennt diese translationalen Hürden aus erster Hand.
Bewertung für eine neue Ära überdenken
Der Kommentar argumentiert, dass die Bewertung medizinischer KI dieselben strengen Standards übernehmen muss, die für Medikamente und Geräte gelten. Das bedeutet mehr RCTs, aber auch die Verwendung geeigneter Vergleichsgruppen, klinisch bedeutsamer Endpunkte und pragmatischer Studiendesigns, die die alltägliche Praxis widerspiegeln. Regulierungsbehörden und Fachgesellschaften beginnen, solche Evidenz zu fordern, aber die Kluft zwischen dem Tempo der technologischen Innovation und dem Tempo der Bewertung bleibt groß.
Lång schlägt vor, dass sich das Feld von der Frage „Ist die KI besser als ein Kliniker?“ entfernen und stattdessen fragen sollte: „Verbessert dieses KI-Kliniker-Team die Ergebnisse, reduziert es Schäden und setzt es Ressourcen sinnvoll ein?“ Diese Neuausrichtung hat tiefgreifende Auswirkungen auf Studiendesign, Finanzierungsprioritäten und Publikationsstandards. Sie legt den Entwicklern auch eine größere Verantwortung auf, Werkzeuge zu bauen, die transparent, interpretierbar und auf klinische Bedürfnisse ausgerichtet sind.
Bessere Mensch-KI-Systeme aufbauen
Eine der überzeugendsten Forderungen des Kommentars ist die gemeinsame Gestaltung von KI-Systemen mit Klinikern an vorderster Front. Wenn das Ziel darin besteht, die Behandlungsergebnisse der Patienten zu verbessern, müssen die Benutzeroberfläche, die Entscheidungsunterstützungslogik und die Feedback-Mechanismen von den Realitäten der klinischen Praxis geprägt sein. Dies ist besonders wichtig in Bereichen mit hohem Risiko wie dem Krebsscreening, wo KI eingesetzt wird, um Fälle zu triagieren, verdächtige Befunde zu markieren und möglicherweise die Anzahl der Bilder zu reduzieren, die ein Radiologe überprüfen muss.
Långs eigene Forschung hat untersucht, wie menschliche Wahrnehmung und Expertise mit maschineller Diagnose interagieren. Frühere Arbeiten, einschließlich Veröffentlichungen in European Radiology und Radiology, untersuchten den „Satisfaction-of-Search“-Effekt und wie Radiologen Befunde übersehen, wenn andere Anomalien vorhanden sind. Diese Erkenntnisse aus der kognitiven Psychologie werden nun angewendet, um zu verstehen, wie das Vertrauen von Radiologen in KI ihre Entscheidungsfindung beeinflusst. Ein System, das genau, aber schlecht auf menschliches Vertrauen kalibriert ist, könnte zu Übervertrauen oder Unterbeanspruchung führen, was beides Patienten schaden kann.
Der Weg nach vorn: Evidenz, Ethik und Gerechtigkeit
Da KI in der Medizin immer weiter verbreitet wird, wird der Bedarf an robuster Evidenz dringend. Långs Kommentar erinnert daran, dass RCTs nicht nur eine Formalität sind; sie sind unerlässlich, um zu verstehen, welche KI-Anwendungen echten Nutzen bieten und welche neue Formen von Verzerrung oder Schaden einführen könnten. Dies ist besonders relevant für unterversorgte Bevölkerungsgruppen, die in den Datensätzen, die zum Trainieren von KI-Modellen verwendet werden, möglicherweise unterrepräsentiert sind.
Die Autorin stellt auch fest, dass die Entwicklung medizinischer KI mit kommerziellen Anreizen verflochten ist. Als Mitbegründerin von N23 Health und Beraterin großer Unternehmen ist sie nicht gegen die Industrie, sondern plädiert für evidenzbasierte Innovation. Das Ziel sollte sein, Marktanreize mit strenger Bewertung in Einklang zu bringen, damit die Werkzeuge, die Patienten erreichen, nachweislich hilfreich sind.
Fazit: Ein neuer Maßstab für klinische KI
Der Kommentar in Nature Medicine vermittelt eine zeitgemäße Botschaft. Die Ära des einfachen Vergleichs von Algorithmen mit Klinikern ist vorbei. Entscheidend ist nun, ob KI, wenn sie in durchdachte klinische Systeme integriert wird, das Leben der Patienten spürbar verbessert. Randomisierte Studien, wie die, die Lång mitgeleitet hat, sind die Brücke zwischen technischem Versprechen und realem Nutzen. Sie liefern die Evidenz, die sicherstellt, dass die nächste Generation medizinischer KI am höchsten Standard gemessen wird: der Verbesserung der Behandlungsergebnisse von Patienten.
Während das Feld reift, müssen Forscher, Regulierungsbehörden, Kliniker und Entwickler zusammenarbeiten, um randomisierte Bewertung zur Norm statt zur Ausnahme zu machen. Nur dann kann medizinische KI ihr Potenzial als Kraft für gesündere Leben erfüllen. Die Lehren sind klar, und sie beginnen mit einer einfachen Verschiebung: Beurteilen Sie den Erfolg nicht danach, was der Algorithmus tut, sondern danach, was der Patient erlebt.
Dieser Artikel basiert auf einer Berichterstattung von Nature Medicine. Lesen Sie den Originalartikel.
Originally published on nature.com








