ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

你深信不疑的“统计显著”,可能是一场百年误会

你深信不疑的“统计显著”,可能是一场百年误会 你深信不疑的“统计显著”可能是一场百年误会97%的发表研究都说自己显著为什么只有37%能被复制你有没有见过这样的场景一篇研究论文只要p值小于0.05研究者就长舒一口气仿佛拿到了“科学证明”的通行证但如果我告诉你这个通行证可能根本不存在呢斯坦福大学心理学教授拉塞尔·波德拉克在《斯坦福大学统计思维入门》中直指一个困扰科学界近百年的问题我们赖以判断科学发现的统计方法可能从一开始就被用错了。p值到底是什么你可能一直理解错了先做一个简单的测试。一项研究得出p0.01以下哪个理解是对的零假设为真的概率是1%你做出错误决定的概率是1%重复这项研究99%会得到同样结果你发现了一个有实际意义的效应答案是以上全错p值的真正含义是在零假设为真的前提下观测到当前数据或更极端数据的概率。简单说它回答的是“如果什么都没发生我看到这个结果的可能性有多大”——而不是“这个结果是真的的可能性有多大”。这个区别很多人——包括受过专业训练的研究者——都没搞明白。科学界的“信任危机”从97%到37%2015年270多位研究者联合发起了一项大规模复制实验选取心理学领域100项已发表的研究逐一重新验证。结果令人震惊97%的原始研究声称结果具有统计显著性但成功复制的只有37%。从97%到37%这个巨大的落差让整个科学界警醒。这场被称为 “可重复性危机” 的风暴根源之一正是零假设显著性检验的滥用。波德拉克在书中直言“在过去50多年间摒弃NHST、改用其他方法的呼声从未停止。”有学者甚至称其为“对科学进步构成要素的一种错误认知”。“p值操纵”数据钓鱼如何制造假发现更令人担忧的是有些研究者为了得到p0.05这个“及格线”会不自觉地采取一些有问题的做法。书中披露了一个令人震惊的案例。著名进食研究学者布莱恩·万辛克Brian Wansink2012年发表了一项关于儿童食物选择的研究声称“用知名媒体人物做广告能让儿童选择健康食品的比例从20.7%提高到33.8%p0.02”。但后续调查发现数据刚收集上来时p值只有0.06万辛克在邮件中写道“我觉得它应该再低一些”并询问同事“如果能拿到数据而且数据需要一点调整最好能把这个值降到0.05以下”。这篇文章最终因数据问题被撤稿万辛克本人也从康奈尔大学辞职。这种为了得到显著性结果而不断调整数据分析方法的行为被称为 “p值操纵” 。常见手段包括每多收集一个受试者就分析一次数据一旦p0.05就停止分析几十个变量只报告显著的那几个尝试多种统计方法只报告“奏效”的那种剔除某些“不顺眼”的数据点这不是学术不端却被广泛使用。一项调查显示51%的研究者承认曾把意外发现当作一开始就提出的假设来报告。统计显著≠实际重要即便p值真的小于0.05也不代表效应有多大。书中举了一个例子一项研究检验某种锻炼方式对血压的影响得到p0.05的统计显著结果。但如果样本量足够大比如6.5万人即使血压只降低了0.5个单位远低于血压测量仪的精度仍然可能得到“显著”结果。绝大多数医生不会认为这种幅度的变化具有临床意义。统计显著性不等于实际显著性。出路在哪里面对这些问题波德拉克在书中提出了几个方向第一关注效应值而非p值。效应值能告诉你效应到底有多大而不是仅仅告诉你“有没有效应”。第二报告置信区间。置信区间能展示估计的不确定程度而不是一个非黑即白的结论。第三做预注册。在收集数据之前把研究设计和分析计划提交到公开数据库。这能有效防止事后调整假设。第四推动复制研究。一个发现只有被多次验证才值得真正相信。第五拥抱贝叶斯统计。贝叶斯方法能直接回答“在给定数据下这个假设为真的概率有多大”——这正是我们真正想知道的问题。科学的目的不是追求“显著”而是追求真实。正如波德拉克在书中所说“我们提出的大多数假设都可能是错的对此我们应当泰然处之。只有这样当我们偶然发现一个正确的假设时才会对它的真实性更有信心。”p0.05不是科学的终点。真正的科学精神恰恰在于承认不确定性并在此基础上一步步逼近真相。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进