相关与因果

“相关不等于因果"大概是传播最广的统计学口号,但它只说对了一半——它告诉你不要做什么,却没告诉你该做什么。真正重要的问题是:既然相关性随处可见而因果性难以捉摸,人类究竟凭什么宣称"吸烟导致肺癌"“疫苗预防疾病"“教育提高收入”?答案不是一句口号,而是一整套用两百年时间打磨出来的方法论:识别混杂变量、警惕辛普森悖论、用随机化切断纠缠、向大自然借用天然的随机实验。理解这套方法,你就拥有了一件比黄金更稀缺的东西——在数据轰炸的时代,分辨"谁推动了谁"的能力。

一、冰淇淋与溺水:藏在幕后的第三变量

每年夏天,冰淇淋的销量和溺水死亡人数同步上升,两条曲线几乎完美相关。如果只看数据,一个荒唐的政策建议呼之欲出:禁售冰淇淋可以救人。稍有常识的人都知道问题出在哪——炎热的天气同时推高了冰淇淋销量和下河游泳的人数,溺水是游泳人数增加的结果,与冰淇淋无关。在这个例子里,气温就是幕后那只看不见的手:它同时驱动两个变量,让两个本无因果关系的量在数据里形影不离。统计学把这样的角色称为混杂变量——它制造了变量之间的虚假相关,而相关本身对此完全无声。

配图

混杂的普遍性:冰淇淋的例子之所以被反复引用,恰恰因为幕后的变量一戳就破——可现实中的混杂很少这么明显。统计学教材里躺着一串更隐蔽的经典案例:学龄儿童的鞋码与阅读能力高度相关(幕后变量是年龄);一个城市的教堂数量与犯罪率同步增长(幕后变量是人口规模);消防员到场人数越多,火灾造成的损失越大(幕后变量是火势大小——派更多消防员是因为火大,而不是消防员造成了损失)。每一个案例的结构都一模一样:X与Y相关,不是因为X导致Y,而是因为存在第三个变量Z同时驱动两者。控制混杂——在相同气温下比较、在相同年龄组内比较、在相同火势等级内比较——之后,幽灵般的相关就会烟消云散。混杂变量是观察性数据的原罪:只要数据不是你亲手通过随机化生成的,你就永远要假设有一个Z藏在幕后——这是观察性研究永远甩不掉的影子,也是一切因果讨论的起跑线。

二、反向因果与健康使用者偏差:荷尔蒙替代疗法的教训

相关关系的第二个深坑是方向问题:X与Y相关,到底是X导致Y,还是Y导致X?健身房会员的健康水平显著高于非会员——是健身改善了健康,还是本来就更健康的人更有力气和意愿走进健身房?聪明学生更常提问——是提问促进了成绩,还是听懂了课的学生才提得出问题?方向一旦搞反,干预就会南辕北辙。医学史上最昂贵的一课来自荷尔蒙替代疗法(HRT):20世纪90年代,以护士健康研究为代表的大型观察性研究一致显示,使用HRT的绝经女性冠心病发病率显著低于不使用者,风险降低幅度估计达四到五成。全球数百万女性据此用药,医学界信心满满。

随机试验的当头棒喝:2002年,美国"女性健康倡议”(WHI)随机对照试验公布了石破天惊的结果——随机分配到HRT组的女性,冠心病风险反而升高了约29%。观察性研究和随机试验给出了方向相反的答案,问题出在哪?事后复盘发现,选择使用HRT的女性本身就是被筛选过的群体:她们收入更高、教育程度更好、更注重体检和健康管理——是这些"健康使用者"的底色压低了观察数据里的发病率,而不是药物的功劳。观察性研究里,“选择接受治疗"这个行为本身就携带了健康信息;只有把分配权交给抛硬币,才能把这个信息洗成白噪声。HRT事件是医学界的分水岭,它用数百万人的用药史证明了一件事:再庞大的观察性样本,也替代不了随机分配

三、辛普森悖论:合并数据会反转方向

1973年,加州大学伯克利分校的研究生录取数据引发了一场轩然大波:当年约8442名男性申请者中约44%被录取,约4321名女性申请者中录取率只有约35%。总体数据看似铁证如山地指向性别歧视。然而比克尔、哈梅尔和奥康奈尔在1975年发表于《科学》杂志的分析给出了惊人的反转:逐院系检查后,绝大多数院系的录取率并不存在对女性的不利,不少院系女性的录取率反而更高。秘密在于申请分布:女性申请者集中投向了英语、历史等竞争激烈、录取率本来就低的院系,男性申请者更多投向工程等录取率较高的院系。总体差异不是"同一扇门对女性更窄”,而是"两性走向了不同的门”。

肾结石的数字版本:辛普森悖论更锋利的演示来自一项1986年的肾结石治疗比较(查里格等人的研究)。把病人按结石大小分层后:小结石组,开放手术成功率约93%,体外碎石约87%;大结石组,开放手术约73%,碎石约69%——两个亚组里都是开放手术更好。但把数据合并后,总体成功率却是碎石约83%,高于开放手术的约78%。方向完全反转。原因同样是分布:碎石的病例里小结石(本来就好治)占大头,手术的病例里大结石占大头——分层的权重不同,把两个"都更好"合并成了一个"更差"。辛普森悖论的教训是双重的:合并数据可能撒谎,分层数据也可能被操纵——当有人给你看一个总体结论时,要问"分组之后还成立吗";当有人给你看分组结论时,要问"他是按什么分的组"。数据结构本身,就是一种叙事选择

辛普森悖论在新冠疫情期间再次现身公共舆论:2021年,英国与以色列的公开数据中一度出现"已完成疫苗接种者的住院占比不低甚至更高"的表格,被疫苗怀疑论广泛引用。按年龄分层之后,结论立刻反转——在几乎每一个年龄段内,接种者的重症率都显著更低。总体数据的假象来自接种率在老年人群中极高:老年人本就以更高的比例住院,当他们中的绝大多数都已接种时,住院名单里自然满是接种者。不看分层的总体比例,就把"谁更容易住院"错答成了"疫苗有没有用"。

四、随机对照试验:用抛硬币斩断纠缠

如何一劳永逸地解决混杂与反向因果?医学的回答是随机对照试验(RCT)。思想的萌芽可以追溯到1747年:詹姆斯·林德在"索尔兹伯里号"军舰上把12名坏血病水手分成6组,分别给予苹果酒、稀硫酸、醋、海水、柑橘类水果等处理——吃到橘子和柠檬的两名水手迅速康复,柑橘由此成为英国海军的标配。林德的分组还不是随机的,真正的现代RCT诞生于1948年:在奥斯汀·布拉德福德·希尔的主导下,英国医学研究委员会开展了链霉素治疗肺结核的试验,用随机数字表把病人分配到治疗组和对照组——这被公认为第一个现代随机对照试验。

随机化的魔法:随机分配为什么有效?因为它创造了一个数学上干净的世界:当样本足够大时,抛硬币会让两组在一切特征上趋于相同——年龄、性别、收入、健康底色,甚至那些你根本没想到要测量的、连名字都没有的潜在混杂因素。此时两组之间唯一系统性的差别,就是"是否接受了处理",于是结局的差异只能归因于处理本身。这是统计学的惊人之美:一个看似放弃控制的动作(随机),反而实现了对一切已知与未知混杂的控制。再叠加上安慰剂对照与双盲(受试者和医生都不知道谁在哪一组),连"心理暗示"这条最后的混杂路径也被堵死。RCT不是完美的——它昂贵、缓慢,有时有伦理困境,结论的外推性也需要额外论证——但它是人类迄今为止发明的最强的因果识别装置。

RCT的影响力早已越出医学。2019年,诺贝尔经济学奖授予班纳吉、迪弗洛和克雷默,表彰他们"用实验方法缓解全球贫困"——三位经济学家把随机对照试验搬进了发展中国家的田野:在肯尼亚和印度的村庄里随机分配驱虫药、蚊帐补贴、教师激励、疫苗接种奖励,用硬数据回答"哪种扶贫手段真的有效"。他们的发现经常逆着直觉:免费提供驱虫药的成本收益远超补贴教育硬件,小小的激励能显著提高疫苗接种的完成率。随机化这把手术刀,从此同时解剖疾病与贫困。

配图

五、工具变量:向大自然借一次随机化

很多重要问题不能做随机试验:你不能随机命令一半人吸烟三十年,也不能随机禁止一半孩子上大学。这时,经济学家的办法是去寻找"大自然已经替我们做过的随机实验"——工具变量。乔舒亚·安格里斯特1990年的经典研究用了越南战争时期的征兵抽签:当年美国按生日抽签决定谁服兵役,生日被抽中纯属随机——它影响一个人的军旅经历,却与这个人的能力、家境、健康毫无关系。通过比较"被抽中与未被抽中"两类人此后的收入,安格里斯特估计出:越战服役经历使白人老兵的年收入比未服役者低了约15%。抽签日就是大自然抛出的硬币。

工具变量的三条件:另一个经典例子是戴维·卡德在20世纪90年代用"家附近有没有大学"来估计教育的回报——家离大学近会降低上学成本(提高入学率),但住址本身不会直接给工资单加钱。一个合格的工具变量必须满足三个条件:与处理变量真实相关(抽中生日的人确实更可能服役);只通过处理这一通道影响结果(生日本身不直接决定收入,这称为排他性约束);与一切混杂因素无关(抽签的随机性保证了这一点)。三个条件里,后两个无法被数据直接证明,只能靠制度知识与逻辑论证来捍卫——这正是工具变量研究的争议焦点,也是它的智力魅力所在。从抽签日到大学距离,从法官的随机分配到河流的走向,社会科学家们像侦探一样在世界里搜寻天然随机化的痕迹——因为找到一次,就等于免费获得一场不可能获批的实验。

六、因果推断的阶梯:从"看到"到"想象"

计算机科学家朱迪亚·珀尔在2018年出版的《为什么:关于因果关系的新科学》中,把因果推理画成了一架三级阶梯。第一级是关联:观察X与Y是否一起变化,回答"我看到什么"——公鸡打鸣与日出高度相关,这一级的能力动物和机器学习模型都有。第二级是干预:主动改变X,看Y是否随之改变,回答"如果我做这件事,会发生什么"——随机对照试验就站在这一级。第三级是反事实:想象一个未曾发生的世界,回答"如果当初不那样做,结果会不同吗"——“如果那天我没错过那班飞机"就属于这一级。珀尔的核心论点是:传统的统计学语言只能表达第一级,而人类因果思维的精华在第二、三级;要给机器装上因果智能,就必须给它们一门能书写"do"和"假如"的数学语言——他发明的因果图与结构方程正是为此而生。这架阶梯也为普通人提供了一把尺子:一条证据站在哪一级,它的结论就只配拥有哪一级的置信度。相关性研究登上新闻头条时,先问一句:这是看见,干预,还是想象?

七、日常的因果素养:希尔准则与决策清单

1965年,布拉德福德·希尔在伦敦皇家医学会的演讲中提出了后来被称为"希尔准则"的九条思考框架,帮助医学界在没有随机试验时权衡"观察到的关联该不该当作因果”:关联的强度、不同研究中的一致性、暴露的特异性、时间上的先后、剂量反应关系(暴露越多效应越强)、生物学合理性、与已知知识的连贯性、实验证据、与已知因果的类比。这九条里,只有"时间先后"是因果关系的铁律——原因必须发生在结果之前;其余各条都是加分项,累积得越多,因果解释就越难被推翻。吸烟与肺癌的因果确立,正是这些准则层层累积的胜利:强关联、剂量反应、多队列一致、加上动物实验,最终让"吸烟导致肺癌"在缺乏人体随机试验的情况下成为共识。

这条胜利之路有清晰的脚印:1950年,多尔与希尔在《英国医学杂志》发表病例对照研究,发现肺癌患者中重度吸烟者的比例惊人地高;1951年,他们又启动了对数万名英国医生的前瞻性队列研究,此后数十年的随访显示,吸烟量越大,肺癌死亡率越高——剂量反应、时间先后、跨人群的一致性、关联强度层层叠加,在从不进行人体随机试验的前提下,把这个结论钉成了二十世纪公共卫生领域最坚固的因果判断。

对普通人而言,因果素养可以压缩成一份三行的决策清单。看到任何"A与B相关"的说法,先问第一行:时间上谁先谁后——分不清先后,方向就无从谈起。再问第二行:有没有第三变量——找一个能同时解释A和B的幕后角色,冰淇淋式的事故大多数死在这一关。最后问第三行:有没有随机证据——有没有随机试验、自然实验或至少可信的对照组撑腰。三个问题都不需要高深的数学,却足以挡下新闻标题、养生爆款和推销话术里九成以上的因果忽悠。统计学留给公众最宝贵的遗产,不是某个公式,而是一种思维习惯:在"相关"这个词面前慢半拍——世界充满了手拉手的变量,但握住手的不一定是彼此,也可能是一双你看不见的手。

graph LR A["混杂变量"] --> B["反向因果"] B --> C["辛普森悖论"] C --> D["随机对照试验"] D --> E["工具变量"] E --> F["因果之梯"] F --> G["希尔准则"] classDef early fill:#667eea,stroke:#333,color:white classDef mid fill:#f093fb,stroke:#333,color:white classDef modern fill:#fbbf24,stroke:#333,color:black class A,B early class C,D mid class E,F,G modern