· Xiaojing Yang · Statistics · 4 min read
ENAI 研究中的相关性与因果性
相关性是有用证据,但因果结论需要更强的实验设计和假设。
核心观点
相关性可以引导调查;因果性需要排除其他解释的设计。
1. 区别
相关性表示两个变量一起变化。因果性表示在明确干预下,改变一个变量会改变另一个变量。AI 研究里很容易从前者太快滑到后者。
X 和 Y 一起变化
X 能帮助预测 Y
改变 X 会改变 Y
我们知道为什么
在其他设置下也成立
2. 为什么 AI 论文容易出问题
模型训练在复杂数据上。混杂因素到处都是:领域、语言、标签质量、prompt 风格、标注者行为、数据来源、算力预算。一个模式可能真实存在,但不一定是因果关系。
相关性说法
更长 prompts 和更高分数相关。
因果说法
在其他条件控制后,让 prompt 更长会提高分数。
3. AI/NLP 例子
假设一个多语模型在某个语言上表现更差。语言本身未必是原因。真正原因可能是训练数据质量较低、领域混合不同、tokenization 效率差,或者评估数据更差。
4. 更好的习惯
| 习惯 | 为什么有帮助 |
|---|---|
| 指出混杂因素 | 避免过度简单解释 |
| 使用受控比较 | 减少替代解释 |
| 做 ablation | 检查机制 |
| 观察性设计中避免因果语言 | 保持结论诚实 |
总结
相关性不是没用,它常常是第一条线索。但 AI 研究要可信,因果语言必须被实验设计赢得,而不是默认拥有。
参考资料和学习路线
这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。