· Xiaojing Yang · Statistics · 4 min read

EN

效应量:显著不等于重要

统计显著的结果,仍然可能小到没有研究或应用意义。

核心观点

统计显著问“能不能检测到”,效应量问“到底重要不重要”。

1. 为什么这篇要放得很早

AI 论文经常关注一个模型是否超过另一个模型。但当测试集很大时,很小的提升也可能统计显著。下一步应该问:这个效果在研究或应用上真的重要吗?

两个不同问题
差异
分数相差多少?
不确定性
噪声能否解释?
效应量
效果到底多大?
成本
我们付出了什么代价?
结论
是否值得强调?

2. 例子

Model A: 87.20 accuracy
Model B: 87.35 accuracy
difference: +0.15

这个差异在巨大 benchmark 上可能可以被检测出来。但如果新模型成本翻倍、速度更慢、可解释性更差,或者在少数安全关键样本上更差,那么 headline improvement 远远不够。

3. AI/NLP 中的效应量问题

场景效应量问题
分类到底多修正了几个样本?
MTBLEU/COMET 提升是否能在人类错误分析中看见?
RAG是否减少了 unsupported answers?
Bias evaluation差异是否有实际意义?
系统质量收益是否值得成本和延迟?

指标提升

一个数字变了。

研究贡献

这个变化改变了系统能稳定做到什么。

4. 我会怎么写

比起“our method significantly improves performance”,我更喜欢:

这个提升在统计上可检测,但幅度较小;它的实际价值取决于术语错误减少是否对目标领域重要。

总结

效应量让统计检验重新连接到研究意义。

参考资料和学习路线

这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。

Share:
Back to Blog

Related Posts

View All Posts »