· Xiaojing Yang · Statistics · 4 min read
EN置信区间:为什么一个分数不够
没有不确定性的模型分数很好读,也最容易被过度相信。
核心观点
置信区间把一个孤零零的分数,变成一段更诚实的可能范围。
1. 一个数字的问题
模型评估经常以分数表结束。分数表有用,但它会悄悄隐藏抽样不确定性。如果测试集稍微换一批样本,分数可能就会变化。
有限样本
测量输出的规则
一次结果
分数可能怎么波动
可能值范围
2. 区间的作用
置信区间不是装饰。它会把“模型得了 87.4”改写成:“在这个评估流程下,合理的真实表现大概落在这个范围附近。”
score = 87.4
95% CI = [86.1, 88.6]这个范围是负责任解释的开始。
3. 比较模型
如果 Model A 是 87.4,Model B 是 87.1,仅靠数字大小并不能说明差异有意义。它们的不确定性范围可能大量重叠,或者 paired difference 并不稳定。
排行榜习惯
选择更大的数字。
研究习惯
问这个差异是否稳定、是否有实际意义、是否被合适指标看见。
4. AI/NLP 例子
在 LLM evaluation 里,benchmark accuracy 会受到 prompt、抽样样本、decoding setting、judge behavior 的影响。报告置信区间会让结果没那么“漂亮”,但更可信。
5. 写作模板
| 薄弱说法 | 更好的说法 |
|---|---|
| Model A 比 Model B 好。 | Model A 在这个测试集上更高,但区间显示差异较小。 |
| 系统达到 91%。 | 系统在这个样本上达到 91%;推广前需要检查不确定性。 |
| 提升很明显。 | 观察到的提升大于 seed variation,并被 bootstrap intervals 支持。 |
总结
一个分数只是一次观察。置信区间帮助我们把观察变成更可靠的证据。
参考资料和学习路线
这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。