· Xiaojing Yang · Statistics · 4 min read

EN

置信区间:为什么一个分数不够

没有不确定性的模型分数很好读,也最容易被过度相信。

核心观点

置信区间把一个孤零零的分数,变成一段更诚实的可能范围。

1. 一个数字的问题

模型评估经常以分数表结束。分数表有用,但它会悄悄隐藏抽样不确定性。如果测试集稍微换一批样本,分数可能就会变化。

从分数到区间
测试样本
有限样本
指标
测量输出的规则
观察分数
一次结果
不确定性估计
分数可能怎么波动
区间
可能值范围

2. 区间的作用

置信区间不是装饰。它会把“模型得了 87.4”改写成:“在这个评估流程下,合理的真实表现大概落在这个范围附近。”

score = 87.4
95% CI = [86.1, 88.6]

这个范围是负责任解释的开始。

3. 比较模型

如果 Model A 是 87.4,Model B 是 87.1,仅靠数字大小并不能说明差异有意义。它们的不确定性范围可能大量重叠,或者 paired difference 并不稳定。

排行榜习惯

选择更大的数字。

研究习惯

问这个差异是否稳定、是否有实际意义、是否被合适指标看见。

4. AI/NLP 例子

在 LLM evaluation 里,benchmark accuracy 会受到 prompt、抽样样本、decoding setting、judge behavior 的影响。报告置信区间会让结果没那么“漂亮”,但更可信。

5. 写作模板

薄弱说法更好的说法
Model A 比 Model B 好。Model A 在这个测试集上更高,但区间显示差异较小。
系统达到 91%。系统在这个样本上达到 91%;推广前需要检查不确定性。
提升很明显。观察到的提升大于 seed variation,并被 bootstrap intervals 支持。

总结

一个分数只是一次观察。置信区间帮助我们把观察变成更可靠的证据。

参考资料和学习路线

这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。

Share:
Back to Blog

Related Posts

View All Posts »