· Xiaojing Yang · Statistics · 4 min read
EN模型评估中的 Bootstrap Resampling
Bootstrap 通过反复重采样已有测试集,估计模型分数和模型差异的不确定性。
核心观点
Bootstrap 问的是:如果我只有这个测试集,反复重采样后分数会怎么波动?
1. 直觉
在很多 AI 项目里,重新收集一个大测试集很贵。Bootstrap 给了我们一种实用方法:用已经有的测试集估计不确定性。
N 个已评估样本
构造一个伪测试集
BLEU、chrF、accuracy、COMET、F1
几百或几千次
区间或差异分布
2. 为什么是有放回抽样?
有放回抽样允许某个样本出现多次,另一个样本完全不出现。这是在模拟:我们手上的测试集只是更大总体中的一次抽样。
original: [1, 2, 3, 4, 5]
sample: [2, 2, 4, 5, 5]bootstrap 得到的分数分布,可以告诉我们指标对测试集组成有多敏感。
3. 模型比较
对于 MT、摘要、分类这类同一批样本上的 paired tasks,bootstrap 更常用于比较系统差异,而不只是估计单个分数。
单模型 bootstrap
这个模型分数有多不确定?
配对 bootstrap
两个系统的差异有多稳定?
4. AI/NLP 例子
对于 English—Norwegian 领域机器翻译,我会在句对层面做 bootstrap。每个重采样测试集都为两个系统计算 BLEU、chrF、COMET。如果大多数重采样都显示 LoRA 优于 baseline,这比单一分数表更有证据力。
5. 局限
Bootstrap 不能修复坏测试集。如果测试集本身有偏、小、重复、缺少困难领域样本,bootstrap 只能估计这个有缺陷样本附近的不确定性。
总结
Bootstrap 是统计和 AI 评估之间最实用的桥之一:它不要求新数据,却能让不确定性可见。
参考资料和学习路线
这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。