· Xiaojing Yang · Statistics · 4 min read
EN作为统计模型的线性回归
线性回归不只是一条线,而是关于信号、噪声、假设和解释的统计模型。
核心观点
回归教会我们一个基本 ML 模式:预测 = 结构 + 噪声。
1. 不只是拟合一条线
线性回归常被讲成“给散点画一条最好的线”。这个直觉有用,但研究意义更深:回归把系统性结构和残差噪声区分开。
我们观察到什么
带权组合
模型无法解释的部分
估计结果
关于模型拟合的证据
2. 模型
y = β0 + β1x1 + ... + βpxp + ε系数描述的是在假设下的关系,残差则显示这个简单模型捕捉不到什么。
3. 为什么 AI 研究者仍然需要它
即使做深度模型,回归思维也到处出现:probing embeddings、分析错误因素、估计标注时间、测量 bias effect、建立 baseline。
作为预测器
用特征估计结果。
作为分析工具
问哪些变量解释了行为差异。
4. NLP 例子
假设我们用句长、术语密度、源语言、文档类型预测翻译错误率。回归模型不会替代神经机器翻译系统,但它能帮助我们发现哪些因素和错误相关。
5. 需要检查什么
| 检查 | 为什么重要 |
|---|---|
| 残差模式 | 暗示模型遗漏了结构 |
| 异常点 | 稀有样本可能强烈影响拟合 |
| 共线性 | 特征可能含义重叠 |
| 训练/测试划分 | 拟合好不等于泛化好 |
总结
线性回归是小模型,但它训练的是大习惯:说明模型解释了什么,以及还没有解释什么。
参考资料和学习路线
这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。