· Xiaojing Yang · Machine Learning · 3 min read
EN过拟合与正则化
模型为什么会学到噪声,验证曲线如何暴露它,正则化如何控制它。
核心观点
过拟合是模型在训练样本上变得很优秀,却在样本外不可靠。
1. 直觉
模型应该学习可复用结构。过拟合意味着它还学到了训练集里的偶然细节:噪声、重复、标注习惯、数据集特有捷径。
训练误差和验证误差都高
验证表现改善
训练继续变好但验证变差
2. 正则化
正则化会抑制不必要复杂度。它可以是 L1/L2 惩罚、early stopping、dropout、data augmentation、pruning 或架构约束。
| 方法 | 实际效果 |
|---|---|
| L2 / weight decay | 让权重更小、更平滑 |
| L1 | 鼓励稀疏特征 |
| Early stopping | 在记忆加深前停止 |
| Dropout | 减少对单一路径的依赖 |
| Data augmentation | 让捷径没那么有用 |
3. sklearn 例子
from sklearn.linear_model import LogisticRegression
model = LogisticRegression(C=0.1, penalty="l2", max_iter=1000)
model.fit(X_train, y_train)在很多 scikit-learn 线性模型里,C 越小,正则化越强。
4. AI/NLP 连接
在小规模领域 NLP 数据中,过拟合可能意味着记住文档模板,或者记住同时出现在 train/validation 里的术语。对于 fine-tuning,正则化也意味着限制预训练模型被改动的程度。
面试回答
过拟合是模型学习了噪声或样本特有模式,导致泛化失败。
研究回答
我们用 held-out data、learning curves、seed variation 和领域错误分析来诊断它。
总结
正则化不只是数学惩罚,而是让模型必须“证明”复杂度值得。
面试回答模板
如果面试问到这个概念,我会分四层回答:
- 先给短定义;
- 再讲直觉;
- 指出常见失败模式;
- 最后连接到真实评估或部署决策。