· Xiaojing Yang · Statistics · 3 min read
EN最大似然估计:模型为什么能学习参数
最大似然把概率模型和参数学习连接起来。
核心观点
MLE 选择的是让观察数据在模型下最“合理”的参数。
1. 核心问题
如果一个模型有参数,我们应该怎么选?最大似然估计的答案是:选择让观察数据在模型下概率最高的参数。
带参数的概率故事
我们看到了什么
数据在参数下有多合理
寻找最佳参数
用于预测或分析
2. 从概率到学习
很多 ML loss 本质上可以理解为 negative log-likelihood。分类任务里最小化 cross-entropy,可以看成最大化正确标签的似然。
似然视角
选择最能解释观察数据的参数。
损失视角
减少给真实标签低概率带来的惩罚。
3. AI/NLP 例子
语言模型训练模型给观察到的 token 序列高概率。next-token prediction loss 不只是工程技巧,它也是基于似然的学习目标。
4. 注意
MLE 依赖模型族和数据。如果数据有偏、噪声大或不代表真实任务,拟合出来的参数也会继承这些问题。
总结
MLE 是统计建模和 ML 训练之间的桥:学习就是找到让观察数据更可能的参数。
参考资料和学习路线
这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。