· Xiaojing Yang · Statistics · 5 min read

EN

机器学习中的概率分布

概率分布不是抽象曲线,而是关于数据、标签、误差和模型行为的假设。

核心观点

分布是一种压缩叙事:哪些值可能出现,它们分别有多可能。

1. 为什么分布重要

机器学习里到处都是分布假设,即使我们没有明确说出来。分类任务假设标签来自某种过程;回归任务假设误差有结构;语言模型学习 token 的概率分布;检索系统面对的 query 分布也会随时间变化。

分布出现在哪里
数据
样本长什么样
标签
结果如何生成
误差
预测如何偏离
参数
哪些参数值更合理
分数
评估结果如何波动

2. 离散分布和连续分布

离散分布描述可数结果,比如 token ID、类别标签、某个 retrieval result 是否相关。连续分布描述连续量,比如 embedding 维度、延迟、loss、标注时间。

分布直觉AI 例子
Bernoulli是/否事件预测正确或错误
Binomial成功次数N 个样本里答对几个
Categorical多类别之一情感类别或下一个 token
Normal围绕中心的噪声测量重复评估得到的指标
Long-tailed大量稀有事件词频、领域、用户查询

3. 隐藏风险:真实数据经常不整齐

文本数据很少真的“像正态分布一样干净”。token frequency 是长尾的,领域分布是不均匀的,标注错误也不一定独立。一个 benchmark 可能包含很多简单样本,却低估少数但重要的失败类型。

所以分布思维不只是数学,它也是诊断工具:哪些样本常见?哪些样本稀有?训练、测试、部署之间发生了什么变化?

公式视角

分布给出概率或密度。

研究视角

分布告诉我们实验实际上从哪里抽样。

4. AI/NLP 例子

在领域机器翻译里,通用网页文本和石油监管文件来自不同分布。模型可能学会了常见语言模式,但测试领域包含大量不常见技术短语。一个模型可以在大分布上看起来很强,却在真正重要的长尾案例上失败。

总结

分布帮助我不把数据看成中性的样本堆,而是追问:这个数据集代表哪个世界?模型之后会面对哪个世界?

参考资料和学习路线

这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。

Share:
Back to Blog

Related Posts

View All Posts »
FoundationsStatisticsEN

Bias-Variance Trade-off

Bias and variance explain why both too-simple and too-flexible models can fail.