· Xiaojing Yang · Statistics · 3 min read

EN

PCA:从方差到表示空间

PCA 连接了方差、投影和表示空间,是理解 embedding 与降维的重要入口。

核心观点

PCA 找到数据变化最大的方向,并把这些方向作为更简洁的表示。

1. 几何直觉

PCA 从一团点开始问:数据沿哪些方向变化最大?这些方向就是 principal components。

PCA 流程
数据矩阵
样本 × 特征
中心化
去掉均值
协方差
衡量共同变化
特征向量
找到主要方向
投影
用更少维度表示数据

2. 为什么方差重要

如果某个方向方差大,说明点在这个方向上分散得多。PCA 保留高方差方向,是因为这些方向在线性投影下保留更多结构。

原始空间

维度很多,通常很难观察。

PCA 空间

维度更少,保留主要变化。

3. AI/NLP 例子

Embedding 空间通常是高维的。PCA 可以把 word、sentence 或 document embeddings 投影到 2D/3D,用于观察 cluster、domain shift、outlier 和 artifact。它不能完全解释神经表示,但很适合作为探索工具。

4. 注意事项

注意含义
PCA 是线性的可能看不见非线性结构
高方差不一定等于语义频率或风格可能主导
可视化可能误导2D 投影会丢信息
scaling 很重要特征尺度会改变 component

总结

PCA 的价值在于把方差转化为表示。对 AI 研究来说,它常常是探索性镜头,不是最终证明。

参考资料和学习路线

这篇笔记采用的是适合我 AI/NLP 研究目标的路线:先用 Seeing Theory、看见统计和 StatQuest 建立直觉,再用 Think Stats 连接 Python 实践,最后用 ISLR/ISLP、CS229 和统计推断资料补足机器学习与研究表达。

Share:
Back to Blog

Related Posts

View All Posts »
FoundationsStatisticsEN

Bias-Variance Trade-off

Bias and variance explain why both too-simple and too-flexible models can fail.