· Xiaojing Yang · NLP and LLMs · 3 min read
EN词向量与句向量
离散语言如何变成向量空间,以及句向量为什么对检索和评估重要。
核心观点
Embedding 把符号文本变成几何对象,让模型可以比较、变换和检索。
1. 从词到向量
词是离散符号,神经模型需要数字。Embeddings 把 token、词、句子或文档映射到稠密向量空间,让相似性可以被计算。
一个模型 token
词汇意义
句子级语义
更长上下文
最近邻搜索
2. 为什么句向量不一样
词向量表示词项。句向量试图把上下文、句法、主题和意义压缩到一个向量里。这种压缩有用,但也会丢信息。
| 用途 | Embedding 层级 |
|---|---|
| 相似词 | word embeddings |
| 语义搜索 | sentence/document embeddings |
| RAG 检索 | passage embeddings |
| MT 评估 | multilingual sentence representations |
3. Hugging Face 实践
from transformers import AutoTokenizer, AutoModel
name = "sentence-transformers/all-MiniLM-L6-v2"
tokenizer = AutoTokenizer.from_pretrained(name)
model = AutoModel.from_pretrained(name)4. 我的研究连接
Embeddings 直接连接 RAG、COMET 风格 MT evaluation、多语相似度和错误分析。在石油领域 MT 中,句向量可以帮助观察技术意义是否保留,即使表面措辞不同。
相似性视角
向量距离近,就被认为语义相关。
注意
Embedding similarity 可能漏掉事实 groundedness、领域术语和否定。
总结
Embedding 强大,是因为它让语言可以被测量;但测量永远不等于完整意义。
面试回答模板
如果面试问到这个概念,我通常会这样回答:
- 用一句话定义;
- 解释数据如何流动;
- 指出主要失败模式;
- 连接到 evaluation、multilinguality 或 fine-tuning。
参考资料
- Hugging Face Course
- Hugging Face Transformers documentation
- Hugging Face tokenizer summary
- Hugging Face fine-tuning guide
- Hugging Face PEFT
- The Illustrated Transformer
- Speech and Language Processing, Jurafsky & Martin
- Stanford CS224N readings
- Attention Is All You Need
- COMET: A Neural Framework for MT Evaluation