· Xiaojing Yang · NLP and LLMs · 3 min read
ENSequence-to-Sequence Models
机器翻译、摘要和许多生成任务背后的 encoder-decoder 思想。
核心观点
Seq2seq 模型把一个序列变成另一个序列:先编码,再一步步解码。
1. 任务形状
很多 NLP 任务天然是 sequence-to-sequence:翻译、摘要、问答、data-to-text generation、语法纠错。
输入 tokens
上下文表示
已经生成了什么
预测下一步
完整输出
2. 它为什么重要
在 Transformers 之前,encoder-decoder RNN 让神经机器翻译变得可行。Attention 又改进了它,让 decoder 可以回看 source states,而不是只依赖一个固定向量。
| 组件 | 作用 |
|---|---|
| Encoder | 读取源文本 |
| Decoder | 生成目标文本 |
| Attention | 选择相关源信息 |
| Teacher forcing | 用真实前文 token 训练 |
3. Hugging Face 实践
from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
name = "Helsinki-NLP/opus-mt-en-no"
tokenizer = AutoTokenizer.from_pretrained(name)
model = AutoModelForSeq2SeqLM.from_pretrained(name)4. 我的研究连接
English—Norwegian MT 就是 seq2seq 问题。领域适配要问的是:当源文本包含稀有石油术语和正式文档风格时,模型能不能生成技术上正确的目标文本。
核心优势
Seq2seq 可以把变长输入映射到变长输出。
核心风险
生成可以很流畅,却仍然遗漏源文本细节。
总结
Seq2seq 是 MT 的任务语法:输入文本变成输出文本,但忠实性必须被认真评估。
面试回答模板
如果面试问到这个概念,我通常会这样回答:
- 用一句话定义;
- 解释数据如何流动;
- 指出主要失败模式;
- 连接到 evaluation、multilinguality 或 fine-tuning。
参考资料
- Hugging Face Course
- Hugging Face Transformers documentation
- Hugging Face tokenizer summary
- Hugging Face fine-tuning guide
- Hugging Face PEFT
- The Illustrated Transformer
- Speech and Language Processing, Jurafsky & Martin
- Stanford CS224N readings
- Attention Is All You Need
- COMET: A Neural Framework for MT Evaluation