· Xiaojing Yang · NLP and LLMs · 3 min read

EN

Sequence-to-Sequence Models

机器翻译、摘要和许多生成任务背后的 encoder-decoder 思想。

核心观点

Seq2seq 模型把一个序列变成另一个序列:先编码,再一步步解码。

1. 任务形状

很多 NLP 任务天然是 sequence-to-sequence:翻译、摘要、问答、data-to-text generation、语法纠错。

Seq2seq 流程
源序列
输入 tokens
Encoder
上下文表示
Decoder state
已经生成了什么
Next token
预测下一步
目标序列
完整输出

2. 它为什么重要

在 Transformers 之前,encoder-decoder RNN 让神经机器翻译变得可行。Attention 又改进了它,让 decoder 可以回看 source states,而不是只依赖一个固定向量。

组件作用
Encoder读取源文本
Decoder生成目标文本
Attention选择相关源信息
Teacher forcing用真实前文 token 训练

3. Hugging Face 实践

from transformers import AutoTokenizer, AutoModelForSeq2SeqLM

name = "Helsinki-NLP/opus-mt-en-no"
tokenizer = AutoTokenizer.from_pretrained(name)
model = AutoModelForSeq2SeqLM.from_pretrained(name)

4. 我的研究连接

English—Norwegian MT 就是 seq2seq 问题。领域适配要问的是:当源文本包含稀有石油术语和正式文档风格时,模型能不能生成技术上正确的目标文本。

核心优势

Seq2seq 可以把变长输入映射到变长输出。

核心风险

生成可以很流畅,却仍然遗漏源文本细节。

总结

Seq2seq 是 MT 的任务语法:输入文本变成输出文本,但忠实性必须被认真评估。

面试回答模板

如果面试问到这个概念,我通常会这样回答:

  1. 用一句话定义;
  2. 解释数据如何流动;
  3. 指出主要失败模式;
  4. 连接到 evaluation、multilinguality 或 fine-tuning。

参考资料

Share:
Back to Blog

Related Posts

View All Posts »
FoundationsNLP and LLMsEN

Attention Mechanism

Attention as a learned way to decide what context matters for each token.

FoundationsNLP and LLMsEN

Fine-Tuning Transformers

How pretrained language models are adapted to a task or domain with supervised data.

FoundationsNLP and LLMsEN

LLM Evaluation and Failure Modes

A practical map of LLM evaluation risks: hallucination, prompt sensitivity, bias, contamination, and brittle benchmarks.

FoundationsNLP and LLMsEN

NLP Evaluation

Why NLP evaluation needs metrics, uncertainty, human judgment, and task-specific error analysis.