加载中...

Seq2Seq(Sequence-to-Sequence,序列到序列)是 2014 年由 Sutskever 等人和 Cho 等人分别提出的神经网络框架,用编码器将输入序列压缩为向量表示,再由解码器逐步生成输出序列,首次让端到端神经网络在机器翻译上达到实用水平。
经典实现以 LSTM 或 GRU 作为编码器和解码器:编码器读入源句得到上下文向量,解码器以其为初始状态,自回归地逐词生成目标句。训练常用教师强制(teacher forcing),推断则配合束搜索。
固定长度向量成为长句翻译的瓶颈,Bahdanau 等人于 2015 年引入注意力机制,让解码器每一步动态关注源句的不同位置,这一思想最终演化为完全基于注意力的 Transformer。
Seq2Seq 范式适用于机器翻译、文本摘要、对话生成、语音识别和代码生成等一切「序列进、序列出」的任务,是现代生成式模型的直接前身。

登录 后参与讨论
暂无讨论,来发表第一条评论吧