加载中...
LSTM(Long Short-Term Memory,长短期记忆网络)通过引入遗忘门、输入门和输出门,解决了 RNN 梯度消失问题,让网络真正能记住长距离依赖。它在 2015-2018 年间几乎主导了序列建模的所有任务。

| 类型 | 门控循环网络 |
| 提出者 | Hochreiter & Schmidhuber,1997 |
| 改进版 | GRU(Cho et al., 2014) |
1997 年 Hochreiter 和 Schmidhuber 提出 LSTM,核心创新是细胞状态(cell state)——一条独立的信息高速公路,搭配三个可学习的门控来决定信息如何流动:
这三个门都是通过反向传播学习出来的,网络自己决定「什么值得记住、什么该忘掉」,而非人工规定。[1]
LSTM 的鼎盛期在 2015-2018 年:Google 语音识别、Siri、百度语音、机器翻译纷纷采用。2016 年谷歌宣布语音识别错误率下降 49%,很大程度上归功于 LSTM。GRU(Gated Recurrent Unit,2014)是简化版本,少一个门,参数更少,在很多任务上效果相当。
2018 年 BERT 横空出世,LSTM 快速式微。但它并未消亡:在时间序列预测(股票、传感器数据)、小型设备上的语音唤醒词检测等场景,LSTM 因为参数少、推理延迟低、不需要大算力,至今仍在工业界大量使用。

| 类型 | 门控循环网络 |
| 提出者 | Hochreiter & Schmidhuber,1997 |
| 改进版 | GRU(Cho et al., 2014) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧