神经网络 3.3:LSTM(长短期记忆网络)—— 为 RNN 装上“记忆阀门”*详细图解+代数表达+示例数据=通俗易懂!*
回顾通俗讲解神经网络合集往期内容:
神经网络1.0感知机
一朵苞米花,公众号:一朵苞米花 神经网络1.0:感知机(Perceptron)--神经网络的原点!*详细图解+代数表达+示例数据=通俗易懂*
神经网络2.0MLP
一朵苞米花,公众号:一朵苞米花 神经网络2.0:MLP/ 前馈神经网络 --非线性从哪里来?*详细图解+代数表达+示例数据=通俗易懂*
神经网络3.1:卷积神经网络
一朵苞米花,公众号:一朵苞米花 神经网络3.1:卷积神经网络(CNN) —— 给 MLP 加上“空间先验”*详细图解+代数表达+示例数据=通俗易懂!*
神经网络3.2:递归神经网络(RNN)
一朵苞米花,公众号:一朵苞米花 神经网络3.2:递归神经网络(RNN)—— 给 MLP 加上“时间记忆”。*详细图解+代数表达+电价预测示例数据=通俗易懂!*
首先上lstm的结构图,一图便可看懂,看不懂的话,带着图片去找定义,然后慢慢理解!!!

LSTM 通过门控机制解决了传统 RNN 的梯度消失问题,不仅能学到短期的变化趋势还能学长期的变动趋势。适合处理长序列依赖和复杂时序模式的数据。
🌍 一、LSTM 的主要应用领域(长时依赖与复杂序列数据)
LSTM 通过门控机制解决了传统 RNN 的梯度消失问题,不仅能学到短期的变化趋势还能学长期的变动趋势。适合处理长序列依赖和复杂时序模式的数据。典型应用包括:
📝 1. 自然语言处理(NLP)
- 机器翻译(如神经机器翻译 NMT)
- 长文本生成(如文章续写、对话系统)
- 文档分类与情感分析(需上下文关联的语义理解)
- 语法解析(如依存句法分析)
- 序列特征:词之间存在跨句甚至跨段落的长期依赖(如代词指代、逻辑连贯性)。
🔊 2. 语音与音频处理
- 语音识别(如长语音命令识别、会议转录)
- 语音合成(如生成自然语流的长文本语音)
- 音乐生成(如基于前奏创作完整旋律)
- 序列特征:声学信号需捕捉
跨帧甚至跨秒的上下文模式(如音调变化、语速连贯性)。
📈 3. 时间序列预测
- 股票价格预测(需分析历史趋势与波动模式)
- 能源消耗预测(如电力、天然气长期需求规划)
- 疾病进展预测(如基于患者历史数据的慢性病发展建模)
- 序列特征:当前值与遥远历史状态存在非线性关联(如周期性、突发性变化)。
🎥 4. 视频与行为建模
- 视频描述生成(如为视频自动生成字幕或摘要)
- 行为轨迹预测(如自动驾驶中预测行人运动路径)
- 多模态时序建模(如结合视频帧与传感器数据的动作识别)
- 序列特征:帧间依赖可能跨越数十甚至上百帧(如运动物体轨迹、场景切换逻辑)。
🧬 5. 生物与医疗数据
- 基因序列分析(如预测蛋白质结构、识别致病突变)
- 脑电信号(EEG)分类(如癫痫发作检测)
- 心电图(ECG)异常检测(需捕捉跨心跳周期的微小变化)
- 序列特征:生物信号存在跨时间尺度的复杂模式(如基因调控网络、神经元脉冲传播)。
❓ 二、为什么 LSTM 特别适合这些任务?
核心原因可概括为:LSTM 通过门控机制实现了对“长时依赖”的精准控制,同时避免梯度消失/爆炸。具体优势分解如下:
🔐 1. 门控机制(Gating Mechanism)
- 输入门、遗忘门、输出门:
- 动态调节信息流,决定保留、丢弃或更新哪些历史信息。
- 解决梯度问题:通过选择性记忆,保持对关键长期依赖的敏感度。
- 技术意义:
- 传统 RNN:所有历史信息平等参与计算,导致梯度指数级衰减。
- LSTM:通过门控“过滤”无关信息,保留对当前预测有用的长期上下文。
🧠 2. 细胞状态(Cell State)作为“长期记忆”
- 细胞状态Ct;
- 汇总被门控筛选后的历史信息,形成“精华记忆”。
- 通过非线性变换(如 tanh)增强模型表达能力。
- 技术意义:
- 传统 RNN:隐状态ht 简单线性组合,容量有限且易饱和。
- LSTM:细胞状态Ct 经过门控和变换,可存储更复杂的时序模式。
⏱️ 3. 因果结构与在线预测
- 计算顺序:当前状态仅依赖过去和当前输入,不依赖未来信息(符合物理世界因果律)。
- 在线适用性:支持逐帧实时预测(如股票实时交易、语音实时识别)。
- 技术意义:
- 传统 RNN:因梯度问题无法处理超长序列,被迫截断输入(破坏因果性)。
- LSTM:通过门控和细胞状态,保持对遥远历史的“软注意力”,兼容因果性。
📐 4. 非线性状态转移与可学习性
- 对比传统模型:
- ARIMA/Kalman 滤波:假设线性关系,需手动设计特征工程。
- LSTM:通过反向传播自动学习非线性状态转移规则,适应复杂动态系统(如金融市场、生物信号)。
- 技术意义:
- LSTM 的状态转移是数据驱动的,而非人工假设的,泛化能力更强。
🔄 5. 缓解梯度问题与长程建模
- 梯度流动:
- LSTM 的门控机制切断无关梯度路径,使梯度能稳定传播到早期时间步。
- 技术意义:
- 传统 RNN:梯度随时间步指数衰减,无法学习超过 5-10 步的依赖。
- LSTM:通过遗忘门“主动遗忘”干扰信息,保持梯度有效性,可建模数百步甚至更长的依赖。
📚 三、 LSTM的基本结构(与简易RNN 的对比)
LSTM(长短期记忆网络)和最简单的RNN(循环神经网络)在结构设计上均围绕序列建模的核心目标,但LSTM通过引入门控机制显著提升了处理长时依赖的能力。以下是两者的共同点与不同点的详细对比:

1.共同点
1.1 循环结构(Recurrent Structure)
RNN:每个时间步的隐状态 由当前输入和上一时间步的隐状态共同决定,形成时间上的循环连接。
LSTM:同样通过循环结构传递信息,但隐状态和细胞状态共同构成循环路径。
意义:两者均能处理变长序列,且参数共享(所有时间步共享同一组权重)。
1.2 隐状态传递历史信息
RNN:隐状态直接汇总历史输入的信息,作为当前时间步的输出或下一时间步的输入。
LSTM:隐状态由细胞状态通过输出门生成,间接传递历史信息。
意义:两者均通过隐状态实现“记忆”功能,但LSTM的传递方式更复杂。
1.3 因果性(Causality)
RNN:计算顺序严格从过去到未来,当前输出仅依赖历史和当前输入,不依赖未来信息。
LSTM:同样遵循因果性,适合在线预测(如实时语音识别)。
意义:两者均符合物理世界的因果律,避免信息泄露。
2. 不同点
2.1 核心结构设计
2. 不同点
2.1 核心结构设计
| 特性 | RNN | LSTM |
|---|---|---|
| 状态类型 | 单一隐状态 | 双重状态:细胞状态Ct + 隐状态 |
| 门控机制 | 无 | 输入门、遗忘门、输出门 |
| 状态更新方式 | 隐状态更新 | 细胞状态更新隐状态更新 |
| 非线性激活函数 | 通常使用tanh或ReLU | 门控使用 σ(输出范围 [0,1]),状态更新使用tanh |
2.2 关键机制对比
RNN 的问题:
梯度消失/爆炸:由于隐状态通过简单线性组合传递,梯度在反向传播时可能指数级衰减或增长,导致无法学习长时依赖(通常超过 5-10 步)。
记忆容量有限:单一隐状态难以同时存储短期和长期信息,易被最新输入覆盖。
LSTM 的改进:
门控机制:
输入门:控制当前输入信息有多少进入细胞状态。
遗忘门:决定保留多少历史细胞状态信息(可主动“遗忘”无关内容)。
输出门:调节细胞状态中有多少信息输出到隐状态。
细胞状态:作为“长期记忆”载体,通过加法更新(而非RNN的线性组合),缓解梯度消失问题。
仅通过门控和少量非线性变换(tanh)修改,保持梯度流动的稳定性。
2.3 参数与计算复杂度
RNN:
参数数量少
计算复杂度:低(单层矩阵乘法 + 非线性激活)。
LSTM:
参数数量多,总参数约为RNN的4倍。
计算复杂度:高(需多次矩阵乘法、门控计算和逐元素操作)。
2.4 适用场景
RNN:
适合短序列任务(如短文本分类、简单时间序列预测)。
优势:计算效率高,模型简单。
LSTM:
适合长序列任务(如机器翻译、语音识别、基因序列分析)。
优势:能捕捉跨数十甚至上百步的长期依赖,但需更多数据和计算资源。
📚 四、 LSTM的代数表达(全是公式公式公式,不喜欢的兄弟们直接移步下一个part!!!!!!!)
📐4.1 LSTM 的代数形式(在 RNN 基础上的门控扩展),为了方便对比理解,严格沿用上一篇RNN给定的符号体系:
![]()
🧠4.2 LSTM(Long Short-Term Memory)的核心思想是:
将“状态”拆分为「记忆单元」与「输出状态」,并用门控机制控制信息流。
因此,在原有ht 之外,引入:
ct:第 t 个时间步的记忆单元状态(Cell State)
🔐 4.3 门控变量定义!!!!!!!
LSTM 在每个时间步引入三个门和一个候选状态:
- 遗忘门(Forget Gate)
![]()
- 输入门(Input Gate)

- 候选记忆(Candidate State)

- 输出门(Output Gate)

其中:
- σ(⋅):Sigmoid 函数(门控)
- tanh(⋅):状态非线性
- U∗,V∗:对应门的权重矩阵
🧠 4.4 记忆单元更新(Cell State Update)!!!!!!!!
记忆单元采用线性加法路径:
![]()
含义分解:

📤 4.5 隐藏状态输出!!!!!!!!!!!!!
隐藏状态由记忆单元调制得到:
![]()
输出层仍然保持与RNN前面一致的形式:
![]()
📌 LSTM 的关键改进点

梯度可以沿着 ct 的线性通道稳定传播,从而有效缓解 RNN 的梯度消失问题。
往期内容回顾(点进文章末尾,点击即可跳转查看这些文章)
https://mp.weixin.qq.com/s/3j-a6lZx0RR1sNIWKiTumg

更多推荐
所有评论(0)