循环神经网络-基于门控(LSTM)
摘要
由于循环神经网络存在的长程依赖问题,对网络模型进行改进,由此提出长短期记忆网络和门控循环单元网络。
5.长程依赖问题
循环神经网络在学习过程中主要问题是由于梯度消失或爆炸问题,很难建模长时间间隔的状态之间的依赖关系。
虽然简单循环网络理论上可以建立长时间间隔的状态之间的依赖关系,但是又由于梯度爆炸或消失问题,实际上只能学习到短期的依赖关系。这样,如果时间间隔较大,简单神经网络很难建模长距离依赖关系即长程依赖问题。
5.1改进方案
1.选取何时参数,同时使用非饱和的激活函数,需要足够的人工调参经验,限制了模型的广泛应用。
2.改进模型或优化方法来缓解循环网络的梯度爆炸和梯度消失问题。
梯度爆炸——权重衰减or梯度截断
梯度消失——改变模型,因存在梯度爆炸问题和记忆容量问题,由此引入门控机制进一步改进。

6.基于门控的循环神经网络
有5.1中提到的公式基础上引入门控机制来控制信息的累积速度,包括有选择的加入新的信息,并有选择地遗忘之前累积的信息。基于门控的循环神经网络主要包括:长短期记忆网络和门控循环单元网络。
6.1长短期记忆网络
LSTM网络引入门控机制来控制信息传递的路径,三个门分别为输入门it、遗忘门ft和输出门ot
(1) 遗忘门控制上一个时刻的内部状态需要遗忘多少信息。
(2) 输入门控制当前时刻的候选状态有多少信息需要保存。
(3) 输出们控制当前时刻的内部状态有多少信息需要输出给外部状态。
LSTM网络中的“门”是一种“软”门,取值在 (0, 1)之间,表示以一定的比例允许信息通过。
计算方式:

σ()为Logistic函数,输出区间为(0,1)

一般在深度网络参数学习时,参数初始化的值一般都比较小.但是在训练 LSTM 网络时,过小的值会使得遗忘门的值比较小.这意味着前一时刻的信息大部分都丢失了,这样网络很难捕捉到长距离的依赖信息.并且相邻时间间隔的梯度会非常小,这会导致梯度弥散问题.因此遗忘的参数初始值一般都设得比较大,其偏置向量设为1或2。
6.2门控循环单元网络
GRU是一种比LSTM网络更加简单的循环神经网络。
GRU网络引入门控机制来控制信息更新的方式,但不引用额外的记忆单元,在5.1基础上引入一个更新门来控制当前状态需要从历史状态中保留多少信息,以及需要从候选状态中接受多少信息。



更多推荐
所有评论(0)