[深度学习] Recurrent Units详细计算过程——LSTM

最新推荐文章于 2024-06-18 19:07:26 发布

手撕机

最新推荐文章于 2024-06-18 19:07:26 发布

阅读量1.4k

点赞数 4

分类专栏：深度学习文章标签： lstm 深度学习

原创文章，未经授权请勿转载。

本文链接：https://blog.csdn.net/guolindonggld/article/details/79223688

版权

深度学习专栏收录该内容

1 篇文章 0 订阅

订阅专栏

通常一个LSTM只需要指定输入向量 $x_t$ 和输出向量 $h_t$ 的维度，向量 $C_{t-1}$ 、 $C_t$ 、 $h_{t-1}$ 的维度都跟 $h_t$ 是一样的。

我们假设 $x_t$ 维度是2， $h_t$ 维度为3。

1、计算公式

1.1 遗忘门（Forget Gate）计算

在这里插入图片描述

这里的参数就是 $W_f$ 和 $b_f$ 了。 $h_{t-1}, x_t]$ ，中括号表示向量合并，得到一个5维的向量，所以 $W_f$ 是3×5维的矩阵。

所以这里的参数个数3×5+3=18。

$\sigma$ 表示输出一个元素取值范围为(0,1)的向量。

1.2 输入门（Input Gate）计算

在这里插入图片描述

这里的参数就是 $W_i$ 和 $b_i$ 和 $W_C$ 和 $b_C$ ，类似地，参数个数为18*2=36。

$t a n h$ 表示输出一个元素取值范围为(-1,1)的向量。

1.3 输出门（Output Gate）计算

在这里插入图片描述
这里的参数就是 $W_o$ 和 $b_o$ ，类似地，参数个数为18。

1.4 $C_t$ 计算

在这里插入图片描述
这里参数量为0。

1.5 $h_t$ 计算

在这里插入图片描述
这里参数量为0。

2、代码

import numpy as np
import pandas as pd
import tensorflow as tf
from tensorflow import keras
from tensorflow.keras import layers
print(tf.__version__)

model = keras.Sequential()
model.add(layers.LSTM(units=4, input_shape=(5, 3)))
model.add(layers.Dense(2, activation='sigmoid'))
model.summary()

X = np.array([[[0, 2, 3], [4, 5, 6], [7, 8, 9], [10, 11, 12], [13, 14, 15]],
              [[1, 0, 3], [4, 5, 6], [7, 8, 9], [10, 11, 12], [13, 14, 15]],
              [[1, 2, 0], [4, 5, 6], [7, 8, 9], [10, 11, 12], [13, 14, 15]],
              [[1, 2, 3], [0, 5, 6], [7, 8, 9], [10, 11, 12], [13, 14, 15]],
              [[1, 2, 3], [4, 0, 6], [7, 8, 9], [10, 11, 12], [13, 14, 15]],
              [[1, 2, 3], [4, 5, 0], [7, 8, 9], [10, 11, 12], [13, 14, 15]],
              [[1, 2, 3], [4, 5, 6], [0, 8, 9], [10, 11, 12], [13, 14, 15]],
              [[1, 2, 3], [4, 5, 6], [7, 0, 9], [10, 11, 12], [13, 14, 15]],
              [[1, 2, 3], [4, 5, 6], [7, 8, 0], [10, 11, 12], [13, 14, 15]],
              [[1, 2, 3], [4, 5, 6], [7, 8, 9], [0, 11, 12], [13, 14, 15]],
              [[1, 2, 3], [4, 5, 6], [7, 8, 9], [10, 0, 12], [13, 14, 15]],
              [[1, 2, 3], [4, 5, 6], [7, 8, 9], [10, 11, 0], [13, 14, 15]],
              [[1, 2, 3], [4, 5, 6], [7, 8, 9], [10, 11, 12], [0, 14, 15]],
              [[1, 2, 3], [4, 5, 6], [7, 8, 9], [10, 11, 12], [13, 0, 15]],
              [[1, 2, 3], [4, 5, 6], [7, 8, 9], [10, 11, 12], [13, 14, 0]]])

y = np.array([[1, 0],
              [1, 0],
              [1, 0],
              [1, 0],
              [1, 0],
              [1, 0],
              [1, 0],
              [1, 0],
              [0, 1],
              [0, 1],
              [0, 1],
              [0, 1],
              [0, 1],
              [0, 1],
              [0, 1]])

model.compile(loss='binary_crossentropy', optimizer='adam', metrics=['accuracy'])
model.fit(X, y, epochs=100, batch_size=3, verbose=2)

这是一个二分类问题。

输入是[batch_size, 5, 3]，表示有5个Time Steps， $x_t$ 的维度是3。

LSTM层的 $h_t$ 维度是4，所以参数量=4×(4×7+4)=128。

输出是一个Dense层，[batch_size, 2]，所以参数量=4×2+2=10。

在这里插入图片描述

Out:

2.5.0


Model: "sequential"
_________________________________________________________________
Layer (type)                 Output Shape              Param #   
=================================================================
lstm (LSTM)                  (None, 4)                 128       
_________________________________________________________________
dense (Dense)                (None, 2)                 10        
=================================================================
Total params: 138
Trainable params: 138
Non-trainable params: 0
_________________________________________________________________


Epoch 1/100
5/5 - 1s - loss: 0.5914 - accuracy: 0.8667
Epoch 2/100
5/5 - 0s - loss: 0.5890 - accuracy: 0.8667
Epoch 3/100
5/5 - 0s - loss: 0.5867 - accuracy: 0.8667
...
Epoch 98/100
5/5 - 0s - loss: 0.4668 - accuracy: 0.9333
Epoch 99/100
5/5 - 0s - loss: 0.4650 - accuracy: 0.9333
Epoch 100/100
5/5 - 0s - loss: 0.4641 - accuracy: 0.9333

3、总结

1、LSTM单元开始时，将向量 $h_{t-1}$ 和 $x_t$ 进行拼接，然后进行3个sigmoid和1个tanh网络的计算，这里面就包含了所有参数了，注意的是，LSTM单元是共享的，所以不管有多少个Time Steps，参数量都等于1个LSTM单元的参数量。

2、sigmoid函数输出的是(0,1)的数值，tanh函数输出的是(-1,1)的数值。

3、文章的图片均由PPT制作，可以付费下载。

参考文章
[1] Understanding LSTM Networks
[2] How to get the weights of layer in a keras model for each input
[3] How to check the weights after every epoc in Keras model

手撕机

关注

4
点赞
踩
12

收藏

觉得还不错? 一键收藏
打赏
0
评论
[深度学习] Recurrent Units详细计算过程——LSTM

文章大部分基于Christopher Olah的Understanding LSTM Networks。（题外话：不知道为什么，每次看到好论文或好文章，我都很喜欢“人肉”一下大牛的来历，结果查了下这篇文章的作者，从LinkedIn里看到简历，教育背景里写着University of Real Life Experience，难道是没上大学？目前他就职Google Brain作为Research
复制链接

扫一扫