LSTM原理及实现

最新推荐文章于 2024-04-15 09:53:52 发布

付石头_stone

最新推荐文章于 2024-04-15 09:53:52 发布

阅读量2k

点赞数

分类专栏：深度学习机器学习

深度学习同时被 2 个专栏收录

15 篇文章 0 订阅

订阅专栏

机器学习

10 篇文章 5 订阅

订阅专栏

文章目录

这篇博客前面原理部分是colah博客的翻译，后面一部分为自己结合实际实际代码的理解。

LSTM网络

long short term memory，即我们所称呼的LSTM，是为了解决长期以来问题而专门设计出来的，所有的RNN都具有一种重复神经网络模块的链式形式。在标准RNN中，这个重复的结构模块只有一个非常简单的结构，例如一个tanh层。

LSTM 同样是这样的结构，但是重复的模块拥有一个不同的结构。不同于单一神经网络层，这里是有四个，以一种非常特殊的方式进行交互。

不必担心这里的细节。我们会一步一步地剖析 LSTM 解析图。现在，我们先来熟悉一下图中使用的各种元素的图标。

在上面的图例中，每一条黑线传输着一整个向量，从一个节点的输出到其他节点的输入。粉色的圈代表 pointwise 的操作，诸如向量的和，而黄色的矩阵就是学习到的神经网络层。合在一起的线表示向量的连接，分开的线表示内容被复制，然后分发到不同的位置。

LSTM核心思想

LSTM的关键在于细胞的状态整个(绿色的图表示的是一个cell)，和穿过细胞的那条水平线。

细胞状态类似于传送带。直接在整个链上运行，只有一些少量的线性交互。信息在上面流传保持不变会很容易。

若只有上面的那条水平线是没办法实现添加或者删除信息的。而是通过一种叫做门（gates）的结构来实现的。

门可以实现选择性地让信息通过，主要是通过一个 sigmoid 的神经层和一个逐点相乘的操作来实现的。

sigmoid 层输出（是一个向量）的每个元素都是一个在 0 和 1 之间的实数，表示让对应信息通过的权重（或者占比）。比如， 0 表示“不让任何信息通过”， 1 表示“让所有信息通过”。

LSTM通过三个这样的本结构来实现信息的保护和控制。这三个门分别输入门、遗忘门和输出门。

逐步理解LSTM

现在我们就开始通过三个门逐步的了解LSTM的原理

遗忘门

在我们 LSTM 中的第一步是决定我们会从细胞状态中丢弃什么信息。这个决定通过一个称为忘记门层完成。该门会读取 $ht−1ht−1 h_{t-1}$ $h_{t} = (1 - z_{t}) * h_{t - 1} + z_{t} * h^_{t}$

多层LSTM

**多层LSTM是将LSTM进行叠加，其优点是能够在高层更抽象的表达特征，并且减少神经元的个数，增加识别准确率并且降低训练时间。**具体信息参考[3]

LSTM实现手写数字

这里我们利用的数据集是tensorflow提供的一个手写数字数据集。该数据集是一个包含n张28*28的数据集。

设置LSTM参数

# -*- coding: utf-8 -*-
import tensorflow as tf
from tensorflow.contrib import rnn

import numpy as np
import input_data

configuration

O * W + b -> 10 labels for each image, O[? 28], W[28 10], B[10]

^ (O: output 28 vec from 28 vec input)

|

±+ ±+ ±-+

|1|->|2|-> … |28| time_step_size = 28

±+ ±+ ±-+

^ ^ … ^

| | |

img1:[28] [28] … [28]

img2:[28] [28] … [28]

img3:[28] [28] … [28]

…

img128 or img256 (batch_size or test_size 256)

each input size = input_vec_size=lstm_size=28

configuration variables

input_vec_size = lstm_size = 28 # 输入向量的维度
time_step_size = 28 # 循环层长度

batch_size = 128
test_size = 256

这里设置将batch_size设置为128，time_step_size表示的是lstm神经元的个数，这里设置为28个(和图片的尺寸有关？)，input_vec_size表示一次输入的像素数。

初始化权值参数

def init_weights(shape):
    return tf.Variable(tf.random_normal(shape, stddev=0.01))

def model(X, W, B, lstm_size):
# X, input shape: (batch_size, time_step_size, input_vec_size)
# XT shape: (time_step_size, batch_size, input_vec_size)
#对这一步操作还不是太理解，为什么需要将第一行和第二行置换
XT = tf.transpose(X, [1, 0, 2]) # permute time_step_size and batch_size,[28, 128, 28]
# XR shape: (time_step_size * batch_size, input_vec_size)
XR = tf.reshape(XT, [-1, lstm_size]) # each row has input for each lstm cell (lstm_size=input_vec_size)

# Each array shape: (batch_size, input_vec_size)
X_split = tf.split(XR, time_step_size, 0) # split them to time_step_size (28 arrays),shape = [(128, 28),(128, 28)...]
# Make lstm with lstm_size (each input vector size). num_units=lstm_size; forget_bias=1.0
lstm = rnn.BasicLSTMCell(lstm_size, forget_bias=1.0, state_is_tuple=True)

# Get lstm cell output, time_step_size (28) arrays with lstm_size output: (batch_size, lstm_size)
# rnn..static_rnn()的输出对应于每一个timestep，如果只关心最后一步的输出，取outputs[-1]即可
outputs, _states = rnn.static_rnn(lstm, X_split, dtype=tf.float32)  # 时间序列上每个Cell的输出:[... shape=(128, 28)..]
# tanh activation
# Get the last output
return tf.matmul(outputs[-1], W) + B, lstm.state_size # State size to initialize the state

init_weigths函数利用正态分布随机生成参数的初始值，model的四个参数分别为：X为输入的数据，W表示的是28 * 10的权值(标签为0-9)，B表示的是偏置，维度和W一样。这里首先将一批128*（28*28）的图片放进神经网络。然后进行相关的操作(注释已经写得很明白了，这里就不再赘述)，然后利用WX+B求出预测结果，同时返回lstm的尺寸

训练

py_x, state_size = model(X, W, B, lstm_size)

cost = tf.reduce_mean(tf.nn.softmax_cross_entropy_with_logits(logits=py_x, labels=Y))
train_op = tf.train.RMSPropOptimizer(0.001, 0.9).minimize(cost)

然后通过交叉熵计算误差，反复训练得到最优值。

源代码：
https://github.com/geroge-gao/deeplearning/tree/master/LSTM

参考资料

[1].https://www.jianshu.com/p/9dc9f41f0b29
[2].http://blog.csdn.net/Jerr__y/article/details/58598296
[3].Stacked Long Short-Term Memory Networks

        </div>
					<link href="https://csdnimg.cn/release/phoenix/mdeditor/markdown_views-258a4616f7.css" rel="stylesheet">
            </div>

付石头_stone

关注

0
点赞
踩
5

收藏

觉得还不错? 一键收藏
0
评论
LSTM原理及实现

文章目录title: LSTM原理及实现date: 2018-02-10 10:49:21tags:categories: 深度学习LSTM网络LSTM核心思想逐步理解LSTM遗忘门输入门输出门LSTM变体多层LSTMLSTM实现手写数字设置LSTM参数初始化权值参数训练参考资料这篇博客前面原理部分是colah博客的翻译，后面一部分为自己结合实际实际代码的理解。LSTM网络long s...
复制链接

扫一扫