pytorch 实现gru_Pytorch实现LSTM和GRU示例

最新推荐文章于 2024-01-09 11:17:13 发布

weixin_39582708

最新推荐文章于 2024-01-09 11:17:13 发布

阅读量214

点赞数

文章标签： pytorch 实现gru

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_39582708/article/details/111526469

版权

本文介绍了LSTM和GRU两种用于解决传统RNN长时依赖问题的变体，详细解析了它们的结构和工作原理，并提供了一个在PyTorch中实现LSTM进行MNIST分类的示例代码。

摘要由CSDN通过智能技术生成

为了解决传统RNN无法长时依赖问题，RNN的两个变体LSTM和GRU被引入。

LSTM

Long Short Term Memory，称为长短期记忆网络，意思就是长的短时记忆，其解决的仍然是短时记忆问题，这种短时记忆比较长，能一定程度上解决长时依赖。

上图为LSTM的抽象结构，LSTM由3个门来控制，分别是输入门、遗忘门和输出门。输入门控制网络的输入，遗忘门控制着记忆单元，输出门控制着网络的输出。最为重要的就是遗忘门，可以决定哪些记忆被保留，由于遗忘门的作用，使得LSTM具有长时记忆的功能。对于给定的任务，遗忘门能够自主学习保留多少之前的记忆，网络能够自主学习。

具体看LSTM单元的内部结构：

在每篇文章中，作者都会使用和标准LSTM稍微不同的版本，针对特定的任务，特定的网络结构往往表现更好。

GRU

上述的过程的线性变换没有使用偏置。隐藏状态参数不再是标准RNN的4倍，而是3倍，也就是GRU的参数要比LSTM的参数量要少，但是性能差不多。

Pytorch

在Pytorch中使用nn.LSTM()可调用，参数和RNN的参数相同。具体介绍LSTM的输入和输出：

输入： input, (h_0, c_0)

input：输入数据with维度(seq_len,batch,input_size)

h_0:维度为(num_layers*num_directions,batch,hidden_size),在batch中的

初始的隐藏状态.

c_0:初始的单元状态，维度与h_0相同

最低0.47元/天解锁文章

weixin_39582708

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
pytorch 实现gru_Pytorch实现LSTM和GRU示例

为了解决传统RNN无法长时依赖问题，RNN的两个变体LSTM和GRU被引入。LSTMLong Short Term Memory，称为长短期记忆网络，意思就是长的短时记忆，其解决的仍然是短时记忆问题，这种短时记忆比较长，能一定程度上解决长时依赖。上图为LSTM的抽象结构，LSTM由3个门来控制，分别是输入门、遗忘门和输出门。输入门控制网络的输入，遗忘门控制着记忆单元，输出门控制着网络的输出。最为重...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。