现代循环神经网络-3.深层循环神经网络【动手学深度学习v2】

最新推荐文章于 2024-04-28 17:42:27 发布

紫色银杏树

最新推荐文章于 2024-04-28 17:42:27 发布

阅读量1k

点赞数

分类专栏：动手学深度学习v2 笔记文章标签：深度学习 rnn lstm nlp pytorch

本文链接：https://blog.csdn.net/qq_37431083/article/details/124560921

版权

动手学深度学习v2 同时被 2 个专栏收录

13 篇文章 2 订阅

订阅专栏

笔记

13 篇文章 2 订阅

订阅专栏

上一篇：现代循环神经网络-2.长短期记忆网络(LSTM)【动手学深度学习v2】

文章目录

- 3.深度循环神经网络

3.深度循环神经网络

在前面几篇文章中，只讨论了具有一个单向隐藏层的循环神经网络。其中，隐变量和观测值与具体的函数形式的交互方式是相当随意的。只要交互类型建模具有足够的灵活性，这就不是一个大问题。然而，对于一个单层来说，这可能具有相当的挑战性。之前在线性模型中，我们通过添加更多的层来解决这个问题。而在循环神经网络中，我们首先需要确定如何添加更多的层，以及在哪里添加额外的非线性，因此这个问题有点棘手。

事实上，我们可以将多层循环神经网络堆叠在一起，通过对几个简单层的组合，产生了一个灵活的机制。特别是，数据可能与不同层的堆叠有关。例如，我们可能希望保持有关金融市场状况（熊市或牛市）的宏观数据可用，而微观数据只记录较短期的时间动态。

下图描述了一个具有个隐藏层的深度循环神经网络，每个隐状态都连续地传递到当前层的下一个时间步和下一层的当前时间步。

浅RNN
- 输入
- 隐层
- 输出
深层RNN
- 输入
- 隐层
- 隐层
- …
- 输出

$H^{(l)}_t = \phi_{l}(H^{l-1}_t W^{(l)}_{xh}+H^(l)_{t-1} W^{(l)}_{hh} + b^{l}_{h})$

$O_t = H^{(l)}_t W_{hq} + b_q$

其中l是循环神经网络的层数，t代表时间步，L是最后一层隐藏层。 $H_t$ 需要考虑上一层的隐藏单元和上一时间步的隐藏单元的影响。

import torch
from torch import nn
from d2l import torch as d2l

batch_size, num_steps = 32, 35
train_iter, vocab = d2l.load_data_time_machine(batch_size, num_steps)

vocab_size, num_hiddens, num_layers = len(vocab), 256, 2
num_inputs = vocab_size
device = d2l.try_gpu()
# 通过num_layers的值来设定隐藏层数
lstm_layer = nn.LSTM(num_inputs, num_hiddens, num_layers)
model = d2l.RNNModel(lstm_layer, len(vocab))
model = model.to(device)

num_epochs, lr = 500, 2
d2l.train_ch8(model, train_iter, vocab, lr, num_epochs, device)

perplexity 1.0, 222604.4 tokens/sec on cuda:0
time traveller for so it will be convenient to speak of himwas e
travelleryou can show black is white by argument said filby