动手学深度学习v2-GRU

最新推荐文章于 2024-05-05 21:13:17 发布

Hzt_dreamer

最新推荐文章于 2024-05-05 21:13:17 发布

阅读量505

点赞数

文章标签： gru 深度学习 pytorch

本文链接：https://blog.csdn.net/z577554980/article/details/120246801

版权

本文探讨了GRU模型中参数增多对梯度爆炸的影响，介绍了grad clipping技巧，并解释了0.01作为初始权重乘数的原因。同时，作者讨论了在处理长文本时，GRU与LSTM的选择，以及在实际场景中可能的替代方案如BERT和Transformer。

摘要由CSDN通过智能技术生成

!pip install d2l
import torch
from torch import nn
from d2l import torch as d2l

batch_size, num_steps = 32, 35
train_iter, vocab = d2l.load_data_time_machine(batch_size, num_steps)

def get_params(vocab_size, num_hiddens, device):
    num_inputs = num_outputs = vocab_size

    # 我们按照标准差  0.01  的高斯分布初始化权重，并将偏置项设为  0 。
    def normal(shape): # 给一个shape，转为均值为0，方差为0.01的权重
      return torch.randn(size=shape, device=device)*0.01

    def three():
      return (normal((num_inputs, num_hiddens)),
            normal((num_hiddens, num_hiddens)),
            torch.zeros(num_hiddens, device=device))

    W_xz, W_hz, b_z = three()  # 更新门参数
    W_xr, W_hr, b_r = three()  # 重置门参数
    W_xh, W_hh, b_h = three()  # 候选隐藏状态参数
    # 输出层参数
    W_hq = normal((num_hiddens, num_outputs))
    b_q = torch.zeros(num_outputs, device=device)
    # 附加梯度
    params = [W_xz, W_hz, b_z, W_xr, W_hr, b_r, W_xh, W_hh, b_h, W_hq, b_q]
    for param in params:
      param.requires_grad_(True)
    return params

# 定义模型
def init_gru_state(batch_size, num_hiddens, device):
    return (torch.zeros((batch_size, num_hiddens), device=device), )

# 定义门控循环单元模型
def gru(inputs, state, params):
    W_xz, W_hz, b_z, W_xr, W_hr, b_r, W_xh, W_hh, b_h, W_hq, b_q = params
    H, = state
    outputs = []
    for X in inputs:
        Z = torch.sigmoid((X @ W_xz) + (H @ W_hz) + b_z)
        R = torch.sigmoid((X @ W_xr) + (H @ W_hr) + b_r)
        H_tilda = torch.tanh((X @ W_xh) + ((R * H) @ W_hh) + b_h) # 候选隐藏状态
        H = Z * H + (1 - Z) * H_tilda
        Y = H @ W_hq + b_q
        outputs.append(Y)
    return torch.cat(outputs, dim=0), (H,)

# 训练
vocab_size, num_hiddens, device = len(vocab), 256, d2l.try_gpu()
num_epochs, lr = 500, 1
model = d2l.RNNModelScratch(len(vocab), num_hiddens, device, get_params,
                            init_gru_state, gru)
d2l.train_ch8(model, train_iter, vocab, lr, num_epochs, device)

1.GRU比RNN多了那么多参数，需不需要提高grad clipping的阙值？

参数多梯度不一定会爆炸，却决于怎么计算的，比如乘法变加法。

grad clipping（梯度裁剪）：神经网络是通过梯度下降来学习的。而梯度爆炸问题一般会随着网络层数的增加而变得越来越明显。如果发生梯度爆炸，那么就是学过了，会直接跳过最优解。所以需要梯度裁剪防止越过最优点。

2.normal函数中，torch.randn(size=shape, device=device)*0.01这个地方为何乘0.01？

0.01这个方差在不这么深的网络中的时候效果还不错，也是这本教材统一的使用的方差数。随着网络的加深需要更好的算法。

3.实际情况下GRU和LSTM在对长文本中处理长度大概是100左右（拍拍脑袋），更长的序列考虑使用bert活着transfomer。

Hzt_dreamer

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
动手学深度学习v2-GRU

!pip install d2limport torchfrom torch import nnfrom d2l import torch as d2lbatch_size, num_steps = 32, 35train_iter, vocab = d2l.load_data_time_machine(batch_size, num_steps)def get_params(vocab_size, num_hiddens, device): num_inputs = num_ou.
复制链接

扫一扫