延后初始化

最新推荐文章于 2023-10-06 15:03:47 发布

林觉棉

最新推荐文章于 2023-10-06 15:03:47 发布

阅读量544

点赞数 1

分类专栏：学习笔记文章标签：深度学习 tensorflow 神经网络

本文链接：https://blog.csdn.net/YUNFanZ/article/details/122770373

版权

14 篇文章 0 订阅

订阅专栏

简述

到目前为止，我们忽略了建立网络时需要做的以下这些事情：

你可能会对我们的代码能运行感到惊讶。毕竟，深度学习框架无法判断网络的输入维度是什么。这里的诀窍是框架的延后初始化（defers initialization），即直到数据第一次通过模型传递时，框架才会动态地推断出每个层的大小。

实例化网络

import tensorflow as tf

net = tf.keras.models.Sequential([
    tf.keras.layers.Dense(256, activation=tf.nn.relu),
    tf.keras.layers.Dense(10),
])

此时，因为输入维数是未知的，所以网络不可能知道输入层权重的维数。因此，框架尚未初始化任何参数，我们通过尝试访问以下参数进行确认。

[net.layers[i].get_weights() for i in range(len(net.layers))]

请注意，每个层对象都存在，但权重为空。使用net.get_weights()将抛出一个错误，因为权重尚未初始化。
接下来让我们将数据通过网络，最终使框架初始化参数。

X = tf.random.uniform((2, 20))
net(X)
[w.shape for w in net.get_weights()]

一旦我们知道输入维数是20，框架可以识别第一层权重矩阵的形状。识别出第一层的形状后，框架处理第二层，依此类推，直到所有形状都已知为止。注意，在这种情况下，只有第一层需要延迟初始化，但是框架仍是按顺序初始化的。等到知道了所有的参数形状，框架就可以初始化参数。

关注