【分布式Tensorflow】初步学习及案例

why do not

已于 2022-04-04 12:29:59 修改

阅读量294

点赞数

分类专栏：深度学习文章标签：深度学习 python 分布式

于 2020-12-05 14:44:53 首次发布

本文链接：https://blog.csdn.net/qq_42994177/article/details/110469867

版权

深度学习专栏收录该内容

16 篇文章 6 订阅

订阅专栏

分布式Tensorflow是由高性能的gRPC框架作为底层技术来支持的。RPC协议，即远程过程调用协议，是指通过网络从计算机程序上请求服务。

计算机网络七层模型：

应用层http协议、表示层、会话层、传输层tcp/udp、网络ip、数据链路层ppp、物理层rj45

RPC框架：远程过程调用

单机单卡：一台服务器上多台设备（GPU）

多机多卡：多太服务器，更多设备

分布式tensorflow把服务器分为参数服务器(parameter server)和工作服务器(worker server)

参数服务器：更新参数，保存参数

工作服务器：计算

说明：

参数作业所在的服务器(parameter server)，负责管理参数的存储和更新；

工作节点的服务器主要从事计算的任务，如运行操作，worker节点中需要一个主节点来进行会话初始化，创建文件等操作，其他节点等待进行计算。

分布式更新参数的模式

1、同步模式更新

2、异步模式更新

分布式API

1、创建一个tf.train.ClusterSpec，用于对集群中的所有任务进行描述，该描述内容对所有任务应该是相同的。

创建集群

端口随便指定

2、创建一个tf.train.Server，用于创建一个任务(ps，worker)，并运行相应作业上的计算任务。

创建服务

tf.train.Server(server_or_cluster_def, job_name=None, task_index=None, protocol=None, config=None, start=True)
- 创建服务（ps, worker）
- server_or_cluster_def：集群描述（集群对象）
- job_name：任务类型名称
- task_index：任务数
- attribute：
  - target 返回tf.Session()连接到此服务器的目标
- method：
  - join() 参数服务器端，直到服务器等待接收参数任务关闭

3、工作节点worker指定设备运行

tf.device(device_name_or_function)
选择指定设备或者设备函数
如果指定设备：例如： /job:worker/task:0/cpu:0
如果指定设备函数：
- tf.train.replica_device_setter(worker_device=worker_device, cluster=cluster)
- 作用：通过此函数协调不同设备上的初始化操作（一般用于分布式）
- worker_device：为指定设备，"/job:worker/task:0/cpu:0" or "/job:worker/task:0/gpu:0"
- cluster：集群描述对象

说明：

使用with tf.device()，使不同工作节点工作在不同的设备上

4、分布式会话

tf.train.MonitoredTrainingSession(master='', is_chief=True, checkpoint_dir=None, hooks=None, save_checkpoint_secs=600, save_summaries_steps=USE_DEFAULT, save_summaries_secs=USE_DEFAULT, config=None)
分布式会话函数
master：指定运行会话协议IP和端口（用于分布式），指定运行会话的老大 “grpc://192.168.0.1:2000”
is_chief：是否为主worker(用于分布式) true/false。如果True，它将负责初始化和恢复基础的Tensorflow会话。如果False，它将等待一位负责人初始化或恢复Tensorflow会话。
checkpoint_dir：检查点文件目录，同时也是events目录
config：会话运行的配置项，tf.ConfigProto(log_device_placement=True)
hooks：可选SessionRunHook对象列表
method:
- should_stop()：是否异常停止
- run()：跟session一样可以运行op

6、常用钩子

tf.train.StopAtStepHook(last_step=5000)

指定执行的训练轮数也就是max_step，超过了就会抛出异常

tf.train.NanTensorHook(loss)

判断指定Tensor是否为NaN，为NaN则结束

注意：

在使用钩子的时候需要定义一个全局步数：global_step=tf.contrib.framework.get_or_create_global_step()

完整案例

import tensorflow as tf

"""
分布式Tensorflow
自实现一个线性回归
运行命令：  在虚拟机上运行 python test.py --job_name="ps" --task_index=0
          在本地运行    python test.py --job_name="worker" --task_index=0
"""

FLAGS = tf.app.flags.FLAGS
tf.app.flags.DEFINE_string("job_name", " ", "启动服务的类型（ps or worker）")
tf.app.flags.DEFINE_integer("task_index", "0", "指定ps或者worker当中的哪一台服务器（task:0,task:1,...）")  # 指定第几台服务器



def main(argv):

    # 定义全局计数的op，给钩子列表当中的训练步数使用
    global_step = tf.contrib.framework.get_or_create_global_step()

    # 指定集群描述对象  ps  worker
    cluster = tf.train.ClusterSpec({"ps": ["10.211.55.3:2223"], "worker": ["10.95.148.41:2222"]})

    # 指定创建不同的服务  ps, worker
    server = tf.train.Server(cluster, job_name=FLAGS.job_name, task_index=FLAGS.task_index)

    # 根据不同的服务做不同的事情  ps去更新保存参数，worker指定设备去运行模型计算
    if FLAGS.job_name == "ps":
        # 参数服务器什么都不用干，是需要等待worker传递参数
        server.join()
    else:
        worker_device = "/job:worker/task:0/cpu:0/"

        # 指定设备去运行
        with tf.device(tf.train.replica_device_setter(
            worker_device=worker_device,
            cluster=cluster
        )):
            # 简单做一个矩阵乘法计算
            x = tf.Variable([1, 2, 3, 4])
            w = tf.Variable([[2], [2], [2], [2]])
            mat = tf.matmul(x, w)

        # 创建分布式会话
        with tf.train.MonitoredTrainingSession(
            master="grpc://10.95.148.41:2222",  # 指定主worker
            is_chief=(FLAGS.task_index == 0),  # 判断是否是主worker
            config=tf.ConfigProto(log_device_placement=True),  # 打印设备信息
            hooks=[tf.train.StopAtStepHook(last_step=200)]  # 钩子
        ) as mon_sess:
            while not mon_sess.should_stop():  # 如果程序没有异常
                print(mon_sess.run(mat))  # 运行200次   如果不写hooks钩子，那么可以for循环运行run()



if __name__ == '__main__':
    tf.app.run()   # 默认调用main方法

why do not

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
【分布式Tensorflow】初步学习及案例

分布式Tensorflow是由高性能的gRPC框架作为底层技术来支持的。RPC协议，即远程过程调用协议，是指通过网络从计算机程序上请求服务。计算机网络七层模型：应用层http协议、表示层、会话层、传输层tcp/udp、网络ip、数据链路层ppp、物理层rj45RPC框架：远程过程调用...
复制链接

扫一扫