分布式Tensorflow是由高性能的gRPC框架作为底层技术来支持的。RPC协议,即远程过程调用协议,是指通过网络从计算机程序上请求服务。
计算机网络七层模型:
应用层http协议、表示层、会话层、传输层tcp/udp、网络ip、数据链路层ppp、物理层rj45
RPC框架:远程过程调用
单机单卡:一台服务器上多台设备(GPU)
多机多卡:多太服务器,更多设备
分布式tensorflow把服务器分为参数服务器(parameter server)和工作服务器(worker server)
参数服务器:更新参数,保存参数
工作服务器:计算
说明:
参数作业所在的服务器(parameter server),负责管理参数的存储和更新;
工作节点的服务器主要从事计算的任务,如运行操作,worker节点中需要一个主节点来进行会话初始化,创建文件等操作,其他节点等待进行计算。
分布式更新参数的模式
1、同步模式更新
2、异步模式更新
分布式API
1、创建一个tf.train.ClusterSpec,用于对集群中的所有任务进行描述,该描述内容对所有任务应该是相同的。
创建集群
端口随便指定
2、创建一个tf.train.Server,用于创建一个任务(ps,worker),并运行相应作业上的计算任务。
创建服务
- tf.train.Server(server_or_cluster_def, job_name=None, task_index=None, protocol=None, config=None, start=True)
- 创建服务(ps, worker)
- server_or_cluster_def:集群描述(集群对象)
- job_name:任务类型名称
- task_index:任务数
- attribute:
- target 返回tf.Session()连接到此服务器的目标
- method:
- join() 参数服务器端,直到服务器等待接收参数任务关闭
3、工作节点worker指定设备运行
- tf.device(device_name_or_function)
- 选择指定设备或者设备函数
- 如果指定设备:例如: /job:worker/task:0/cpu:0
- 如果指定设备函数:
- tf.train.replica_device_setter(worker_device=worker_device, cluster=cluster)
- 作用:通过此函数协调不同设备上的初始化操作(一般用于分布式)
- worker_device:为指定设备,"/job:worker/task:0/cpu:0" or "/job:worker/task:0/gpu:0"
- cluster:集群描述对象
说明:
使用with tf.device(),使不同工作节点工作在不同的设备上
4、分布式会话
- tf.train.MonitoredTrainingSession(master='', is_chief=True, checkpoint_dir=None, hooks=None, save_checkpoint_secs=600, save_summaries_steps=USE_DEFAULT, save_summaries_secs=USE_DEFAULT, config=None)
- 分布式会话函数
- master:指定运行会话协议IP和端口(用于分布式),指定运行会话的老大 “grpc://192.168.0.1:2000”
- is_chief:是否为主worker(用于分布式) true/false。如果True,它将负责初始化和恢复基础的Tensorflow会话。如果False,它将等待一位负责人初始化或恢复Tensorflow会话。
- checkpoint_dir:检查点文件目录,同时也是events目录
- config:会话运行的配置项,tf.ConfigProto(log_device_placement=True)
- hooks:可选SessionRunHook对象列表
- method:
- should_stop():是否异常停止
- run():跟session一样可以运行op
6、常用钩子
- tf.train.StopAtStepHook(last_step=5000)
指定执行的训练轮数也就是max_step,超过了就会抛出异常
- tf.train.NanTensorHook(loss)
判断指定Tensor是否为NaN,为NaN则结束
注意:
在使用钩子的时候需要定义一个全局步数:global_step=tf.contrib.framework.get_or_create_global_step()
完整案例
import tensorflow as tf
"""
分布式Tensorflow
自实现一个线性回归
运行命令: 在虚拟机上运行 python test.py --job_name="ps" --task_index=0
在本地运行 python test.py --job_name="worker" --task_index=0
"""
FLAGS = tf.app.flags.FLAGS
tf.app.flags.DEFINE_string("job_name", " ", "启动服务的类型(ps or worker)")
tf.app.flags.DEFINE_integer("task_index", "0", "指定ps或者worker当中的哪一台服务器(task:0,task:1,...)") # 指定第几台服务器
def main(argv):
# 定义全局计数的op,给钩子列表当中的训练步数使用
global_step = tf.contrib.framework.get_or_create_global_step()
# 指定集群描述对象 ps worker
cluster = tf.train.ClusterSpec({"ps": ["10.211.55.3:2223"], "worker": ["10.95.148.41:2222"]})
# 指定创建不同的服务 ps, worker
server = tf.train.Server(cluster, job_name=FLAGS.job_name, task_index=FLAGS.task_index)
# 根据不同的服务做不同的事情 ps去更新保存参数,worker指定设备去运行模型计算
if FLAGS.job_name == "ps":
# 参数服务器什么都不用干,是需要等待worker传递参数
server.join()
else:
worker_device = "/job:worker/task:0/cpu:0/"
# 指定设备去运行
with tf.device(tf.train.replica_device_setter(
worker_device=worker_device,
cluster=cluster
)):
# 简单做一个矩阵乘法计算
x = tf.Variable([1, 2, 3, 4])
w = tf.Variable([[2], [2], [2], [2]])
mat = tf.matmul(x, w)
# 创建分布式会话
with tf.train.MonitoredTrainingSession(
master="grpc://10.95.148.41:2222", # 指定主worker
is_chief=(FLAGS.task_index == 0), # 判断是否是主worker
config=tf.ConfigProto(log_device_placement=True), # 打印设备信息
hooks=[tf.train.StopAtStepHook(last_step=200)] # 钩子
) as mon_sess:
while not mon_sess.should_stop(): # 如果程序没有异常
print(mon_sess.run(mat)) # 运行200次 如果不写hooks钩子,那么可以for循环运行run()
if __name__ == '__main__':
tf.app.run() # 默认调用main方法