10-分布式系统和线性回归

10-分布式系统和线性回归

分布式Tensorflow:分布式Tensorflow是由高性能的gRPC框架作为底层技术来支持的。这是一个通信框架gRPC(google remote procedure call),是一个高性能、跨平台的RPC框架。RPC协议,即远程过程调用协议,是指通过网络从远程计算机程序上请求服务。
在这里插入图片描述
在这里插入图片描述
多机多卡分布式的架构
在这里插入图片描述
分布式的模式:
在这里插入图片描述

02自实现一个线性回归

分布式API

1、创建一个tf.train.ClusterSpec,用于对集群中的所有任务进行描述,该描述内容对所有任务应该是相同的

2、创建一个tf.train.Server,用于创建一个任务(ps,worker),并运行相应作业上的计算任务。

在tensorflow对设备的命名是有一定规则的,其主要以两个参数job表示工作的内心,为ps或者worker。还有有事task,其是用来指定第几台机器,如/job:ps/task:0表示的,就是第0台参数服务器。/job:woker/task:0代表第0台工作服务器。那么其设备怎么去添加呢?继续往后添加。第0台参数服务器其下有cpu。则为/job:ps/task:0/cpu:0。如果是GPU,则为/job:ps/task:0/GPU:0。

1、创建集群

1、 cluster = tf.train.ClusterSpec({"ps": ps_spec, "worker": worker_spec})
cluster = tf.train.ClusterSpec(
{
"worker":
[“worker0.example.com:2222,    /job:worker/task:0 
“worker1.example.com:2222,    /job:worker/task:1 
“worker2.example.com:2222],    /job:worker/task:2 

"ps": 
[“ps0.example.com:2222,    /job:ps/task:0 
“ps1.example.com:2222]   /job:ps/task:1
})

2、创建服务

tf.train.Server(server_or_cluster_def, job_name=None, task_index=None, 
protocol=None, config=None, start=True)
创建服务(ps,worker)
	server_or_cluster_def: 集群描述
	job_name: 任务类型名称
	task_index: 任务数
	
	attribute:target
	返回tf.Session连接到此服务器的目标
	method:join()
	参数服务器端,直到服务器等待接受参数任务关闭

3、工作节点指定设备运行

tf.device(device_name_or_function)
	选择指定设备或者设备函数
	if device_name:
	指定设备
	例如:"/job:worker/task:0/cpu:0if function:
	tf.train.replica_device_setter(worker_device=worker_device,
	cluster=cluster)
	作用:通过此函数协调不同设备上的初始化操作
	worker_device:为指定设备,/job:worker/task:0/cpu:0or
	"/job:worker/task:0/gpu:0"
	cluster:集群描述对象
	
注:使用with tf.device(),使不同工作节点工作在不同的设备上

3、工作节点指定设备运行

tf.device(device_name_or_function)
选择指定设备或者设备函数
if device_name:
指定设备
例如:"/job:worker/task:0/cpu:0if function:
tf.train.replica_device_setter(worker_device=worker_device,
cluster=cluster)
作用:通过此函数协调不同设备上的初始化操作
worker_device:为指定设备,/job:worker/task:0/cpu:0or
"/job:worker/task:0/gpu:0"
cluster:集群描述对象

注:使用with tf.device(),使不同工作节点工作在不同的设备上

一般步骤如下:
1、对集群当中的一些ps,worker进行指定。
2、创建对应的服务,如果是worker则创建worker服务,ps同理。ps创建之后执行join即可,woker需要运行模型,程序,初始化等。
3、会话,但是这里不能使用tf.Session()不支持分布式。需要使用分布式会话API:

MonitoredTrainingSession(master=‘’,is_chief=True,checkpoint_dir=None,    hooks=None,save_checkpoint_secs=600,save_summaries_steps=USE_DEFAULT,    save_summaries_secs=USE_DEFAULT,config=None)
分布式会话函数
master:指定运行会话协议IP和端口(用于分布式)
	“grpc://192.168.0.1:2000”
is_chief是否为主worker(用于分布式)
	如果True,它将负责初始化和恢复基础的TensorFlow会话。如果False,
它将等待一位负责人初始化或恢复TensorFlow会话。
checkpoint_dir:检查点文件目录,同时也是events目录
config:会话运行的配置项, tf.ConfigProto(log_device_placement=True)
hooks:可选SessionRunHook对象列表

should_stop():是否异常停止
run():跟session一样可以运行op

其上的hooks

tf.train.SessionRunHook
Hook to extend calls to MonitoredSession.run()
1、begin():
在会话之前,做初始化工作
2、before_run(run_context)在每次调用run()之前调用,以添加run()中的参数。
ARGS:
run_context:一个SessionRunContext对象,包含会话运行信息
return:一个SessionRunArgs对象,例如:tf.train.SessionRunArgs(loss)
3、after_run(run_context,run_values)在每次调用run()后调用,一般用于运行之后的结果处理
该run_values参数包含所请求的操作/张量的结果 before_run()。
该run_context参数是相同的一个发送到before_run呼叫。
 ARGS:
run_context:一个SessionRunContext对象
run_values一个SessionRunValues对象, run_values.results

常用钩子

tf.train.StopAtStepHook(last_step=5000)

指定执行的训练轮数也就是max_step,超过了就会抛出异常

tf.train.NanTensorHook(loss)

判断指定Tensor是否为NaN,为NaN则结束

注:在使用钩子的时候需要定义一个全局步数:global_step = tf.contrib.framework.get_or_create_global_step()

下面是一个例子。
在这里插入图片描述

下面我们通过一个案例,去实现这样的分布式案例,步骤如下:
1、创建集群对象
2、创建服务
3、服务端等待接受参数
4、客户端使用不同设备进行定义模型以进行计算
5、使用高级会话类

编写代码如下:

import tensorflow as tf
FLAFS = tf.app.flags.FLAGS

tf.app.flags.DEFINE_string("job_name", "","启动服务的类型ps or woker")
tf.app.flags.DEFINE_string("task_idex", "0","指定ps或者worker当中那一台服务器,以task:0,task:1")




def main(argv):
    # 定义全局计数的op,给钩子列表中的训练步数使用
    global_step = tf.contrib.framework.get_or_create_global_step()

    # 指定集群描述对象ps,worker
    cluster = tf.train.ClusterSpec({"ps":["192.168.1.1:2222"], "worker":["192.168.1.12:2222"]})

    # 创建不同的服务,ps,worker
    server = tf.train.Server(cluster, job_name=FLAFS.job_name, task_index=FLAFS.task_index)

    # 根据不同的服务做不同的事情 ps:去保存更新参数    worker:指定设备区运行模型计算
    if FLAFS.job_name =="ps":
        # 参数服务器什么都不用干,只需要等待worker传递参数
        server.join()
    else:
        worker_device = "job:worker/task:0/cpu:0/"

        # 可以指定设备区去运行
        with tf.device(tf.train.replica_device_setter(
            worker_device=worker_device,
            cluster=cluster
        )):
            # 简单做一个矩阵乘法运算
            x = tf.Variable([[1,2,3,4]])
            w = tf.Variable([[2],[2],[2],[2]])

            mat = tf.matmul(x,w)

        # 创建分布式会话
        with tf.train.MonitoredTrainingSession(
            master = "grpc/192.168.1.12:2222",   # 指定worler
            is_chierf=(FLAFS.task_index == 0),   # 判断是否为在worker
            config=tf.ConfigProto(log_device_placement=True),  # 打印设备信息
            hooks=[tf.train.StopAtStepHook(last_step=200)]
        ) as mon_sess:
            while not mon_sess.should_stop():
                mon_sess.run(mat)

if __name__ == '__main__':
    tf.app.run()
  • 1
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论
机器学习是一种人工智能(AI)的子领域,致力于研究如何利用数据和算法让计算机系统具备学习能力,从而能够自动地完成特定任务或者改进自身性能。机器学习的核心思想是让计算机系统通过学习数据中的模式和规律来实现目标,而不需要显式地编程。 机器学习应用非常广泛,包括但不限于以下领域: 图像识别和计算机视觉: 机器学习在图像识别、目标检测、人脸识别、图像分割等方面有着广泛的应用。例如,通过深度学习技术,可以训练神经网络来识别图像中的对象、人脸或者场景,用于智能监控、自动驾驶、医学影像分析等领域。 自然语言处理: 机器学习在自然语言处理领域有着重要的应用,包括文本分类、情感分析、机器翻译、语音识别等。例如,通过深度学习模型,可以训练神经网络来理解和生成自然语言,用于智能客服、智能助手、机器翻译等场景。 推荐系统: 推荐系统利用机器学习算法分析用户的行为和偏好,为用户推荐个性化的产品或服务。例如,电商网站可以利用机器学习算法分析用户的购买历史和浏览行为,向用户推荐感兴趣的商品。 预测和预测分析: 机器学习可以用于预测未来事件的发生概率或者趋势。例如,金融领域可以利用机器学习算法进行股票价格预测、信用评分、欺诈检测等。 医疗诊断和生物信息学: 机器学习在医疗诊断、药物研发、基因组学等领域有着重要的应用。例如,可以利用机器学习算法分析医学影像数据进行疾病诊断,或者利用机器学习算法分析基因数据进行疾病风险预测。 智能交通和物联网: 机器学习可以应用于智能交通系统、智能城市管理和物联网等领域。例如,可以利用机器学习算法分析交通数据优化交通流量,或者利用机器学习算法分析传感器数据监测设备状态。 以上仅是机器学习应用的一部分,随着机器学习技术的不断发展和应用场景的不断拓展,机器学习在各个领域都有着重要的应用价值,并且正在改变我们的生活和工作方式。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

江南才尽,年少无知!

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值