一. tensorflow分布式

1.     概念

分布式Tensorflow是由高性能的gRPC框架作为底层技术来支持的。这是一个通信框架gRPC(google remote procedure call),是一个高性能、跨平台的RPC框架。RPC协议,即远程过程调用协议,是指通过网络从远程计算机程序上请求服务。

2.     模式

1)单机单卡 一台服务器上多台设备(GPU)

2)多机多卡(分布式)

l  参数服务器(parameter server)ps:更新参数、保存参数

l  工作服务器(worker):主要功能是计算。worker节点中需要一个主节点来进行会话初始化,创建文件等操作,其他节点等待进行计算

二. API

1.     分布式会话

MonitoredTrainingSession(master=‘’,is_chief=True,checkpoint_dir=None,hooks=None,save_checkpoint_secs=600,save_summaries_steps=USE_DEFAULT,save_summaries_secs=USE_DEFAULT,config=None)  分布式会话函数

  • master:指定运行会话协议IP和端口(用于分布式)

“grpc://192.168.0.1:2000”

  • is_chief是否为主worker(用于分布式)

如果True,它将负责初始化和恢复基础的TensorFlow会话。如果False,

它将等待一位负责人初始化或恢复TensorFlow会话。

  • checkpoint_dir:检查点文件目录,同时也是events目录
  • config:会话运行的配置项, tf.ConfigProto(log_device_placement=True)
  • hooks:可选SessionRunHook对象列表

生成的对象可调用的函数:

  • should_stop():是否异常停止
  • run():跟session一样可以运行op

2.     Hook

tf.train.SessionRunHook

  • Hook to extend calls to MonitoredSession.run()
  • 1、begin():
  • 在会话之前,做初始化工作
  • 2、before_run(run_context)

    在每次调用run()之前调用,以添加run()中的参数。

ARGS:

run_context:一个SessionRunContext对象,包含会话运行信息

return:一个SessionRunArgs对象,例如:tf.train.SessionRunArgs(loss)

  • 3、after_run(run_context,run_values)

    在每次调用run()后调用,一般用于运行之后的结果处理

该run_values参数包含所请求的操作/张量的结果 before_run()。

该run_context参数是相同的一个发送到before_run呼叫。

ARGS:

run_context:一个SessionRunContext对象

run_values一个SessionRunValues对象, run_values.results

注:在使用钩子的时候需要定义一个全局步数

global_step =
tf.contrib.framework.get_or_create_global_step()

3.    
创建集群

cluster =
tf.train.ClusterSpec({"ps": ps_spec, "worker":
worker_spec})

cluster = tf.train.ClusterSpec({

“worker”:[“worker0.example.com:2222”,
     /job:worker/task:0

“worker1.example.com:2222”,      /job:worker/task:1

“worker2.example.com:2222”],   
  /job:worker/task:2

"ps":
[“ps0.example.com:2222”,     /job:ps/task:0

“ps1.example.com:2222”]   /job:ps/task:1

})

4.    
创建服务

tf.train.Server(server_or_cluster_def,
job_name=None, task_index=None, protocol=None, config=None, start=True)  创建服务(ps,worker)

l  server_or_cluster_def: 集群描述

l  job_name: 任务类型名称

l  task_index: 任务数

attribute:target

返回tf.Session连接到此服务器的目标

method:join()

参数服务器端,直到服务器等待接受参数任务关闭

5.    
工作节点指定设备运行

tf.device(device_name_or_function)

  • 选择指定设备或者设备函数
  • if device_name:
    • 指定设备
    • 例如:"/job:worker/task:0/cpu:0”
    • if function:
      • tf.train.replica_device_setter(worker_device=worker_device,cluster=cluster)
      • 作用:通过此函数协调不同设备上的初始化操作
      • worker_device:为指定设备,

“/job:worker/task:0/cpu:0” or"/job:worker/task:0/gpu:0"

  • cluster:集群描述对象

注:使用with tf.device(),使不同工作节点工作在不同的设备上

三. 案例

 1 import tensorflow as tf
2
3 FLAGS = tf.app.flags.FLAGS
4
5 tf.app.flags.DEFINE_string("job_name", " ", "启动服务的类型ps or worker")
6 tf.app.flags.DEFINE_integer("task_index", 0, "指定ps或者worker当中的那一台服务器以task:0 ,task:1")
7
8 def main(argv):
9
10 # 定义全集计数的op ,给钩子列表当中的训练步数使用
11 global_step = tf.contrib.framework.get_or_create_global_step()
12
13 # 指定集群描述对象, ps , worker
14 cluster = tf.train.ClusterSpec({"ps": ["10.211.55.3:2223"], "worker": ["192.168.65.44:2222"]})
15
16 # 创建不同的服务, ps, worker
17 server = tf.train.Server(cluster, job_name=FLAGS.job_name, task_index=FLAGS.task_index)
18
19 # 根据不同服务做不同的事情 ps:去更新保存参数 worker:指定设备去运行模型计算
20 if FLAGS.job_name == "ps":
21 # 参数服务器什么都不用干,是需要等待worker传递参数
22 server.join()
23 else:
24 worker_device = "/job:worker/task:0/cpu:0/"
25
26 # 可以指定设备取运行
27 with tf.device(tf.train.replica_device_setter(
28 worker_device=worker_device,
29 cluster=cluster
30 )):
31 # 简单做一个矩阵乘法运算
32 x = tf.Variable([[1, 2, 3, 4]])
33 w = tf.Variable([[2], [2], [2], [2]])
34
35 mat = tf.matmul(x, w)
36
37 # 创建分布式会话
38 with tf.train.MonitoredTrainingSession(
39 master= "grpc://192.168.65.44:2222", # 指定主worker
40 is_chief= (FLAGS.task_index == 0),# 判断是否是主worker
41 config=tf.ConfigProto(log_device_placement=True),# 打印设备信息
42 hooks=[tf.train.StopAtStepHook(last_step=200)]
43 ) as mon_sess:
44 while not mon_sess.should_stop():
45 print(mon_sess.run(mat))
46
47
48 if __name__ == "__main__":
49 tf.app.run()

05tensorflow分布式会话的更多相关文章

  1. 补习系列(15)-springboot 分布式会话原理

    目录 一.背景 二.SpringBoot 分布式会话 三.样例程序 四.原理进阶 A. 序列化 B. 会话代理 C. 数据老化 小结 一.背景 在 补习系列(3)-springboot 几种scope ...

  2. 004-restful应用构建、分布式会话、测试工具简介

    一.概述 什么是rest(表述性状态转移,Representational State Transfer)是一种架构风格.他定义了创建可扩展Web服务的最佳实践. 1.Richardson成熟度模型 ...

  3. 第二十三章 多项目集中权限管理及分布式会话——《跟我学Shiro》

    二十三章 多项目集中权限管理及分布式会话——<跟我学Shiro> 博客分类: 跟我学Shiro 跟我学Shiro  目录贴:跟我学Shiro目录贴 在做一些企业内部项目时或一些互联网后台时 ...

  4. 使用Redis实现分布式会话

    1. 概述 传统的单体应用中,用户是否登录,通常是通过从Tomcat容器的session中获取登录用户信息判断的. 但在分布式的应用中,通常负载均衡了多台Tomcat,每台Tomcat都有自己独立的s ...

  5. 使用Spring Session做分布式会话管理

    在Web项目开发中,会话管理是一个很重要的部分,用于存储与用户相关的数据.通常是由符合session规范的容器来负责存储管理,也就是一旦容器关闭,重启会导致会话失效.因此打造一个高可用性的系统,必须将 ...

  6. 使用SpringSession管理分布式会话时遇到的反序列化问题

    关于SpringSession相关的介绍和使用指南,可移步如下网址: [SpringSession管理分布式系统的会话Session] https://www.cnblogs.com/captaina ...

  7. [源码解析] TensorFlow 分布式环境(1) --- 总体架构

    [源码解析] TensorFlow 分布式环境(1) --- 总体架构 目录 [源码解析] TensorFlow 分布式环境(1) --- 总体架构 1. 总体架构 1.1 集群角度 1.1.1 概念 ...

  8. [源码解析] TensorFlow 分布式环境(2)---Master 静态逻辑

    [源码解析] TensorFlow 分布式环境(2)---Master 静态逻辑 目录 [源码解析] TensorFlow 分布式环境(2)---Master 静态逻辑 1. 总述 2. 接口 2.1 ...

  9. [源码解析] TensorFlow 分布式环境(3)--- Worker 静态逻辑

    [源码解析] TensorFlow 分布式环境(3)--- Worker 静态逻辑 目录 [源码解析] TensorFlow 分布式环境(3)--- Worker 静态逻辑 1. 继承关系 1.1 角 ...

随机推荐

  1. Redis源码简要分析

    转载请注明来源:https://www.cnblogs.com/hookjc/ 把所有服务端文件列出来,并且标示出其作用:adlist.c //双向链表ae.c //事件驱动ae_epoll.c // ...

  2. mac brew安装

    mac 安装homebrew出错 Failed to connect to raw.githubusercontent.com port 443: Connection refused error:原 ...

  3. 【转载收藏】使用Jacoco远程统计tomcat服务的代码覆盖率

    在做软件开发的时候经常会遇到做各种测试,这里介绍一种本人遇到的:代码覆盖率测试, 这个测试非常实用,能发现许多无效的模块和代码.强烈推荐!!!!! 网上好多资料都不全,而且没有详细的配置流程 本文将简 ...

  4. 关于一些基础的dp——硬币的那些事(dp的基本引入)

    1.最少硬币问题大体题意: 有n种硬币,面值分别是v1,v2......vn,数量无限,输入一个非负整数s,选用硬币使其和为s,要求输出最少的硬币组合. 我们可以这样分析: 定义一个名为Min[s]的 ...

  5. linux_5

    1 简述osi七层模型和TCP/IP五层模型 2 总结描述TCP三次握手四次挥手 TCP是一种可靠的,面向连接的全双工传输层协议. TCP连接的建立是一个三次握手的过程.如图所示: 第一次握手:主机A ...

  6. python数据分析入门笔记[1]

    1.Numpy: Numpy是python科学计算的基础包,它提供以下功能(不限于此): (1)快速高效的多维数组对象naarray (2)用于对数组执行元素级计算以及直接对数组执行数学运算的函数 ( ...

  7. React Native纯干货总结

    随着项目也渐渐到了尾声,之前的项目是mobile开发,采用的是React Native.为即将要开始做RN项目或者已经做过的小伙伴可以参考借鉴,也顺便自己做一下之前项目的总结. 文章比较长,可以选择自 ...

  8. 本地虚拟机在NAT网络连接模式下如何设置才可以访问外网以及使用Xshell远程连接

    本文演示环境: 笔记本电脑系统:windows 7 虚拟机系统:CentOS 7 虚拟化软件:VMware Workstation 12 远程连接工具:Xshell 5 第一步: 打开虚拟网络编辑器 ...

  9. 施耐德NOE77101后门漏洞分析

    固件下载地址: GitHub - ameng929/NOE77101_Firmware 文件目录结构,这里只列出了一些主要的文件信息: ├── bin ├── ftp ├── fw ├── rdt ├ ...

  10. 2021年国内BI厂商推荐_大数据分析工具

    随着互联网大数据时代的不断发展,BI让企业的工作效率变得更高效.BI的功能也随着需求的增长不断地丰富,例如,数据可视化大屏.可视化表格.商业化数据分析.数据地图等.国外的厂商在很多场景下无法满足国内的 ...