Zeppelin原理简介

Zeppelin是一个基于Web的notebook，提供交互数据分析和可视化。后台支持接入多种数据处理引擎，如spark，hive等。支持多种语言： Scala(Apache Spark)、Python(Apache Spark)、SparkSQL、 Hive、 Markdown、Shell等。本文主要介绍Zeppelin中Interpreter和SparkInterpreter的实现原理。

转载请注明

http://www.cnblogs.com/shenh062326/p/6195064.html

安装与使用
参考http://blog.csdn.net/jasonding1354/article/details/46822391

原理简介

Interpreter
Zeppelin中最核心的概念是Interpreter，interpreter是一个插件允许用户使用一个指定的语言或数据处理器。每一个Interpreter都属于换一个InterpreterGroup，同一个InterpreterGroup的Interpreters可以相互引用，例如SparkSqlInterpreter 可以引用 SparkInterpreter 以获取 SparkContext，因为他们属于同一个InterpreterGroup。当前已经实现的Interpreter有spark解释器，python解释器，SparkSQL解释器,JDBC，Markdown和shell等。下图是Zeppelin官网中介绍Interpreter的原理图。

Interpreter接口中最重要的方法是open，close，interpert三个方法，另外还有cancel，gerProgress，completion等方法。

Open 是初始化部分，只会调用一次。

Close 是关闭释放资源的接口，只会调用一次。

Interpret 会运行一段代码并返回结果，同步执行方式。

Cancel可选的接口，用于结束interpret方法

getPregress 方法获取interpret的百分比进度

completion 基于游标位置获取结束列表，实现这个接口可以实现自动结束

SparkInterpreter

Open方法中，会初始化SparkContext，SQLContext，ZeppelinContext；当前支持的模式有：

　　• local[*] in local mode

　　• spark://master:7077 in standalone cluster

　　• yarn-client in Yarn client mode

　　• mesos://host:5050 in Mesos cluster

其中Yarn集群只支持client模式。

if (isYarnMode()) {

  conf.set("master", "yarn");

  conf.set("spark.submit.deployMode", "client");

}

Interpret方法中会执行一行代码（以\n分割），其实会调用spark 的SparkILoop一行一行的执行（类似于spark shell的实现），这里的一行是逻辑行，如果下一行代码中以“.”开头（非“..”,“./”），也会和本行一起执行。关键代码如下：

scala.tools.nsc.interpreter.Results.Result res = null;

try {

  res = interpret(incomplete + s);

} catch (Exception e) {

  sc.clearJobGroup();

  out.setInterpreterOutput(null);

  logger.info("Interpreter exception", e);

  return new InterpreterResult(Code.ERROR, InterpreterUtils.getMostRelevantMessage(e));

}

r = getResultCode(res);

sparkInterpret的关键方法：

    close 方法会停止SparkContext

    cancel 方法直接调用SparkContext的cancel方法。sc.cancelJobGroup(getJobGroup(context)

    getProgress 通过SparkContext获取所有stage的总的task和已经结束的task，结束的tasks除以总的task得到的比例就是进度。

　　问题1，是否可以存在多个SparkContext？

　　　　Interpreter支持'shared', 'scoped', 'isolated'三种选项，在scopde模式下，spark interpreter为每个notebook创建编译器但只有一个SparkContext；isolated模式下会为每个notebook创建一个单独的SparkContext。
　　问题2，isolated模式下，多个SparkContext是否在同一个进程中？
　　　　一个服务端启动多个spark Interpreter后，会启动多个SparkContext。不过可以用另外一个jvm启动spark Interpreter。

Zeppelin优缺点小结

优点
　　1.提供restful和webSocket两种接口。
　　2.使用spark解释器，用户按照spark提供的接口编程即可，用户可以自己操作SparkContext，不过用户3.不能自己去stop SparkContext；SparkContext可以常驻。
　　4.包含更多的解释器，扩展性也很好，可以方便增加自己的解释器。
　　5.提供了多个数据可视化模块，数据展示方便。

缺点
　　1.没有提供jar包的方式运行spark任务。
　　2.只有同步的方式运行，客户端可能需要等待较长时间。

Zeppelin原理简介的更多相关文章

storm 原理简介及单机版安装指南——详细版【转】
storm 原理简介及单机版安装指南本文翻译自: https://github.com/nathanmarz/storm/wiki/Tutorial 原文链接自:http://www.open-op ...
Java进阶(二十四)Java List集合add与set方法原理简介
Java List集合add与set方法原理简介 add方法 add方法用于向集合列表中添加对象. 语法1 用于在列表的尾部插入指定元素.如果List集合对象由于调用add方法而发生更改,则返回 tr ...
kafka原理简介并且与RabbitMQ的选择
kafka原理简介并且与RabbitMQ的选择 kafka原理简介,rabbitMQ介绍,大致说一下区别 Kafka是由LinkedIn开发的一个分布式的消息系统,使用Scala编写,它以可水平扩展和 ...
InheritableThreadLocal类原理简介使用父子线程传递数据详解多线程中篇（十八）
上一篇文章中对ThreadLocal进行了详尽的介绍,另外还有一个类: InheritableThreadLocal 他是ThreadLocal的子类,那么这个类又有什么作用呢? 测试代码 p ...
Nginx 负载均衡原理简介与负载均衡配置详解
Nginx负载均衡原理简介与负载均衡配置详解 by:授客 QQ:1033553122 测试环境 nginx-1.10.0 负载均衡原理客户端向反向代理发送请求,接着反向代理根据某种负载机制 ...
Nginx 反向代理工作原理简介与配置详解
Nginx反向代理工作原理简介与配置详解 by:授客 QQ:1033553122 测试环境 CentOS 6.5-x86_64 nginx-1.10.0 下载地址:http://nginx. ...
Linux DNS原理简介及配置
Linux DNS原理简介及配置 DNS简介 DNS原理域名解析的过程资源记录 DNS BIND安装配置一.简介一般来讲域名比IP地址更加的有含义.也更容易记住,所以通常用户更习惯输入域名来访 ...
Oracle Golden Gate原理简介
Oracle Golden Gate原理简介 http://www.askoracle.org/oracle/HighAvailability/20140109953.html#6545406-tsi ...
Linux SSH基于密钥交换的自动登陆原理简介及配置说明
一.原理简介 SSH证书认证登录的基础是一对唯一匹配密钥: 私钥(private key)和公钥(public key).公钥用于对数据进行加密,而且只能用于加密.而私钥只能对使用所匹配的公钥,所加密 ...

随机推荐

洛谷P3273 [SCOI2011] 棘手的操作 [左偏树]
题目传送门棘手的操作题目描述有N个节点,标号从1到N,这N个节点一开始相互不连通.第i个节点的初始权值为a[i],接下来有如下一些操作: U x y: 加一条边,连接第x个节点和第y个节点 A1 ...
Python类总结-反射及getattr,setattr
类反射的四个基本函数 hasattr getattr setattr delattr #反射 class BlackMedium: feature = 'Ugly' def __init__(self ...
最大流 [USACO4.2]草地排水Drainage Ditches
Background 在农夫约翰的农场上,每逢下雨,贝茜最喜欢的三叶草地就积聚了一潭水.这意味着草地被水淹没了,并且小草要继续生长还要花相当长一段时间.因此,农夫约翰修建了一套排水系统来使贝茜的草地免 ...
八皇后--python代码
迭代和递归方法的运用 import random def prettyprint(solution): #图形化处理数据 def line(pos,length=len(solution)): #单行 ...
路由跟踪工具0trace
路由跟踪工具0trace 0trace是Kali Linuz自带的一个Shell脚本工具.该工具基于已建立的TCP连接,进行路由探测,实现侦查和防火墙穿透功能.使用时候,用户首先使用Telnet之 ...
python 学习笔记 - Queue & Pipes，进程间通讯
上面写了Python如何创建多个进程,但是前面文章中创建的进程都是哑巴和聋子,自己顾自己执行,不会相互交流.那么如何让进程间相互说说话呢?Python为我们提供了一个函数multiprocessing ...
os.path.dirname(__file__)使用
os.path.dirname(__file__)使用该测试脚本所在的位置:D:\第1层\第2层\第3层\第4层\第5层\test11.py test11.py import os #该文件所在位置 ...
asp.net绝对与相对路径
对于asp.net 路径的问题,闲心有很多人和我一样,只是知道一点,理解并不深刻.下面我就来整理一下相路径和绝对路径的知识. 绝对路径: 每个网页都有一个唯一的地址,它就是该网页的绝对路径.绝对路径提 ...
stl upper_bound()
http://blog.csdn.net/niushuai666/article/details/6734650 upper_bound( a , b , k )返回有序升序序列[a,b)中能放下 ...
Week Three
2018.12.10 1.[BZOJ 4818][P 3702] 2.[AGC007 A] 3.[AGC007 B] 4.[AGC007 C] 5.[AGC007 D] 2018.12.11 1.[B ...

Zeppelin原理简介

Zeppelin原理简介的更多相关文章

随机推荐

热门专题