前言

　　Apache Zeppelin是一款基于web的notebook(类似于ipython的notebook)，支持交互式地数据分析，即一个Web笔记形式的交互式数据查询分析工具，可以在线用scala和SQL对数据进行查询分析并生成报表。原生就支持Spark、Scala、SQL 、shell 、markdown等。而且它是完全开源的，目前还处于Apache孵化阶段。其已经在各大公司均有采用，比如美团、微软等等。

　　Zeppelin的后台数据引擎可以是Spark，也可以通过实现更多的解释器来为Zeppelin添加数据引擎。在本地搭建一个Zeppelin 使得Spark更易用，同时可以很方便的将自己的工作成功展示给客户。

准备

sudo apt-get update    //更新Apt

安装JDK

sudo apt-get install openjdk-8-jre openjdk-8-jdk

安装Hadoop

安装Spark

安装Git

sudo apt-get install git

安装Maven

sudo apt-get install maven

安装Npm

sudo apt-get install npm　　//Npm home: /usr/share/npm

安装Phantomjs

下载"phantomjs-1.9.8-linux-x86_64.tar.bz2"
解压至:/usr/local/phantomjs

安装Apache Zeppelin

源码下载

https://github.com/apache/incubator-zeppelin

http://zeppelin.apache.org/download.html

解压安装

　　Apache Zeppelin官方提供了Source包和二进制包，我们可以根据需要下载相关的包进行安装。

通过下载zeppelin的binary包：http://ftp.meisei-u.ac.jp/mirror/apache/dist/incubator/zeppelin/0.5.6-incubating/zeppelin-0.5.6-incubating-bin-all.tgz，然后解压缩安装。
```
tar -xzvf zeppelin--incubating-bin-all.tgz
```
通过编译源码的方式来安装Apache Zeppelin，我这里从Zeppelin的git库里面下载最新的源码进行编译。
```
$ git clone https://github.com/apache/incubator-zeppelin.git //下载最新的->解压至：/usr/local/zeppelin
```

编译Apache Zeppelin

本地模式：mvn clean package -DskipTests
集群模式：mvn package -Pspark-2.0 -Dhadoop.version=2.7.1 -Phadoop-2.7 -DskipTests -X

在安装过程中可能会出现各种问题，但是一般都是网络问题导致，重新执行下编译命令即可。但如果编译出现oom，需增加如下命令:

export MAVEN_OPTS="-Xmx2g -XX:MaxPermSize=512M -XX:ReservedCodeCacheSize=512m"

配置环境变量

ysp@YSP:~$ vim .bashrc

-openjdk-amd64
export SPARK_HOME=/usr/local/spark
export HADOOP_HOME=/usr/local/hadoop
export PHANTOMJS_HOME=/usr/local/phantomjs
export ZEPPELIN_HOME=/usr/local/zeppelin
export PATH=.:$PATH:/usr/local/hadoop/bin:/usr/local/phantomjs/bin:/usr/local/spark/bin:/usr/local/zeppelin/bin:/usr/lib/jvm/java--openjdk-amd64/bin;

ysp@YSP:~$ source .bashrc

集群模式编译

ysp@YSP:~$ cd /usr/local/zeppelin
ysp@YSP:/usr/local/zeppelin$ mvn package -Pspark- -Phadoop-2.7 -DskipTests -X

如果你需要使用到YARN，你必须在编译Zeppelin的时候指定-Pyarn选项。

配置

　　配置文件为环境变量文件(conf/zeppelin-env.sh)和Java属性文件(conf/zeppelin-site.xml)。根据自己的要求进行配置。

拷贝/usr/local/zeppelin/conf/zeppelin-env.sh.template和/usr/local/zeppelin/conf/zeppelin-site.xml.template至/usr/local/zeppelin/conf/zeppelin-env.sh与/usr/local/zeppelin/conf/zeppelin-site.xml。

编辑conf/zeppelin-env.sh

export JAVA_HOME=/usr/lib/jvm/java--openjdk-amd64
export SPARK_HOME=/usr/local/spark
export HADOOP_CONF_DIR=/usr/local/hadoop
export SPARK_SUBMIT_OPTIONS="--packages com.databricks:spark-csv_2.10:1.2.0"

启动

　　在zeppelin_home目录下执行如下命令：

ysp@YSP:/usr/local/zeppelin$ ./bin/zeppelin-daemon.sh start

　　其启动/停止命令： bin/zeppelin-daemon.sh start/stop。

　　启动之后，打开localhost:8080访问zepplin主页。

测试

配置Spark解释器

创建Note

Zeppelin入门使用

1.text

　　默认使用scala语言输出text内容：

println("Hello Yuan Siping!")

2.html

　　　　shell输出html:

%sh echo "%html <h2>Hello Zeppelin</h2>"

　　3.table

　　　　scala:

print(s"""%table name\tsize\nsun\t100\nmoon\t10""")

　　4.Tutorial with Local File

Data Refine:

下载bank数据:http://archive.ics.uci.edu/ml/machine-learning-databases/00222/bank.zip ，将csv格式数据转成Bank对象RDD，并过滤表头列:

val bankText = sc.textFile("/usr/data/bank/bank-full.csv")

case class Bank(age:Integer, job:String, marital : String, education : String, balance : Integer)

val bank = bankText.map(s=>s.split()!="\"age\"").map(
    s=>Bank(s().toInt,
            s().replaceAll("\"", ""),
            s().replaceAll("\"", ""),
            s().replaceAll("\"", ""),
            s().replaceAll("\"", "").toInt
        )
)

bank.toDF().registerTempTable("bank")

Data Retrieval:

执行以下语句，可看到年龄的分布：

%sql )  group by age order by age

　　动态输入maxAge参数（默认是30岁），查看小于maxAge岁的年龄分布：

%sql ) } group by age order by age

　　根据婚姻状况选项，查看年龄分布状况：

%sql ) from bank where marital="${marital=single,single|divorced|married}" group by age order by age

Ubuntu下基于Saprk安装Zeppelin的更多相关文章

ubuntu下的openfire安装、配置、运行
openfire服务器 Openfire 采用Java开发,开源的实时协作(RTC)服务器基于XMPP(Jabber)协议.您可以使用它轻易的构建高效率的即时通信服务器.Op ...
2010-01-20 12:09 ubuntu下minicom的安装及使用
转http://hi.baidu.com/npugtawqdnbgqrq/item/106f805409b42813db163527 ubuntu下minicom的安装及使用安装: sudo apt ...
Ubuntu下git的安装与使用
Ubuntu下git的安装与使用 Ubuntu下git的安装与使用与Windows下的大致相同,只不过个人感觉在Ubuntu下使用git更方便. 首先,确认你的系统是否已安装git,可以通过git指令 ...
Ubuntu下Speedtest的安装
要安装Speedtest,需要先安装apache,参见<Ubuntu下Apache的安装>一文:*(再安装LAMP server,参见<Ubuntu下快速安装LAMP server& ...
Ubuntu下Apache的安装
Ubuntu下可快速安装LAMP server(Apache+MySQL+PHP5),参见<Ubuntu下快速安装LAMP server>一文. 也可以手动安装Apache.本文介绍如何手 ...
Linux(Ubuntu)下MySQL的安装与配置
转自:http://www.2cto.com/database/201401/273423.html 在Linux下MySQL的安装,我一直觉得挺麻烦的,因为之前安装时就是由于复杂的配置导致有点晕.今 ...
ubuntu下boost编译安装
ubuntu下boost编译安装 boost 安装 1.依赖安装 apt-get install mpi-default-dev libicu-dev python-dev python3-dev l ...
ubuntu 下redis的安装简介
Linux公社:https://www.linuxidc.com/topicnews.aspx?page=2&tid=2 简单介绍下ubuntu下redis的安装方式: 第一种: 1:进入re ...
ubuntu下tomcat的安装及注册成系统服务
在ubuntu下tomcat的安装有两种方式,第一种是下载二进制文件,解压安装:第二种则是使用apt-get自动下载.这里不推荐第二种方法安装,因为这种方法安装会像天女散花一样把安装的文件散落在系统的 ...

随机推荐

base的应用
------------父类 public class Person { public Person(string name,int age) { this.Na ...
UITableViewCell单元格的删除、插入、移动
UITableViewDelegate的方法设置编辑模式中得cell的编辑样式(删除或插入) - (UITableViewCellEditingStyle)tableView:( ...
Unity 3D json嵌套使用以及多种类型匹配
我们控制端要发送很多命令给终端设备,其中有速度,方向,开关门,开关灯....方法千万种,我只取一瓢.我还小,不知道其他人是怎么写的.我喜欢把有规律的东西放在一起写!为了我的强迫症! using Uni ...
SimpleSSO:使用Microsoft.Owin.Security.OAuth搭建OAuth2.0授权服务端
目录前言 OAuth2.0简介授权模式 (SimpleSSO示例) 使用Microsoft.Owin.Security.SimpleSSO模拟OpenID认证通过authorization co ...
【转】Django Model field reference学习总结
Django Model field reference学习总结(一) 本文档包含所有字段选项(field options)的内部细节和Django已经提供的field types. Field 选项 ...
java.lang.Class.isAssignableFrom()用法解析
一.概述: 此方法主要用来判断 "参数类" 是否是 "源类" 的子类.接口实现类,或者与 "源类" 相同,在此情况下返回 true; 二.格 ...
三大框架之hibernate入门
hibernate入门 1.orm hibernate是一个经典的开源的orm[数据访问中间件]框架 ORM( Object Relation Mapping)对象关 ...
VMware安装CentOS时，无法以图形界面安装解决办法
有的同学问: 用虚拟机软件(vmware.VirtualBox)安装CentOS系统时, 安装过程中没有中文,也没有出现图形界面,都是以命令行方式去安装, 有时候又会出现图形界面,不知道哪里配置的问题 ...
高性能 TCP & UDP 通信框架 HP-Socket v3.5.1
HP-Socket 是一套通用的高性能 TCP/UDP 通信框架,包含服务端组件.客户端组件和 Agent 组件,广泛适用于各种不同应用场景的 TCP/UDP 通信系统,提供 C/C++.C#.Del ...
position总结图

Ubuntu下基于Saprk安装Zeppelin

前言

准备

安装JDK

安装Hadoop

安装Spark

安装Git

安装Maven

安装Npm

安装Phantomjs

安装Apache Zeppelin

源码下载

解压安装

编译Apache Zeppelin

配置

启动

测试

配置Spark解释器

创建Note

Zeppelin入门使用

Ubuntu下基于Saprk安装Zeppelin的更多相关文章

随机推荐

热门专题