Spark的安装及其配置

1.Spark下载

https://archive.apache.org/dist/spark/

2.上传解压，配置环境变量配置bin目录

解压：tar -zxvf spark-2.4.5-bin-hadoop2.7.tgz -C /usr/local/soft/

改名：mv spark-2.4.5-bin-hadoop2.7/ spark-2.4.5

配置环境变量：vim /etc/profile

添加环境变量：

export SPARK_HOME=/usr/local/soft/spark-2.4.5
export PATH=$PATH:$SPARK_HOME/bin

保存配置：source /etc/profile

3.修改配置文件 conf

修改spark-env.sh: cp spark-env.sh.template spark-env.sh

增加配置：

export SPARK_MASTER_IP=master
export SPARK_MASTER_PORT=7077

export SPARK_WORKER_CORES=2
export SPARK_WORKER_INSTANCES=1
export SPARK_WORKER_MEMORY=2g
export JAVA_HOME=/usr/local/soft/jdk1.8.0_171

修改：cp slaves.template slaves

增加：

node1

node2

4.发放到其他节点

xsync spark-2.4.5

(xsync是自己写的脚本，在安装Hadoop的时候写过)

4、在主节点执行启动命令
启动集群，在master中执行
./sbin/start-all.sh

http://master:8080/ 访问spark ui

5.检验安装的Spark

1. standalone client模式日志在本地输出，一班用于上线前测试(bin/下执行)

需要进入到spark-examples_2.11-2.4.5.jar 包所在的目录下执行
cd /usr/local/soft/spark-2.4.5/examples/jars

spark-submit --class org.apache.spark.examples.SparkPi --master spark://master:7077 --executor-memory 512m --total-executor-cores 1 spark-examples_2.11-2.4.5.jar 100

2. standalone cluster模式上线使用，不会再本地打印日志
spark-submit --class org.apache.spark.examples.SparkPi --master spark://master:7077 --driver-memory 512m --deploy-mode cluster --supervise --executor-memory 512M --total-executor-cores 1 spark-examples_2.11-2.4.5.jar 100

spark-shell spark 提供的一个交互式的命令行，可以直接写代码

spark-shell master spark://master:7077

6.整合yarn

在公司一般不适用standalone模式，因为公司一般已经有yarn 不需要搞两个资源管理框架

停止spark集群
在spark sbin目录下执行 ./stop-all.sh

spark整合yarn只需要在一个节点整合, 可以删除node1 和node2中所有的spark 文件

1、增加hadoop 配置文件地址

vim spark-env.sh
增加
export HADOOP_CONF_DIR=/usr/local/soft/hadoop-2.7.6/etc/hadoop

2、往yarn提交任务需要增加两个配置 yarn-site.xml(/usr/local/soft/hadoop-2.7.6/etc/hadoop/yarn-site.xml)

先关闭yarn
stop-yarn.sh

<property>
<name>yarn.nodemanager.pmem-check-enabled</name>
<value>false</value>
</property>

<property>
<name>yarn.nodemanager.vmem-check-enabled</name>
<value>false</value>
</property>

4、同步到其他节点，重启yarn
scp -r yarn-site.xml node1:`pwd`
scp -r yarn-site.xml node2:`pwd`

启动yarn
start-yarn.sh

cd /usr/local/soft/spark-2.4.5/examples/jars

3.spark on yarn client模式日志在本地输出，一班用于上线前测试
spark-submit --class org.apache.spark.examples.SparkPi --master yarn-client --executor-memory 512M --num-executors 2 spark-examples_2.11-2.4.5.jar 100

4.spark on yarn cluster模式上线使用，不会再本地打印日志减少io
spark-submit --class org.apache.spark.examples.SparkPi --master yarn-cluster --executor-memory 512m --num-executors 2 --executor-cores 1 spark-examples_2.11-2.4.5.jar 100

获取yarn程序执行日志执行成功之后才能获取到
yarn logs -applicationId application_1560967444524_0003

hdfs webui
http://node1:50070

yarn ui
http://node1:8088

在idea中使用spark做wordCount

import org.apache.spark.rdd.RDD

import org.apache.spark.{SparkConf, SparkContext}

object Demo1WordCount {

  def main(args: Array[String]): Unit = {

    // Spark配置文件对象

    val conf: SparkConf = new SparkConf()

    // 设置Spark程序的名字

    conf.setAppName("Demo1WordCount")

    // 设置运行模式为local模式 即在idea本地运行

    conf.setMaster("local")

    // Spark的上下文环境，相当于Spark的入口

    val sc: SparkContext = new SparkContext(conf)

    // 词频统计

    // 1、读取文件

    /**

     * RDD : 弹性分布式数据集（可以先当成scala中的集合去使用）

     */

    val linesRDD: RDD[String] = sc.textFile("spark/data/words")

    // 2、将每一行的单词切分出来

    // flatMap: 在Spark中称为 算子

    // 算子一般情况下都会返回另外一个新的RDD

    val wordsRDD: RDD[String] = linesRDD.flatMap(line => line.split(","))

    // 3、按照单词分组

    val groupRDD: RDD[(String, Iterable[String])] = wordsRDD.groupBy(word => word)

    // 4、统计每个单词的数量

    val countRDD: RDD[String] = groupRDD.map(kv => {

      val word: String = kv._1

      val words: Iterable[String] = kv._2

      // words.size直接获取迭代器的大小

      // 因为相同分组的所有的单词都会到迭代器中

      // 所以迭代器的大小就是单词的数量

      word + "," + words.size

    })

    // 5、将结果进行保存

    countRDD.saveAsTextFile("spark/data/wordCount")

  }

}

Spark的安装及其配置的更多相关文章

Spark的安装及配置
title: Spark的安装及配置 summary: 关键词:Hadoop集群环境 Spark scala python ubuntu 安装和配置 date: 2019-5-19 13:56 aut ...
Mac OSX系统中Hadoop / Hive 与 spark 的安装与配置环境搭建记录
Mac OSX系统中Hadoop / Hive 与 spark 的安装与配置环境搭建记录 Hadoop 2.6 的安装与配置(伪分布式) 下载并解压缩配置 .bash_profile : ...
Spark standlone安装与配置
spark的安装简单,去官网下载与集群hadoop版本相一致的文件即可. 解压后,主要需要修改spark-evn.sh文件. 以spark standlone为例,配置dn1,nn2为master,使 ...
Spark(三): 安装与配置
参见 HDP2.4安装(五):集群及组件安装 ,安装配置的spark版本为1.6, 在已安装HBase.hadoop集群的基础上通过 ambari 自动安装Spark集群,基于hadoop yarn ...
spark安装及配置
windows下spark的安装与配置教程 Windows下安装spark windows下搭建spark环境出现ChangeFileModeByMask error (3): ??????????? ...
spark HA 安装配置和使用（spark1.2-cdh5.3）
安装环境如下: 操作系统:CentOs 6.6 Hadoop 版本:CDH-5.3.0 Spark 版本:1.2 集群5个节点 node01~05 node01~03 为worker. node04. ...
Spark安装和配置
hadoop2的安装教程 Spark可以直接安装在hadoop2上面,主要是安装在hadoop2的yarn框架上面安装Spark之前需要在每台机器上安装Scala,根据你下载的Spark版本,选择对 ...
01、Spark安装与配置
01.Spark安装与配置 1.hadoop回顾 Hadoop是分布式计算引擎,含有四大模块,common.hdfs.mapreduce和yarn. 2.并发和并行并发通常指针对单个节点的应对多个请 ...
Spark集群安装与配置
一.Scala安装 1.https://www.scala-lang.org/download/2.11.12.html下载并复制到/home/jun下解压 [jun@master ~]$ cd sc ...

随机推荐

51nod1229-序列求和V2【数学,拉格朗日插值】
正题题目链接:http://www.51nod.com/Challenge/Problem.html#problemId=1229 题目大意给出$n,k,r$求 \[\sum_{i=1}^ni ...
牛客练习赛71E-神奇的迷宫【点分治,NTT】
正题题目链接:https://ac.nowcoder.com/acm/contest/7745/E 题目大意给出$n$个点的一棵树,每个点有一个选择权重$a_i$(有\(\frac{a_i ...
最详细的搭建web自动化测试网站，别再说你没有实战项目（文未有福利）
一步步教你搭建开源网站环境准备: Tomcat shopping商城文件 jdk环境 Mysql环境解压shopping.rar拷贝至tomcat/webapps 在navicat导入数据库db_ ...
Visual Studio Code (VSCode) 配置 C/C++ 开发编译环境
前言工作多年,突然发现很多C++的基础都忘记了,加之C++不断更新换代后的各种新特性,于是想重拾C++的基础学习.虽然现在工作都是Linux平台,但考虑到个人方便,自己也仅仅想重温语法,家里家外都可 ...
学习使用SignalR
1.创建空白的控制台程序 2.添加两个NuGet包(Microsoft.AspNet.SignalR.SelfHost.Microsoft.Owin.Cors.Topshelf)Topshelf用于快 ...
Go语言核心36讲（Go语言基础知识四）--学习笔记
04 | 程序实体的那些事儿(上) 还记得吗?Go 语言中的程序实体包括变量.常量.函数.结构体和接口. Go 语言是静态类型的编程语言,所以我们在声明变量或常量的时候,都需要指定它们的类型,或者给予 ...
Powerful Number 学习笔记
定义对于一个正整数 $n$ ,若完全分解之后不存在指数 $=1$ ,则称 $n$ 为 $\text{Powerful Number}$ . 可以发现的是,在 $[1,n]$ 中, ...
VUE中v-for更新检测
口诀: 数组变更方法,就会导致 v-for 更新,页面更新数组非变更方法:返回新数组,就不会导致 v-for 更新,更新值检测不到可采用覆盖或者 this.$set() 数组变更方法如下: 1. a ...
【数据结构与算法Python版学习笔记】递归(Recursion)——定义及应用：分形树、谢尔宾斯基三角、汉诺塔、迷宫
定义递归是一种解决问题的方法,它把一个问题分解为越来越小的子问题,直到问题的规模小到可以被很简单直接解决. 通常为了达到分解问题的效果,递归过程中要引入一个调用自身的函数. 举例数列求和 def ...
OO第二单元电梯作业总结
目录目录一.第一次作业分析设计策略基于度量分析程序结构二.第二次作业分析设计策略基于度量分析程序结构三.第三次作业分析设计策略基于度量分析程序结构四.分析自己程序的bug五.发现别人程序bug所采用 ...

Spark的安装及其配置

Spark的安装及其配置的更多相关文章

随机推荐

热门专题