Spark集群管理器介绍

袋鼠云dtstack 2024-08-30 23:37:41 原文

Spark可以运行在各种集群管理器上，并通过集群管理器访问集群中的其他机器。
Spark主要有三种集群管理器，如果只是想让spark运行起来，可以采用spark自带的独立集群管理器，采用独立部署的模式；如果是想让Spark部署在其他集群上，各应用共享集群的话，可以采取两种集群管理器：Hadoop Yarn 或 Apache Mesos。

一、独立集群管理器

Spark独立集群管理器提供的在集群上运行应用的简单方法。要使用集群启动脚本，按照以下步骤执行即可：
1、将编译好的Spark发送到集群的其他节点相同的目录下，例如: /home/opt/spark
2、设置集群的主节点和其他机器的SSH免密码登录
3、编辑主节点的conf/slaves文件，添加上所有的工作节点的主机名
4、在主节点上运行sbin/start-all.sh启动集群，可以在http://masternode:8080上看到集群管理界面
5、要停止集群，在主节点上运行 sbin/stop-all.sh

二、Hadoop Yarn

YARN是Hadoop2.0中引入的集群管理器，可以让多中数据处理框架运行在一个共享的资源池上，而且和Hadoop的分布式存储系统（HDFS）安装在同一个物理节点上。所以让Spark运行在配置了YARN的集群上是一个非常好的选择，这样当Spark程序运行在存储节点上的时候可以快速的访问HDFS中的数据。
在Spark中使用YARN的步骤：

1.找到你的Hadoop的配置目录，然后把它设置问环境变量HADOOP_CONF_DIR。
export HADOOP_CONF_DIR="..."
然后采用如下方式提交作业
spark-submit --master yarn yourapp

2、配置资源用量
(1) --executor-memory 设置每个执行器的内存用量
(2)--executor-cores 设置每个执行器进程从YARN中占用的核心数目
(3)--num-wxecutors Spark应用会使用固定数量的执行器节点，默认为2

三、Apache Mesos

Mesos是一个通用的集群管理器，既可以运行分析性负载又可以运行长期运行的服务。
在Mesos上使用Spark，可以采用以下方式：
spark-submit --master mesos://masternode:5050 yourapp

1、Mesos的调度模式
Mesos的调度模式分为两种：粗粒度模式和细粒度模式
粗粒度模式：只Spark会提前为每个执行器分配固定数量的CPU，而且在任务结束前不会释放这些资源。
可以通过设置spark.mesos.coarse为true，开启粗粒度调度模式
细粒度模式(默认)：执行器进程占用的CPU核心数会在执行任务的过程中动态变化。

2、配置资源用量
(1) --executor-memory 设置每个执行器的资源
(2) --total-executor-cores 设置应用占用的核心数

Spark集群管理器介绍的更多相关文章

Spark的集群管理器
上篇文章谈到Driver节点和Executor节点,但是如果想要运行Driver节点和Executor节点,就不能不说spark的集群管理器.spark的集群管理器大致有三种,一种是自带的standa ...
ruby redis的集群管理器
#========================================================================================== # => ...
OpenPAI：大规模人工智能集群管理平台介绍及任务提交指南
产品渊源: 随着人工智能技术的快速发展,各种深度学习框架层出不穷,为了提高效率,更好地让人工智能快速落地,很多企业都很关注深度学习训练的平台化问题.例如,如何提升GPU等硬件资源的利用率?如何节省硬件 ...
Fleet（集群管理器）
工作原理 fleet 是通过systemd来控制你的集群的,控制的任务被称之为unit(单元),控制的命令是fleetctl unit运行方式 unit的运行方式有两种: standard globa ...
Spark 集群管理命令
[启动] # 启动所有服务 start-all.sh # 启动 master start-master.sh # 启动所有 worker start-slaves.sh # 启动单个 worker s ...
Kubernetes TensorFlow 默认特定集群管理器
Our goal is to foster an ecosystem of components and tools that relieve the burden of running applic ...
Kubernetes TensorFlow 默认特定集群管理器虚拟化技术
Our goal is to foster an ecosystem of components and tools that relieve the burden of running applic ...
Spark集群模式概述
作者:foreyou出处:http://www.foreyou.net/2015/06/22/spark-cluster-mode-overview/声明:本文采用以下协议进行授权: 署名-非商用|C ...
zhihu spark集群,书籍,论文
spark集群中的节点可以只处理自身独立数据库里的数据,然后汇总吗? 修改我将spark搭建在两台机器上,其中一台既是master又是slave,另一台是slave,两台机器上均装有独立的mongo ...

随机推荐

【洛谷P2657】[SCOI2009] windy数
最近学习了一下数位DP 感觉记忆化搜索是比较好理解的这篇博客对我有一定的启发https://www.cnblogs.com/zbtrs/p/6106783.html 总结了一下: 用数位DP的 ...
【luogu P3368 树状数组2】模板
题目链接:https://www.luogu.org/problemnew/show/P3368 #include<iostream> #include<cstdio> #in ...
MapFile
MapFile是排序后的SequenceFile, 这个排序是由开发者来保证的, 不是内存实现. 相当于对key作了一个分块索引, 只针对key. 缺点 1.文件不支持复写操作,不能向已存在的Seq ...
java使用JSCH连接FTP(Linux服务器)上传文件到Linux服务器
首先需要用到jsch-0.1.54.jar 包: 链接: https://pan.baidu.com/s/1kZR6MqwpCYht9Pp_D6NKQw 密码: gywx 直接上代码: package ...
Vue node.js商城-购物车模块
一.渲染购物车列表页面新建src/views/Cart.vue获取cartList购物车列表数据就可以在页面中渲染出该用户的购物车列表数据 data(){ return { car ...
oracle聚簇表的理解（转自：https://blog.csdn.net/gumengkai/article/details/51009345 ）
Oracle支持两种类型的聚簇:索引聚簇和哈希聚簇一.索引聚簇表的原理聚簇:如果一些表有一些共同的列,则将这样一组表存储在相同的数据块中聚簇还表示把相关的数据存储在同一个块上.利用聚簇,一个块可 ...
分布式网上商城项目-dubbo搭建与初次使用错误
1.Spring-service启动失败严重: Exception sending context initialized event to listener instance of class o ...
【原创】关于skip-gram的个人理解
★skip-gram的关键术语与详细解释: [语料]—— 所有句子文档(当然会出现大量重复的单词) [词典(可用V维的onehot编码来表示)]—— 语料中出现的所有单词的集合(去除了重复词) [ ...
Linux系统运维基础测试题
1 Linux运维基础测试题(第一关) 通过这段时间学习Linux基础命令,为了检测自己对Linux基础命令掌握的情况,从网上整理13到测试题,并将其整理出来供大家参考学习. 1.1 习题 ...
Mysql导出表结构和数据
导出数据库 -- 导出dbname表结构 mysqldump -uroot -p123456 -d dbname > dbname.sql -- 导出dbname表数据 mysqldump -u ...