spark提交任务的两种的方法

在学习Spark过程中，资料中介绍的提交Spark Job的方式主要有两种（我所知道的）：

第一种:

通过命令行的方式提交Job,使用spark 自带的spark-submit工具提交，官网和大多数参考资料都是已这种方式提交的，提交命令示例如下：
./spark-submit --class com.learn.spark.SimpleApp --master yarn --deploy-mode client --driver-memory 2g --executor-memory 2g --executor-cores 3 ../spark-demo.jar
参数含义就不解释了，请参考官网资料。
第二种:

提交方式是已JAVA API编程的方式提交，这种方式不需要使用命令行，直接可以在IDEA中点击Run 运行包含Job的Main类就行，Spark 提供了以SparkLanuncher 作为唯一入口的API来实现。这种方式很方便（试想如果某个任务需要重复执行，但是又不会写linux 脚本怎么搞？我想到的是以JAV API的方式提交Job, 还可以和Spring整合，让应用在tomcat中运行），官网的示例：http://spark.apache.org/docs/latest/api/java/index.html?org/apache/spark/launcher/package-summary.html

根据官网的示例，通过JAVA API编程的方式提交有两种方式：

第一种是调用SparkLanuncher实例的startApplication方法，但是这种方式在所有配置都正确的情况下使用运行都会失败的，原因是startApplication方法会调用LauncherServer启动一个进程与集群交互，这个操作貌似是异步的，所以可能结果是main主线程结束了这个进程都没有起起来，导致运行失败。解决办法是调用new SparkLanuncher().startApplication后需要让主线程休眠一定的时间后者是使用下面的例子：

 package com.learn.spark; 

 import org.apache.spark.launcher.SparkAppHandle;

 import org.apache.spark.launcher.SparkLauncher; 

 import java.io.IOException;

 import java.util.HashMap;

 import java.util.concurrent.CountDownLatch; 

 public class LanuncherAppV {

     public static void main(String[] args) throws IOException, InterruptedException { 

         HashMap env = new HashMap();

         //这两个属性必须设置

         env.put("HADOOP_CONF_DIR", "/usr/local/hadoop/etc/overriterHaoopConf");

         env.put("JAVA_HOME", "/usr/local/java/jdk1.8.0_151");

         //可以不设置

         //env.put("YARN_CONF_DIR","");

         CountDownLatch countDownLatch = new CountDownLatch();

         //这里调用setJavaHome()方法后，JAVA_HOME is not set 错误依然存在

         SparkAppHandle handle = new SparkLauncher(env)

         .setSparkHome("/usr/local/spark")

         .setAppResource("/usr/local/spark/spark-demo.jar")

         .setMainClass("com.learn.spark.SimpleApp")

         .setMaster("yarn")

         .setDeployMode("cluster")

         .setConf("spark.app.id", "")

         .setConf("spark.driver.memory", "2g")

         .setConf("spark.akka.frameSize", "")

         .setConf("spark.executor.memory", "1g")

         .setConf("spark.executor.instances", "")

         .setConf("spark.executor.cores", "")

         .setConf("spark.default.parallelism", "")

         .setConf("spark.driver.allowMultipleContexts", "true")

         .setVerbose(true).startApplication(new SparkAppHandle.Listener() {

         //这里监听任务状态，当任务结束时（不管是什么原因结束）,isFinal（）方法会返回true,否则返回false

          @Override

         public void stateChanged(SparkAppHandle sparkAppHandle) {

             if (sparkAppHandle.getState().isFinal()) {

                 countDownLatch.countDown();

             }

             System.out.println("state:" + sparkAppHandle.getState().toString());

         } 

         @Override

         public void infoChanged(SparkAppHandle sparkAppHandle) {

             System.out.println("Info:" + sparkAppHandle.getState().toString());

         }

     });

     System.out.println("The task is executing, please wait ....");

     //线程等待任务结束

     countDownLatch.await();

     System.out.println("The task is finished!"); 

     }

 }

注意：如果部署模式是cluster,但是代码中有标准输出的话将看不到，需要把结果写到HDFS中，如果是client模式则可以看到输出。

第二种方式是：通过SparkLanuncher.lanunch()方法获取一个进程，然后调用进程的process.waitFor()方法等待线程返回结果，但是使用这种方式需要自己管理运行过程中的输出信息，比较麻烦，好处是一切都在掌握之中，即获取的输出信息和通过命令提交的方式一样，很详细，实现如下：

 package com.learn.spark; 

 import org.apache.spark.launcher.SparkAppHandle;

 import org.apache.spark.launcher.SparkLauncher; 

 import java.io.IOException;

 import java.util.HashMap; 

 public class LauncherApp { 

 public static void main(String[] args) throws IOException, InterruptedException { 

     HashMap env = new HashMap();

     //这两个属性必须设置

     env.put("HADOOP_CONF_DIR","/usr/local/hadoop/etc/overriterHaoopConf");

     env.put("JAVA_HOME","/usr/local/java/jdk1.8.0_151");

     //env.put("YARN_CONF_DIR",""); 

     SparkLauncher handle = new SparkLauncher(env)

         .setSparkHome("/usr/local/spark")

         .setAppResource("/usr/local/spark/spark-demo.jar")

         .setMainClass("com.learn.spark.SimpleApp")

         .setMaster("yarn")

         .setDeployMode("cluster")

         .setConf("spark.app.id", "")

         .setConf("spark.driver.memory", "2g")

         .setConf("spark.akka.frameSize", "")

         .setConf("spark.executor.memory", "1g")

         .setConf("spark.executor.instances", "")

         .setConf("spark.executor.cores", "")

         .setConf("spark.default.parallelism", "")

         .setConf("spark.driver.allowMultipleContexts","true")

         .setVerbose(true); 

     Process process =handle.launch();

     InputStreamReaderRunnable inputStreamReaderRunnable = new InputStreamReaderRunnable(process.getInputStream(), "input");

     Thread inputThread = new Thread(inputStreamReaderRunnable, "LogStreamReader input");

     inputThread.start(); 

     InputStreamReaderRunnable errorStreamReaderRunnable = new InputStreamReaderRunnable(process.getErrorStream(), "error");

     Thread errorThread = new Thread(errorStreamReaderRunnable, "LogStreamReader error");

     errorThread.start(); 

     System.out.println("Waiting for finish...");

     int exitCode = process.waitFor();

     System.out.println("Finished! Exit code:" + exitCode); 

     }

 }

使用的自定义InputStreamReaderRunnable类实现如下：

 package com.learn.spark; 

 import java.io.BufferedReader;

 import java.io.IOException;

 import java.io.InputStream;

 import java.io.InputStreamReader; 

 public class InputStreamReaderRunnable implements Runnable { 

 　　private BufferedReader reader; 

 　　private String name; 

 　　public InputStreamReaderRunnable(InputStream is, String name) {

 　　　　this.reader = new BufferedReader(new InputStreamReader(is));

 　　　　this.name = name;

 　　} 

 　　public void run() {

 　　　　System.out.println("InputStream " + name + ":");

 　　　　try {

 　　　　　　　　String line = reader.readLine();

 　　　　　　　　while (line != null) {

 　　　　　　　　　　　System.out.println(line);

 　　　　　　　　　　　line = reader.readLine();

 　　　　　　　　}

 　　　　　　　　reader.close();

 　　　 　　} catch (IOException e) {

 　　　　　 　　e.printStackTrace();

 　　　　　　}

 　 　}

 }

spark提交任务的两种的方法的更多相关文章

spark提交任务的三种的方法
在学习Spark过程中,资料中介绍的提交Spark Job的方式主要有三种: 第一种: 通过命令行的方式提交Job,使用spark 自带的spark-submit工具提交,官网和大多数参考资料都是已这 ...
【Spark篇】--Spark中Standalone的两种提交模式
一.前述 Spark中Standalone有两种提交模式,一个是Standalone-client模式,一个是Standalone-master模式. 二.具体 1.Standalon ...
spark application提交应用的两种方式
bin/spark-submit --help ... ... --deploy-mode DEPLOY_MODE Whether to launch the driver program loc ...
Spark On Yarn的两种模式yarn-cluster和yarn-client深度剖析
Spark On Yarn的优势每个Spark executor作为一个YARN容器(container)运行.Spark可以使得多个Tasks在同一个容器(container)里面运行 1. Sp ...
git两种合并方法比较merge和rebase
18:01 2015/11/18git两种合并方法比较merge和rebase其实很简单,就是合并后每个commit提交的id记录的顺序而已注意:重要的是如果公司用了grrit,grrit不允许用m ...
两种Ajax方法
两种Ajax方法 Ajax是一种用于快速创建动态网页的技术,他通过在后台与服务器进行少量的数据交换,可以实现网页的异步更新,不需要像传统网页那样重新加载页面也可以做到对网页的某部分作出更新,现在这项技 ...
Spark on YARN的两种运行模式
Spark on YARN有两种运行模式,如下 1.yarn-cluster:适合于生产环境. Spark的Driver运行在ApplicationMaster中,它负责向YARN Re ...
JS中的两种刷新方法以及区别和适用范围
在项目中有一个人信息修改的页面,但是修改后显示的却是修改之前的内容,分析问题后发现查询语句写在了修改语句之前,有些某些需要又必须这么写,但是修改信息后先却显示之前的信息也太不科学了. 所以我就想用js ...
两种js方法发起微信支付：WeixinJSBridge，wx.chooseWXPay区别
原文链接:https://www.2cto.com/weixin/201507/412752.html 1.为什么会有两种JS方法可以发起微信支付? 当你登陆微信公众号之后,左边有两个菜单栏,一个是微 ...

随机推荐

课时53.video标签第二种格式（掌握）
由于视频数据非常非常的重要,所以五大浏览器厂商都不愿意支持别人都视频格式,所以导致了没有一种视频格式是所有浏览器都支持的,这个时候W3C为了解决这个问题,所以推出了第二种video标签的格式如何查看 ...
Nlog日志出坑合集
.net core框架下nlog不记录: 1.安装NLog.Web.AspNetCore 2.在Startup.cs文件的方法public void Configure(IApplicationBui ...
HTML表格属性及简单实例
这里主要总结记录下表格的一些属性和简单的样式,方便以后不时之需. 1.<table> 用来定义HTML的表格,具有本地属性 border 表示边框,border属性的值必须为1或空字符串( ...
oracle编程300例-性能优化（一）
1.在SELECT语句中避免使用“*” 2.尽可能减小记录行数 3.使用rowid高效删除重复记录实例: delete from stu s where s.rowid>(select min ...
springboot-自定义起步依赖
自定义起步依赖步骤: 1. 添加configuration注解文件 - 指定什么情况下加载配置 - 使用enableconfigurationProperties ...
linux操作之软件安装（一）
rpm 包安装 RedHat Package Manager的缩写 , linux 的软件包可能存在依赖关系,比如某某依赖某某才能使用. 挂载一个光盘 mount -t auto /dev/cdrom ...
PHP获取当月天数，获取当月的每天的开始和结束的时间戳，获取当月每号
由于经常要写导单和数据分析功能,所以要获取什么时间的数据,想什么当天,周,年,月之类的时间格式都很好获取.我今天在这里为大家提供的是当月每天的开始和结束的时间格式. 希望能帮到大家!!! # 获取当月 ...
STM32F407+STemwin学习笔记之STemwin移植
原文链接:http://www.cnblogs.com/NickQ/p/8748011.html 环境:keil5.20 STM32F407ZGT6 LCD(320*240) STemwin:S ...
Springboot 拦截器（HandlerInterceptorAdapter）中注入无效
1,传统filter和HandlerInterceptorAdapter的区别 springboot对传统Filter进行增强,添加更多细粒度的操作,分别实现预处理.后处理(调用了Service并返回 ...
03以太网帧结构（链路层 IEEE802.3）
OSI七层模型:从底往上记(研究细致时用) 物理层:单位bit,字节byte,同轴电缆,光纤,二进制,比特流数据链路层:帧,16进制,0-9,A-FMac地址->全网唯一性 mac地址 ...

spark提交任务的两种的方法

spark提交任务的两种的方法的更多相关文章

随机推荐

热门专题