spark JAVA 开发环境搭建及远程调试

以后要在项目中使用Spark 用户昵称文本做一下聚类分析，找出一些违规的昵称信息。以前折腾过Hadoop，于是看了下Spark官网的文档以及 github 上官方提供的examples，看完了之后决定动手跑一个文本聚类的demo，于是有了下文。

1. 环境介绍

本地开发环境是：IDEA2018、JDK8、windows 10。远程服务器 Ubuntu 16.04.3 LTS上安装了spark-2.3.1-bin-hadoop2.7

看spark官网介绍，有两种形式（不是Spark Application Execution Mode）来启动spark

Running the Examples and Shell

比如说./bin/pyspark --master local[2]启动的是一个交互式的命令行界面，可以在4040端口查看作业。
Launching on a Cluster

spark 集群，有多种部署选项：Standalone。另外还有：YARN，Mesos（将集群中的资源将由资源管理器来管理）。

对于Standalone，./sbin/start-master.sh 启动Master，通过8080端口就能看到：集群的情况。

再通过./sbin/start-slave.sh spark://panda-e550:7077 启动slave：Alive Workers 就是启动的slave。

执行jps：看到Master和Worker：

~/spark-2.3.1-bin-hadoop2.7$ jps

45437 Master

50429 Worker

下面介绍一下在本地windows10 环境下写Spark程序，然后连接到远程的这台Ubuntu机器上的Spark上进行调试。

2. 一个简单的开发环境

创建Maven工程，根据官网提供的Spark Examples 来演示聚类算法（JavaBisectingKMeansExample ）的运行过程，并介绍如何配置Spark调试环境。

2.1添加maven 依赖：

<dependency>

    <groupId>org.apache.spark</groupId>

    <artifactId>spark-sql_2.11</artifactId>

    <version>2.3.1</version>

</dependency>

<!-- https://mvnrepository.com/artifact/org.apache.spark/spark-mllib -->

<dependency>

    <groupId>org.apache.spark</groupId>

    <artifactId>spark-mllib_2.11</artifactId>

    <version>2.3.1</version>

    <!--<scope>runtime</scope>-->

</dependency>

2.2 编写代码：

package net.hapjin.spark;

import org.apache.spark.ml.clustering.BisectingKMeans;

import org.apache.spark.ml.clustering.BisectingKMeansModel;

import org.apache.spark.ml.linalg.Vector;

import org.apache.spark.sql.Dataset;

import org.apache.spark.sql.Row;

import org.apache.spark.sql.SparkSession;

public class JavaBisectingKMeansExample {

    public static void main(String[] args) {

//        SparkSession spark = SparkSession.builder().appName("JavaBisectingKMeansExample").getOrCreate();

        SparkSession spark = SparkSession.builder().appName("JavaBisectingKMeansExample").master("spark://xx.xx.129.170:7077").getOrCreate();

//        Dataset<Row> dataset = spark.read().format("libsvm").load(".\\data\\sample_kmeans_data.txt");

        Dataset<Row> dataset =     spark.read().format("libsvm").load("hdfs://172.25.129.170:9000/user/panda/sample_kmeans_data.txt");

//        Dataset<Row> dataset = spark.read().format("libsvm").load("file:///E:/git/myown/test/spark/example/data/sample_kmeans_data.txt");

        // Trains a bisecting k-means model.

        BisectingKMeans bkm = new BisectingKMeans().setK(2).setSeed(1);

        BisectingKMeansModel model = bkm.fit(dataset);

        // Evaluate clustering.

        double cost = model.computeCost(dataset);

        System.out.println("Within Set Sum of Squared Errors = " + cost);

        // Shows the result.

        System.out.println("Cluster Centers: ");

        Vector[] centers = model.clusterCenters();

        for (Vector center : centers) {

            System.out.println(center);

        }

        // $example off$

        spark.stop();

    }

}

2.3 配置远程调试环境

在IDEA中，"Run"-->"Edit Configurations"-->"Template"--->"Remote"，点击 "+"号：

报错：

Could not locate executable null\bin\winutils.exe

去这个github下载对应的Hadoop版本的winutils.exe。

配置windows10环境变量：HADOOP_HOME，并将该环境变量添加到 Path 环境变量下%HADOOP_HOME%\bin。

再次Debug调试，成功进入断点：（如果报拒绝连接的错误，修改一下 conf/spark-env.sh 指定SPARK_LOCAL_IP为机器的IP地址，然后再修改 /etc/hosts 文件将主机名与机器IP地址相对应即可）

其实，在本地开发环境（Windows10）连不上远程的服务器时，先在Windows下telnet 一下看一下能不能通。如果不能通，那肯定连不上了。另外，可以在远程服务器上看下相应的端口绑定在哪个IP地址上，是不是绑定到了环回地址上了。比如下面这个spark master默认端口绑定在127.0.1.1上，那你本地的开发环境肯定连不上这个端口了：

~/spark-2.3.1-bin-hadoop2.7$ netstat -anp | grep 7077

tcp6 0 0 127.0.1.1:7077 ::

spark JAVA 开发环境搭建及远程调试的更多相关文章

CUDA并行程序设计开发环境搭建与远程调试
课题需要用到GPU加速.目前使用的台式电脑只有核心显卡,而实验室有一台服务器装有NVIDIA GTX980独显.因此,想搭建一个CUDA的开发环境,来实现在台式机上面开发cuda程序,程序在服务器而不 ...

超全详解Java开发环境搭建
摘自:https://www.cnblogs.com/wangjiming/p/11278577.html 超全详解Java开发环境搭建在项目产品开发中,开发环境搭建是软件开发的首要阶段,也是必 ...

Java 开发环境搭建
找到一篇很不錯的Java開發環境搭建的博客, 原文地址為:http://www.cnblogs.com/bribe/p/3377008.html Java 开发环境搭建一.开发工具获取 1.开发工具 ...

开始JAVA编程的敲门砖——JAVA开发环境搭建
从头开始的java编程--JAVA开发环境搭建一.什么是java的开发环境? 顾名思义java的开发环境是提供并保证整个java程序开发运行的必要的环境,搭建java开发环境是开始java编程的敲门 ...

【java系列】java开发环境搭建
描述本篇文章主要讲解基于windows 10系统搭建java开发环境,主要内容包括如下: (1)安装资料准备 (2)安装过程讲解 (3)测试是否安装成功 (4)Hello Word测试 1 安装 ...

Windows系统下JAVA开发环境搭建
首先我们需要下载JDK(JAVA Development Kit),JDK是整个java开发的核心,它包含了JAVA的运行环境,JAVA工具和JAVA基础的类库. 下载地址:http://www.or ...

MAC系统 -java开发环境搭建
MAC - java开发环境搭建软件: jdk Intellij IDEA:java开发工具 maven:jar包管理 git :源码管理 sourceTree :源码管理GUI客户端 Studio ...

初识Java以及JAVA开发环境搭建
目录 JAVA帝国的诞生 C&C++ JAVA JAVA特性和优势 JAVA三大版本 JDK.JRE.JVE JAVA开发环境搭建 JDK下载与安装.卸载安装JDK 卸载JDK JDK目录介 ...

Java开发环境搭建的准备工作
Java开发环境搭建的准备工作网络配置(修改hosts) 什么时候需要比如我们在安装homeBrew的时候会遇到 curl: (7) Failed to connect to raw.github ...

随机推荐

SQLServer之创建DML AFTER INSERT触发器
DML AFTER INSERT触发器创建原理触发器触发时,系统自动在内存中创建deleted表或inserted表,内存中创建的表只读,不允许修改,触发器执行完成后,自动删除. insert触发器 ...

【Python 06】汇率兑换1.0-1（IPO与字符串转数字）
1.案例描述设计一个汇率换算器程序,功能是将外币换算成人民币. 2.案例分析将问题划分为输入.处理及输出三部分(IPO) 3.上机实验 rmb_str_value = input('请输入人民币( ...

slice()和splice()区别
1.slice(start,end):方法可从已有数组中返回选定的元素,返回一个新数组,包含从start到end(不包含该元素)的数组元素. 注意:该方法不会改变原数组,而是返回一个子数组,如果想删除 ...

git添加/删除远程仓库
注意:仓库只有管理员建的你才有权限上传,不然自己建的也没用,没权限上传 1.远程仓库路径查询 git remote -v 2.添加远程仓库 git remote add origin <你的项目 ...

记一个bug
就在刚刚,测试叫我去看一个问题,有用户反应,在业务页面,出现了一部分重复的内容,而且点击按钮弹窗里,出现了只有个title,没有body的情况. 事情的现象就是这样.然后我就开始着手找原因了.首先声明 ...

IO 模型 IO 多路复用
IO 模型 IO 多路复用 IO多路复用:模型(解决问题的方案) 同步:一个任务提交以后,等待任务执行结束,才能继续下一个任务异步:不需要等待任务执行结束, 阻塞:IO阻塞,程序卡住了非阻塞:不阻 ...

《通过C#学Proto.Actor模型》之Mailbox
邮箱是Actor模型的一个重要组成部分,负责接收发过来的消息,并保存起来,等待Actor处理.邮箱中维护着两种队列,一种是存系统消息,另一个是存用户消息,系统省是指Started,Stoping,St ...

Linux内存管理 (9)mmap
专题:Linux内存管理专题关键词:文件映射.匿名映射.私有映射.共享映射 mmap/munmap是常用的一个系统调用,使用场景是:分配内存.读写大文件.连接动态库文件.多进程间共享内存. 更详细解 ...

你不知道的 requestIdleCallback
本文副标题是 Request Schedule 源码解析一.在本章中会介绍 requestIdleCallback 的用法以及其缺陷, 接着对 React 团队对该 api 的 hack 部分的源码进 ...

（PAT）L2-004 这是二叉搜索树吗？（数据结构）
题目链接:https://www.patest.cn/contests/gplt/L2-004 一棵二叉搜索树可被递归地定义为具有下列性质的二叉树:对于任一结点, 其左子树中所有结点的键值小于该结点的 ...

spark JAVA 开发环境搭建及远程调试