Idea下用SBT搭建Spark Helloworld

2024-10-09 18:26:13 原文

没用过IDEA工具，听说跟Eclipse差不多，sbt在Idea其实就等于maven在Eclipse。Spark运行在JVM中，所以要在Idea下运行spark，就先要安装JDK 1.8+ 然后加入Scala和Spark的依赖包就可以进行开发了，不要安装低版本的JDK。

先下载Idea的社区版

https://www.jetbrains.com/idea/download/download-thanks.html?platform=windows&code=IIC

Scala、Spark环境

安装完后下载Scala插件

新建sbt工程

这里需要注意，如果选择Spark2.0以上，那么Scala要选2.11以上。因为我用的是Spark2.0.2，所以就选择2.11.1，选择JDK版本后确认。

工程创建成功后的目录

编辑build.sbt文件，添加Spark依赖

name := "Scala"

version := "1.0"

scalaVersion := "2.11.1"

libraryDependencies += "org.apache.spark" % "spark-core_2.11" % "2.0.2"

保存，等待下载完依赖的包。

PS： Scala版本对应的Spark可在官网查询

Helloworld

在project下 src/scala包下创建一个scala.class

helloworld.scala

import org.apache.spark.{SparkConf, SparkContext}

/**

  * Created by Jan on 2016/12/19.

  */

object Helloworld {

    def main(args: Array[String]) {

      val logFile = "./README.md"  // Should be some file on your server.

      val conf = new SparkConf().setAppName("Simple Application").setMaster("local")

      val sc = new SparkContext(conf)

      val logData = sc.textFile(logFile, 2).cache()

      val numAs = logData.filter(line => line.contains("h")).count()

      val numBs = logData.filter(line => line.contains("j")).count()

      println("Lines with h: %s, Lines with j: %s".format(numAs, numBs))

    }

}

上面代码目的是：在本地读取一个叫README.md的文件，通过Spark内存分析，计算字母“h”和字母“j”在文件中出现多少次。

运行代码

可能出现的错误：

java.io.IOException: Could not locate executable null\bin\winutils.exe in the Hadoop binaries.

原因是缺少了winutils.exe文件，这个而且没有设置HADOOP_HOME

解决办法

1. 下载hadoop到本机并添加bin目录到环境变量

http://hadoop.apache.org/releases.html

2. 网上搜下winutils.exe文件，下载后放到hadoop的bin目录下

http://download.csdn.net/detail/u014313009/7671379

Idea下用SBT搭建Spark Helloworld的更多相关文章

window环境下使用sbt编译spark源码
前些天用maven编译打包spark,搞得焦头烂额的,各种错误,层出不穷,想想也是醉了,于是乎,换种方式,使用sbt编译,看看人品如何! 首先,从官网spark官网下载spark源码包,解压出来.我这 ...
SBT搭建Spark
http://www.cnblogs.com/yongjian/p/6211007.html http://www.aboutyun.com/thread-8587-1-1.html http://b ...
在Ubuntu下搭建Spark群集
在前一篇文章中,我们已经搭建好了Hadoop的群集,接下来,我们就是需要基于这个Hadoop群集,搭建Spark的群集.由于前面已经做了大量的工作,所以接下来搭建Spark会简单很多. 首先打开三个虚 ...
Windows下搭建Spark+Hadoop开发环境
Windows下搭建Spark+Hadoop开发环境需要一些工具支持. 只需要确保您的电脑已装好Java环境,那么就可以开始了. 一. 准备工作 1. 下载Hadoop2.7.1版本(写Spark和H ...
Spark在Windows下的环境搭建(转）
原作者:xuweimdm 原文网址:http://blog.csdn.net/u011513853/article/details/52865076 由于Spark是用Scala来写的,所以Spa ...
Spark学习笔记--Spark在Windows下的环境搭建
本文主要是讲解Spark在Windows环境是如何搭建的一.JDK的安装 1.1 下载JDK 首先需要安装JDK,并且将环境变量配置好,如果已经安装了的老司机可以忽略.JDK(全称是JavaTM P ...
Spark在Windows下的环境搭建
本文转载自:http://blog.csdn.net/u011513853/article/details/52865076 由于Spark是用Scala来写的,所以Spark对Scala肯定是原生态 ...
二、Spark在Windows下的环境搭建
由于Spark是用Scala来写的,所以Spark对Scala肯定是原生态支持的,因此这里以Scala为主来介绍Spark环境的搭建,主要包括四个步骤,分别是:JDK的安装,Scala的安装,Spar ...
Spark学习笔记--Spark在Windows下的环境搭建（转）
本文主要是讲解Spark在Windows环境是如何搭建的一.JDK的安装 1.1 下载JDK 首先需要安装JDK,并且将环境变量配置好,如果已经安装了的老司机可以忽略.JDK(全称是JavaTM P ...

随机推荐

开源：Taurus.MVC 框架
为什么要创造Taurus.MVC: 记得被上一家公司忽悠去负责公司电商平台的时候,情况是这样的: 项目原版是外包给第三方的,使用:WebForm+NHibernate,代码不堪入目,Bug无限,经常点 ...
首个threejs项目-前端填坑指南
第一次使用threejs到实际项目中,开始的时候心情有点小激动,毕竟是第一次嘛,然而做着做着就感受到这玩意水好深,满满的都是坑,填都填不过来.经过老板20天惨无人道的摧残,终于小有成就. 因为第一次搞 ...
06.SQLServer性能优化之---数据库级日记监控
汇总篇:http://www.cnblogs.com/dunitian/p/4822808.html#tsql 之前说了一下数据库怎么发邮件:http://www.cnblogs.com/duniti ...
video.js
1.github地址 2.常用API: class : video-js: video-js应用视频所需的风格.js功能,比如全屏和字幕. vjs-default-skin: vjs-default- ...
Android 6.0 权限知识学习笔记
最近在项目上因为6.0运行时权限吃了亏,发现之前对运行时权限的理解不足,决定回炉重造,重新学习一下Android Permission. 进入正题: Android权限在Android系统中,权限分 ...
让kindeditor显示高亮代码
kindeditor4.x代码高亮功能默认使用的是prettify插件,prettify是Google提供的一款源代码语法高亮着色器,它提供一种简单的形式来着色HTML页面上的程序代码,实现方式如下: ...
Web安全相关（四）：过多发布(Over Posting)
简介过多发布的内容相对比较简单,因此,我只打算把原文中的一些关键信息翻译一下.原文链接如下: http://www.asp.net/mvc/overview/getting-started/gett ...
java常用的设计模式
设计模式:一个程序员对设计模式的理解:"不懂"为什么要把很简单的东西搞得那么复杂.后来随着软件开发经验的增加才开始明白我所看到的"复杂"恰恰就是设计模式的精髓所 ...
Oozie分布式任务的工作流——Spark篇
Spark是现在应用最广泛的分布式计算框架,oozie支持在它的调度中执行spark.在我的日常工作中,一部分工作就是基于oozie维护好每天的spark离线任务,合理的设计工作流并分配适合的参数对于 ...
centos7 安装时候检测不到空余硬盘的解决办法
我是用U盘装的centos,在进行硬盘规划时,看到硬盘的可用空间太少这是因为我的硬盘以前装的是windows系统,硬盘几乎都已经被windows 操作系统给使用了,剩余空间也只会是windows用剩 ...