spark shell

启动spark-shell客户端

启动集群模式

本机为master节点

export MASTER=spark://`hostname`:7077
bin/spark-shell

或者

bin/spark-shell --master spark://ip:7077

如果没有spark实例启动，直接运行bin/spark-shell则启动的是本地模式，并且线程数为1，该启动方式和下面的效果一样

bin/spark-shell --master local

启动本地模式，线程数为n:

bin/spark-shell --master local[n]

./bin/spark-shell --help 查看更详细的参数信息

spark-shell 默认会创建一个SparkContext对象sc和一个SparkSession对象为spark，利用这些对象我们可以做一些命令行的操纵。

SparkSession可以用来创建SparkContext对象（spark.sparkContext），这个是新版的api。

常用的方法

RDD的方法分为transformations和actions，当对RDD进行transformation时，不会立刻执行，因为transformation是延迟执行的，

此时只会记录RDD的lineage，transformation返回的数据还是RDD。action会立刻执行，返回操作后的结果集

1、textFile：加载文件，如果文件不是分布式文件，则每个work节点都需要有这个文件，不然运行的时候会提示文件找不到错误

sc.textFile("README.md")

2、addFile：添加文件到spark中

sc.addFile("../test")

可以通过 sc.textFile(SparkFiles.get("test"))进行文件的加载，注意引入import org.apache.spark.SparkFiles

3、count：RDD中有多少条数据

val input = sc.textFile("../README.md")

input.count

4、first：返回RDD中的第一条数据

input.first

5、map：对RDD中的每一条数据做map方法中传递的方法的操作

val spaceSplit = input.map(_.split(" "))

spaceSplit.first

6、flatMap：对RDD的数据进行映射后，合并成一个集合

val fmInput = input.flatMap(_.split(" "))

flatMap:

map：

7、take：取RDD中的前几条数据

val input = sc.textFile("../README.md")

取第一条数据：input.take(1)

取前三条数据：input.take(3)

8、collect：以集合的形式返回RDD中的数据

input.collect

9、reduceByKey：对相同key的值，做给定方法的操作，下面是一个spark实现的map reduce统计文件中的单词个数

input.flatMap(_.split(" ")).map((_, 1)).reduceByKey(_+_).collect

spark shell的更多相关文章

Spark shell的原理
Spark shell是一个特别适合快速开发Spark原型程序的工具,可以帮助我们熟悉Scala语言.即使你对Scala不熟悉,仍然可以使用这个工具.Spark shell使得用户可以和Spark集群 ...
Spark:使用Spark Shell的两个示例
Spark:使用Spark Shell的两个示例 Python 行数统计 ** 注意: **使用的是Hadoop的HDFS作为持久层,需要先配置Hadoop 命令行代码 # pyspark >& ...
Spark源码分析之Spark Shell（上）
终于开始看Spark源码了,先从最常用的spark-shell脚本开始吧.不要觉得一个启动脚本有什么东东,其实里面还是有很多知识点的.另外,从启动脚本入手,是寻找代码入口最简单的方法,很多开源框架,其 ...
Spark源码分析之Spark Shell（下）
继上次的Spark-shell脚本源码分析,还剩下后面半段.由于上次涉及了不少shell的基本内容,因此就把trap和stty放在这篇来讲述. 上篇回顾:Spark源码分析之Spark Shell(上 ...
[Spark内核] 第36课：TaskScheduler内幕天机解密：Spark shell案例运行日志详解、TaskScheduler和SchedulerBackend、FIFO与FAIR、Task运行时本地性算法详解等
本課主題通过 Spark-shell 窥探程序运行时的状况 TaskScheduler 与 SchedulerBackend 之间的关系 FIFO 与 FAIR 两种调度模式彻底解密 Task 数据 ...
【原创 Hadoop&Spark 动手实践 5】Spark 基础入门，集群搭建以及Spark Shell
Spark 基础入门,集群搭建以及Spark Shell 主要借助Spark基础的PPT,再加上实际的动手操作来加强概念的理解和实践. Spark 安装部署理论已经了解的差不多了,接下来是实际动手实 ...
[Spark Core] Spark Shell 实现 Word Count
0. 说明在 Spark Shell 实现 Word Count RDD (Resilient Distributed dataset), 弹性分布式数据集. 示意图 1. 实现 1.1 分步实现 ...
Spark Shell简单使用
基础 Spark的shell作为一个强大的交互式数据分析工具,提供了一个简单的方式学习API.它可以使用Scala(在Java虚拟机上运行现有的Java库的一个很好方式)或Python.在Spark目 ...
Spark Shell Examples
Spark Shell Example 1 - Process Data from List: scala> val pairs = sc.parallelize( List( ("T ...
02、体验Spark shell下RDD编程
02.体验Spark shell下RDD编程 1.Spark RDD介绍 RDD是Resilient Distributed Dataset,中文翻译是弹性分布式数据集.该类是Spark是核心类成员之 ...

随机推荐

linux 内核与用户空间通信之netlink使用方法
转自:http://blog.csdn.net/haomcu/article/details/7371835 Linux中的进程间通信机制源自于Unix平台上的进程通信机制.Unix的两大分支AT&a ...
将android模拟器上的db文件拷贝到电脑上
1. db文件在android手机中的存储地址一般都是/data/data/packname/databases/db_file. 2.打开cmd,运行 adb shell ,使用root权限 3.通 ...
js的回调函数一些例子
这边用bootstrap 3.0的上传控件做例子下面是上传控件的一段完整的 js 操作代码. <script> // 定义这四个全局 ...
hdu1561 The more, The Better (树形dp+背包)
题目链接:http://acm.split.hdu.edu.cn/showproblem.php?pid=1561 思路:树形dp+01背包 //看注释可以懂用vector建树更简单. 代码: #i ...
table居中
- -bcenter标签已经被淘汰了让一个容器水平居中,可以使用css控制 body { text-align:center; } table { margin:0px auto; }
Android之UI编程(一):线性布局
package com.example.fk_layout; import android.app.Activity; import android.os.Bundle; public class L ...
[Python学习] Linux环境下的Python配置，必备库的安装配置
1.默认Python安装情况一般情况,Linux会预装Python的,版本较低,比如Ubuntu15的系统一般预装的是Python2.7.10. 使用命令:which python可以查看当前的py ...
js简单放羊式单元测试-上
这是看了很多js单元测试资料后第一次自己做单元测试,因为资料都在介绍工具怎么使用,js单元测试的工具是在是太多了,各种风格,各种支持的,新的旧的,so 还是自己动手来体验一次简单是我给自己的需求很 ...
$Ajax简单理解
关于web开发的可能我们不能或缺的利器就是$Ajax,我们这里就不具体的将里面的原理(如果大家有时间的话可以好好的看看javascript里面的权威指南)里面讲的比较详细了这里就在不说了.今天我们就 ...
网站开发常用cmd命令
一.Windows服务安装: framework 4.0 : cd C:\Windows\Microsoft.NET\Framework\v4.0.30319 framework 2.0 : cd ...

spark shell

启动spark-shell客户端

常用的方法

spark shell的更多相关文章

随机推荐

热门专题