Spark Shuffle 过程

本文参考：http://www.cnblogs.com/cenyuhai/p/3826227.html

在数据流动的整个过程中，最复杂最影响性能的环节，就是 Shuffle 过程，本文将参考大神的博客，根据 Spark-1.5 的代码，再次走读一遍。

Shuffle 过程

Spark 中最经典的 Shuffle 过程发生在函数 reduceByKey、groupByKey。这里以 reduceByKey 为例分析。举个例子：

val pairs = sc.parallelize(Array((, ), (, ), (, ), (, ), (, )))

val sums = pairs.reduceByKey(_ + _).collect()

sums.foreach(println)

结果为：

(,)

(,)

相关代码如下：

def reduceByKey(func: (V, V) => V, numPartitions: Int): RDD[(K, V)] = self.withScope {

  reduceByKey(new HashPartitioner(numPartitions), func)

}

/**

 * Merge the values for each key using an associative reduce function. This will also perform

 * the merging locally on each mapper before sending results to a reducer, similarly to a

 * "combiner" in MapReduce. Output will be hash-partitioned with the existing partitioner/

 * parallelism level.

 */

def reduceByKey(func: (V, V) => V): RDD[(K, V)] = self.withScope {

  reduceByKey(defaultPartitioner(self), func)

}

注释说的挺清楚的，翻译一下：使用 reduce 函数 merge 同一个 key 的 values。这里会在每个 mapper 端执行本地的 merge，然后将结果发送到 reducer 端，作用类似于 MapReduce 中的 combiner。输出结果会被 hash-partitioned。之后的代码也会解释这个步骤。

第一个 reduceByKey 的分区数目是传入的，第二个则使用默认方法：

def defaultPartitioner(rdd: RDD[_], others: RDD[_]*): Partitioner = {

  val bySize = (Seq(rdd) ++ others).sortBy(_.partitions.size).reverse

  for (r <- bySize if r.partitioner.isDefined && r.partitioner.get.numPartitions > ) {

    return r.partitioner.get

  }

  if (rdd.context.conf.contains("spark.default.parallelism")) {

    new HashPartitioner(rdd.context.defaultParallelism)

  } else {

    new HashPartitioner(bySize.head.partitions.size)

  }

}

默认的计算方式为：

1. 优先使用自定义的分区函数

2. 次而使用参数 spark.default.parallelism 作为分区数，创建 HashPartition

3. 最后选择输入数据的分区数，创建 HashPartition

==== 未完待续

Spark Shuffle 过程的更多相关文章

022 Spark shuffle过程
1.官网 http://spark.apache.org/docs/1.6.1/configuration.html#shuffle-behavior Spark数据进行重新分区的操作就叫做shuf ...
浅析 Spark Shuffle 内存使用
在使用 Spark 进行计算时,我们经常会碰到作业 (Job) Out Of Memory(OOM) 的情况,而且很大一部分情况是发生在 Shuffle 阶段.那么在 Spark Shuffle 中具 ...
Spark Shuffle数据处理过程与部分调优（源码阅读七）
shuffle...相当重要,为什么咩,因为shuffle的性能优劣直接决定了整个计算引擎的性能和吞吐量.相比于Hadoop的MapReduce,可以看到Spark提供多种计算结果处理方式,对shuf ...
Spark shuffle详细过程
有许多场景下,我们需要进行跨服务器的数据整合,比如两个表之间,通过Id进行join操作,你必须确保所有具有相同id的数据整合到相同的块文件中.那么我们先说一下mapreduce的shuffle过程. ...
彻底搞懂spark的shuffle过程（shuffle write）
什么时候需要 shuffle writer 假如我们有个 spark job 依赖关系如下我们抽象出来其中的rdd和依赖关系: E <-------n------, ...
Spark 的 Shuffle过程介绍`
Spark的Shuffle过程介绍 Shuffle Writer Spark丰富了任务类型,有些任务之间数据流转不需要通过Shuffle,但是有些任务之间还是需要通过Shuffle来传递数据,比如wi ...
剖析Hadoop和Spark的Shuffle过程差异
一.前言对于基于MapReduce编程范式的分布式计算来说,本质上而言,就是在计算数据的交.并.差.聚合.排序等过程.而分布式计算分而治之的思想,让每个节点只计算部分数据,也就是只处理一个分片,那么 ...
剖析Hadoop和Spark的Shuffle过程差异（一）
一.前言对于基于MapReduce编程范式的分布式计算来说,本质上而言,就是在计算数据的交.并.差.聚合.排序等过程.而分布式计算分而治之的思想,让每个节点只计算部分数据,也就是只处理一个分片,那么 ...
Spark的Shuffle过程介绍
Spark的Shuffle过程介绍 Shuffle Writer Spark丰富了任务类型,有些任务之间数据流转不需要通过Shuffle,但是有些任务之间还是需要通过Shuffle来传递数据,比如wi ...

随机推荐

elk安装2.0版本，自己总结，比较细致 es单机的安装
用root用户会报错,版本6之前还是可以用root用户启动的,针对es的保护,数据的一些问题,6之后就不允许了. 启动成功下面验证一下可以直接用浏览器访问,接受http访问配置,因为没有暴露端 ...
ubuntu13.10更新sources.list
步骤: 1>设置网络连接方式,NAT 2>自动获取ip address 10.0.2.15 3>更新源soureces.list soureces.list deb http://m ...
Apache Shiro安全（权限框架）学习笔记一
1. 授权需要继承 AuthorizingRealm 类, 并实现其 doGetAuthorizationInfo 方法 2. AuthorizingRealm 类继承自 Authenticating ...
【转】Python中*args和**kwargs的区别
一.*args的使用方法 *args 用来将参数打包成tuple给函数体调用例子一: 输出结果以元组的形式展示 def function(*args): print(args, type(args) ...
Java基础 -1.2
Shell是脚本程序的含义在很多编程语言中为了方便使用者进行代码的开发都会有shell交互式编程环境可能是为了进行一些简短的程序验证但是在java里面就必须编写很多的结果代码才可以实现为了解 ...
Redis的安装配置及简单集群部署
最近针对中铁一局项目,跟事业部讨论之后需要我们的KF平台能够接入一些开源的数据库,于是这两天研究了一下Redis的原理. 1. Redis的数据存储原理及简述 1.1Redis简述 Redis是一个基 ...
获取Webshell方法总结
一.CMS获取Webshell方法搜索CMS网站程序名称 eg:phpcms拿webshell.wordpress后台拿webshell 二.非CMS获取Webshell方法 2.1数据库备份获取W ...
JavaScript图形实例：正多边形
圆心位于坐标原点,半径为R的圆的参数方程为 X=R*COS(θ) Y=R*SIN(θ) 在圆上取N个等分点,将这N个点首尾连接N条边,可以得到一个正N边形. 1．正多边形阵列构造一个8行8列的正N( ...
概率图模型（PGM，Probabilistic Graphical Model）
PGM是现代信号处理(尤其是机器学习)的重要内容. PGM通过图的方式,将多个随机变量之前的关系通过简洁的方式表现出来.因此PGM包括图论和概率论的相关内容. PGM理论研究并解决三个问题: 1)表示 ...
win7/10获取本地wifi密码明文
win7 单击右下角无线网图标,选择已连接的无线网右击无线网名称,选择属性点击标题栏的安全,再点击显示字符,即可显示wifi密码明文 win10 控制面板[查看方式选类别]-查看网络状态和任务点 ...

Spark Shuffle 过程

Spark Shuffle 过程的更多相关文章

随机推荐

热门专题