Spark学习笔记总结

02. Spark任务流程

1. RDD的依赖关系

RDD和它依赖的父RDD（s）的关系有两种不同的类型，即窄依赖（narrow dependency）和宽依赖（wide dependency）

窄依赖
窄依赖指的是每一个父RDD的Partition最多被子RDD的一个Partition使用
总结：窄依赖我们形象的比喻为独生子女
宽依赖
宽依赖指的是多个子RDD的Partition会依赖同一个父RDD的Partition

总结：窄依赖我们形象的比喻为超生（多个子女）
查看RDD依赖关系：
整个树形结构：rdd.toDebugString
本身：rdd.dependencies

2. DAG的生成

DAG，有向无环图，原始的RDD通过一系列的转换就就形成了DAG，根据RDD之间的依赖关系的不同将DAG划分成不同的Stage，对于窄依赖，partition的转换处理在Stage中完成计算。对于宽依赖，由于有Shuffle的存在，只能在parent RDD处理完成后，才能开始接下来的计算，因此宽依赖是划分Stage的依据。

3. Spark任务执行流程

大致分为4步：

根据算子生成DAG
将DAG根据宽依赖切分成任务集合的stages
Driver将具体任务分发给Worker
Worker中的executor执行任务
DAGScheduler和TaskScheduler都在Driver中

4. wordcount执行流程

1. wc示例代码

//textFile会产生两个RDD： 1. HadoopRDD -> MapPartitionsRDD

sc.textFile(INPUT_PATH)

  //flatMap产生1个RDD：MapPartitionsRDD

  .flatMap { _.split(" ") }

  //map产生1个RDD：MapPartitionsRDD

  .map { (_, 1) }

  //reduceByKey产生了：ShuffledRDD

  .reduceByKey(_ + _)

  //暂时不管

  .sortBy(_._2, false)

  //saveAsTextFile产生1个RDD：MapPartitionsRDD

  .saveAsTextFile(OUTPUT_PATH)

一共产生了6个RDD

2. 执行流程-切分stage

执行流程：

根据宽依赖划分成了两个stage，后面一个stage需要等待前一个计算完成
第一个stage中的taskSet包含了3个task
一个task就是一个流水线pipelining，可以与其他task并行执行，在这里，任务内容是相同的，只是数据不同。

初接触，记下学习笔记，还有很多问题，望指导，谢谢。

Spark任务流程笔记的更多相关文章

Spark 基本函数学习笔记一
Spark 基本函数学习笔记一¶ spark的函数主要分两类,Transformations和Actions. Transformations为一些数据转换类函数,actions为一些行动类函数: ...
Spark源代码阅读笔记之DiskStore
Spark源代码阅读笔记之DiskStore BlockManager底层通过BlockStore来对数据进行实际的存储.BlockStore是一个抽象类,有三种实现:DiskStore(磁盘级别的持 ...
大数据学习day23-----spark06--------1. Spark执行流程（知识补充：RDD的依赖关系）2. Repartition和coalesce算子的区别 3.触发多次actions时，速度不一样 4. RDD的深入理解（错误例子，RDD数据是如何获取的）5 购物的相关计算
1. Spark执行流程知识补充:RDD的依赖关系 RDD的依赖关系分为两类:窄依赖(Narrow Dependency)和宽依赖(Shuffle Dependency) (1)窄依赖窄依赖指的是 ...
Spark学习之路（七）Spark 运行流程
一.Spark中的基本概念 (1)Application:表示你的应用程序 (2)Driver:表示main()函数,创建SparkContext.由SparkContext负责与ClusterMan ...
Hadoop/Spark入门学习笔记(完结)
Hadoop基础及演练 ---第1章初识大数据大数据是一个概念也是一门技术,是在以Hadoop为代表的大数据平台框架上进行各种数据分析的技术. ---第2章 Hadoop核心HDFS Hadoop ...
Spark学习之路（七）Spark 运行流程[转]
Spark中的基本概念 (1)Application:表示你的应用程序 (2)Driver:表示main()函数,创建SparkContext.由SparkContext负责与ClusterManag ...
spark发行版笔记11
本期概览: ReceiverTracker架构设计消息循环系统 ReceiverTracker具体的实现 Spark Streaming作为Spark Core基础架构之上的一个应用程序,其中的R ...
spark发行版笔记10
感谢DT大数据梦工厂支持提供技术支持,DT大数据梦工厂专注于Spark发行版定制. 本期概览: 数据接收全生命周期的思考大数据处理框架中,最重要的就是性能,性能是排在前面的.其次再考虑其他的.因为数 ...
spark发行版笔记9
感谢DT大数据梦工厂支持提供技术支持,DT大数据梦工厂专注于Spark发行版定制. 本期概览: 1 Receiver生命全周期首先,我们找到数据来源的入口,入口如下 Receiver的设计是极其巧妙 ...

随机推荐

pomelo 安装 windows 下
最近一直在捣鼓这个东西,看着个的先记录下发帖时间, pomelo 现在最新版是2.0 的,和之前的版本的启动时有区别的(命令行)的,可以进pomelo官网去看下基本的信息, 在pomelo官方论坛上的 ...
C/C++资料网站
1.C语言基础知识讲解 http://c-faq-chn.sourceforge.net/ccfaq/node1.html 2.C++参考手册中文版 http://zh.cppreference.co ...
android TranslateAnimation 顶部segment分段移动动画
这里实现的功能是从主页布局的fragment点击跳转到一个acitivity,然后顶部是一个切换的segment顶部是一个listview,点击segment分段让listview加载不同的内容.我这 ...
Spring-MVC开发步骤(入门配置)
Spring-MVC开发步骤(入门配置) Step1.导包 spring-webmvc Step2.添加spring配置文件 Step3.配置DispatcherServlet 在web.xml中: ...
spring mvc:日志对象logger的复用
在采用Spring mvc+org.slf4j.Logger开发项目时,发现几乎每个controller或者manager都有的一个标配: private final static Logger LO ...
初入PHP，（for循环~水仙花数）
找出100-999之间的所有"水仙花数".所谓水仙花数是指一个三位数,各位数字的立方和等于该数本身.(如153次方＝1的3次方+5的3次方+3的3次方)并输出这些数字想想153 ...
★10 个实用技巧，让Finder带你飞~
10 个实用技巧,让 Finder 带你飞 Finder 是 Mac 电脑的系统程序,有的功能类似 Windows 的资源管理器.它是我们打开 Mac 首先见到的「笑脸」,有了它,我们可以组织和使用 ...
【ctrl+A】与【ctrl+单击图层缩略图】有什么区别?
如果这图层没有透明区域的话那和ctrl+A的效果是一样的! 但如果图层有不透明区域,那选中的就是图层中所有不透明的区域!
【Beta阶段】第三次scrum meeting
Coding/OSChina 地址 1. 会议内容学号主要负责的方向昨日任务昨日任务完成进度接下去要做 99 PM 打包上传团队代码 100% 查找适合的素材模块,和105一起把手势功能连接 ...
201521123045 《Java程序设计》第7周学习总结
Java 第七周总结 1. 本周学习总结 2. 书面作业 1.ArrayList代码分析 1.1 解释ArrayList的contains源代码 public boolean contains(Obj ...

Spark任务流程笔记