Spark学习笔记之SparkRDD

ChouYarn 2024-10-12 05:30:44 原文

Spark学习笔记之SparkRDD

一、基本概念

RDD（resilient distributed datasets）弹性分布式数据集。

来自于两方面

① 内存集合和外部存储系统

② 通过转换来自于其他RDD，如map，filter等

2.创建操作（creation operation）：RDD的创建由SparkContext来负责。

3.转换操作（transformation operation）：将一个RDD通过一定操作转换为另一个RDD。

4.控制操作（control operation）：对RDD进行持久化等。

5.行动操作（action operation）：Spark为惰性计算，对RDD的行动操作都会触发Spark作业的运行。

基本分为两类

① 使操作结果变为Scala变量或者标量。

② 将RDD保存到外部文件或者数据库系统中。

6.RDD分区（partitions）

分区多少关系到对这个RDD进行并行计算的粒度，每一个RDD分区的计算操作都在一个单独的任务中被执行

7.RDD优先位置（preferredLocations）

是RDD中每个分区所存储的位置

8.RDD依赖关系（dependencies）

窄依赖：每一个父RDD的分区最多只被子RDD的一个分区使用

宽依赖：多个子RDD的分区会依赖同一个父RDD的分区

9.RDD分区计算（compute）

Spark中每个RDD的计算都是以分区为单位的，而且RDD中的compute函数都是在对迭代器进行复合，只返回相应分区数据的迭代器。

10.RDD分区函数（partitioner）

两类分区函数：HashPartitioner和RangPartitioner。

二、创建操作

集合创建操作：makeRDD可以指定每个分区perferredLocations参数parallelize则没有
存储创建操作：Spark与Hadoop完全兼容，所以对Hadoop所支持的文件类型或者数据库类型，Spark同样支持。
基本转换操作

三、转换操作

map：将RDD中T类型一对一转换为U

distinct：返回RDD不重复元素

flatMap：将元素一对多转换

reparation、coalesce：对RDD分区重新划分，reparation只是coalesce接口中shuffle为true的简易实现

randomSplit：将RDD切分

glom：将类型为T的元素转换为Array[T]

union等等

键值RDD转换操作

partitionBy、mapValues、flatMapValues等

RDD依赖关系，Spark生成的RDD对象一般多于用户书写的Spark应用程序中包含的RDD，因为RDD在转换操作过程中产生临时的RDD

四、控制操作

cache（）：

persist（）：保留着RDD的依赖关系

checkpoint（level：StorageLevel）：RDD[T]切断RDD依赖关系

五、行动操作

集合标量行动操作

first：返回RDD第一个元素

count：返回RDD中元素个数

reduce：对RDD的元素进行二元计算

aggregate：聚合函数

fold：是aggregate的便利借口

存储行动操作

saveAsHadoopFile

saveAsHadoopDataset等

Spark学习笔记之SparkRDD的更多相关文章

spark学习笔记总结-spark入门资料精化
Spark学习笔记 Spark简介 spark 可以很容易和yarn结合,直接调用HDFS.Hbase上面的数据,和hadoop结合.配置很容易. spark发展迅猛,框架比hadoop更加灵活实用. ...
Spark学习笔记2（spark所需环境配置
Spark学习笔记2 配置spark所需环境 1.首先先把本地的maven的压缩包解压到本地文件夹中,安装好本地的maven客户端程序,版本没有什么要求不需要最新版的maven客户端. 解压完成之后 ...
Spark学习笔记3（IDEA编写scala代码并打包上传集群运行）
Spark学习笔记3 IDEA编写scala代码并打包上传集群运行我们在IDEA上的maven项目已经搭建完成了,现在可以写一个简单的spark代码并且打成jar包上传至集群,来检验一下我们的sp ...
Spark学习笔记-GraphX-1
Spark学习笔记-GraphX-1 标签: SparkGraphGraphX图计算 2014-09-29 13:04 2339人阅读评论(0) 收藏举报分类: Spark(8) 版权声明: ...
Spark学习笔记3——RDD（下）
目录 Spark学习笔记3--RDD(下) 向Spark传递函数通过匿名内部类通过具名类传递通过带参数的 Java 函数类传递通过 lambda 表达式传递(仅限于 Java 8 及以上) 常 ...
Spark学习笔记0——简单了解和技术架构
目录 Spark学习笔记0--简单了解和技术架构什么是Spark 技术架构和软件栈 Spark Core Spark SQL Spark Streaming MLlib GraphX 集群管理器受 ...
Spark学习笔记2——RDD（上）
目录 Spark学习笔记2--RDD(上) RDD是什么? 例子创建 RDD 并行化方式读取外部数据集方式 RDD 操作转化操作行动操作惰性求值 Spark学习笔记2--RDD(上) 笔记摘 ...
Spark学习笔记1——第一个Spark程序：单词数统计
Spark学习笔记1--第一个Spark程序:单词数统计笔记摘抄自 [美] Holden Karau 等著的<Spark快速大数据分析> 添加依赖通过 Maven 添加 Spark-c ...
Spark学习笔记——读写Hbase
1.首先在Hbase中建立一张表,名字为student 参考 Hbase学习笔记——基本CRUD操作一个cell的值,取决于Row,Column family,Column Qualifier和Ti ...

随机推荐

JAVA课程体系
文件流单点登录 maven.maven私服 jenkins 小程序支付 webservice/webapi redis 工作流权限:shiro 高并发 springBoot dubbo 消息推送 ...
Fully Convolutional Networks for semantic Segmentation（深度学习经典论文翻译）
摘要卷积网络在特征分层领域是非常强大的视觉模型.我们证明了经过端到端.像素到像素训练的卷积网络超过语义分割中最先进的技术.我们的核心观点是建立"全卷积"网络,输入任意尺寸,经过有 ...
AES加密算法C++实现
我从网上下载了一套AES加密算法的C++实现,代码如下: (1)aes.h #ifndef SRC_UTILS_AES_H #define SRC_UTILS_AES_H class AES { pu ...
protobuf C++ 使用示例
1.在.proto文件中定义消息格式 2.使用protobuf编译器 3.使用c++ api来读写消息 0.为何使用protobuf? 1.原始内存数据结构,可以以二进制方式sent/saved.这种 ...
解决Excel 2010只有一个窗口的问题
Excel 2010打开多个文件,但只有一个窗口的问题. 一般首次安装没有这个问题,碰到装了WPS后再卸载WPS,还有就是OFFICE卸载后重装,也会发生这个现像. 一.: 删除 HKEY_CLASS ...
PHP静态变量定义memcache对象的调用
<?php $do = $_GET['do']; myCache($do,'do'); echo myCache($do); /** * 缓存管理 * @param mixed $name 缓存 ...
c#Ice开发之环境配置（一）
第一步,基于Windows下的安装,所以下载windows版的Ice,官网最新版本是Ice3.5.1: http://www.zeroc.com/download/ 安装完成可以在vs-工具的最下面看 ...
java如何区分是form表单请求，还是ajax请求
requestType = request.getHeader("X-Requested-With"); if(requestType==null) ...
OpenCV配置经历简述
关于OpenCV的配置过程在这里做一简述和记录. 配置的是OpenCV2.2.0,环境为VS2010. 首先在OpenCV官网(http://opencv.org/downloads.html)下载了 ...
【解决】org.apache.hadoop.util.Shell$ExitCodeException: /bin/bash: line 0: fg: no job control
[环境信息] Hadoop版本:2.4.0 客户端OS:Windows Server 2008 R2 服务器端OS:CentOS 6.4 [问题现象] 在通过Windows客户端向Linux服务器提交 ...