转自：http://kaimingwan.com/post/alluxio/effective-spark-rdds-with-alluxio

1. 介绍

近期，作者给我推荐了一篇spark on alluxio的文章。原文地址：Effective Spark RDDs with Alluxio

本文不会全文翻译，主要提取一些文章的内容和观点结合自己的理解做下总结。

2. 引言

文章首先说了像百度、去哪儿这些企业都已经在生产上用上了alluxio，效果很好（spark streaming job提升15倍-300倍）。

在不使用alluxio之前，可能由于内存不足会导致spark job性能变差，甚至无法完成。本文也主要介绍alluxio是如何去改进spark性能，以及使用spark on alluxio的注意点。文中采用spark 2.0， alluxio版本1.2。

alluxio可以使得spark jobs共享内存数据。通过把RDD保存在alluxio使得RDD可以在多个spark job之间共享。

3. Alluxio and Spark RDD Cache

spark提升性能主要是可以把RDD放到Spark executors拥有的内存中，方便下一次访问时可以直接访问。这样就可以起到提升性能的效果。由于可能有很大的数据集，可能有时会导致没有足够的内存用于计算。例如去哪儿之前就遇到过这样的问题，即数据集太大导致无法放入内存。并且如果JOB crash了，这些内存数据也不会持久化。那么下一次访问的时候，就无法从内存取数据来加速了。

将RDD数据存放在ALLUXIO是个可选的方案。spark job不需要配置额外的内存来存放数据，只需要预留足够的内存用于计算即可。数据存放在alluxio不受job crash的影响。

将RDD保存到alluxio时比较简单的，只需要将RDD保存到ALLUXIO即可。有两种方式来保存RDD文件：

saveAsTextFile
saveAsObjectFile

通过以下两种方式，可以从alluxio内存空间读取文件

sc.textFile
sc.objectFile

下面通过一些实验来理解使用alluxio和使用Spark RDD cache的区别

实验硬件信息：single r3.2xlarge Amazon EC2 instance, with 61GB of memory and 8 cores.

4. 保存RDD

实验分别对比的是：

使用 Spark rdd cache: 采用persist()保存RDD
使用alluxio: 采用saveAsTextFile和saveAsObjectFile这两个API

4.1 采用persist()

通过persist() API可以在不同的存储媒介上保存RDD：

作为实验，我们涉及以下的存储方式：

MEMORY_ONLY: 在Spark的JVM内存上存储JAVA对象
MEMORY_ONLY_SER：在Spark的JVM内存上存储序列化后的JAVA对象
DISK_ONLY: 保存在本地磁盘

例子：

rdd.persist(MEMORY_ONLY)
rdd.count()

4.2 采用saveAsTextFile和saveAsObjectFile

例子：

rdd.saveAsTextFile(alluxioPath)
rdd = sc.textFile(alluxioPath)
rdd.count()

5. 读取保存后的RDD

RDD保存后，在后续计算中，都可以读取出来使用。我们通过测试读取RDD并且使用count()来统计行数所消耗的时间来衡量性能。下图是实验的结果：

从图上可以看到，RDD存放在ALLUXIO中，其性能和数据集大小之间的关系是比较稳定的。当RDD存放在Spark JVM内存中时，可以看到当RDD size超过10GB时, MEMORY_ONLY的方式就开始性能下降了。这个主要是由于在Spark Cache当中如果不做序列化，RDD大小会比源文件大很多。所以虽然有61GB的总内存，但是从10G开始就开始性能会下降。

此外图上也能看到，对于太小的数据集来说，RDD存放在Spark JVM中反而比使用alluxio性能更好一些。

对于一个给定内存大小的节点来说，alluxio使得应用能够以内存速度处理更多的数据。（图上看起来就是，Spark JVM cache很容易就放不下比较大的数据集）

Effective Spark RDDs with Alluxio【转】的更多相关文章

Spark RDDs vs DataFrames vs SparkSQL
简介 Spark的 RDD.DataFrame 和 SparkSQL的性能比较. 2方面的比较单条记录的随机查找 aggregation聚合并且sorting后输出使用以下Spark的三种方式来解 ...
<Spark><Programming><RDDs>
Introduction to Core Spark Concepts driver program: 在集群上启动一系列的并行操作包含应用的main函数,定义集群上的分布式数据集,操作数据集通过 ...
Hive架构及Hive On Spark
Hive的所有数据都存在HDFS中. (1)Table:每个表都对应在HDFS中的目录下,数据是经过序列化后存储在该目录中.同时Hive也支持表中的数据存储在其他类型的文件系统中,如NFS或本地文件系 ...
Spark之GraphX的Graph_scala学习
/* * Licensed to the Apache Software Foundation (ASF) under one or more * contributor license agreem ...
搭建一个IntelliJ的Spark项目
之前发现创建一个新项目之后,无法添加scala class 创建新项目选择maven项目,然后选择simple或者quickstart: 进入项目后,在Project Structure里面,在gl ...
spark 三种数据集的关系（一）
Catalyst Optimizer: Dataset 数据集仅可用Scala或Java.但是,我们提供了以下上下文来更好地理解Spark 2.0的方向数据集是在2015年作为Apache Spark ...
Spark OFF_HEP变迁
在文章的开头,安利一下我自己的github上的一个项目:AlluxioBlockManager,同时还有我的github上的博客:blog这个项目的作用是替代Spark2.0以前默认的TachyonB ...
Spark RDD Tutorial
Spark RDD教程这个教程将会帮助你理解和使用Apache Spark RDD.所有的在这个教程中使用的RDD例子将会提供在github上,供大家快速的浏览. 什么是RDD(Rssilient ...
A Tale of Three Apache Spark APIs: RDDs, DataFrames, and Datasets（中英双语）
文章标题 A Tale of Three Apache Spark APIs: RDDs, DataFrames, and Datasets 且谈Apache Spark的API三剑客:RDD.Dat ...

随机推荐

fileUpload(草稿)
Java关于文件上传的一个例子发表于2012/6/7 13:01:56 1374人阅读分类: JavaWeb 文件上传不能用get方式提交,因为他提交的数据量最多只有1kb, IE浏览器默认情况 ...
gitignore file already add
忽略一些已经添加到Git版本管理的文件先用 git remove --cache filename 再将文件加入.gitignore文件
JAVA环境变量的脚本
简单的一个脚本,用于自动设置环境变量.把代码拷贝,另存为javaEnv.bat.安装完Java 2 SDK之后,开一个命令行窗口,输入javaEnv java2SDKDir(java2SDKDir是你 ...
再说Android RecyclerView局部刷新那个坑
RecyclerView局部刷新大家都遇到过,有时候还说会遇见图片闪烁的问题. 优化之前的效果: 优化之后的效果: 如果想单独更新一个item,我们通常会这样做,代码如下: mLRecyclerV ...
简单易用的安装文件制作工具NSIS的使用demo示例
安装文件制作工具NSIS 使用总结在给客户开发客户端软件时,为避免技术人员亲自上门安装带来额外的成本损耗,通常我们都会自作一个安装包,以确保我们开发的程序的相关依赖资源.环境在客户端运行前能自动 ...
java File类中的mkdir()和mkdirs()有什么区别
mkdir() 只能在已经存在的目录中创建创建文件夹. mkdirs() 可以在不存在的目录中创建文件夹.诸如:a\\b,既可以创建多级目录.
Linux版迅雷(Xware)安装配置方法
Linux版迅雷下载请见:Xware下载解压下载的压缩包核对MD5或SHA1校验值解压得到以下三个文件安装文件在/usr/local/下创建thunder文件夹,将上面的三个文件放入,然后运 ...
IDEA（2018.01）安装和破解
IDEA(2018.01)安装和破解 1.下载IDE https://www.jetbrains.com/idea/download/#section=windows 选择Ultimate版本 2.下 ...
python2 与 python3的区别总结
python2 与 python3的区别总结几乎所有的Python 2程序都需要一些修改才能正常地运行在Python 3的环境下.为了简化这个转换过程,Python 3自带了一个叫做2to3的 ...
eclipse 开发 spring 、 springboot项目调试时一直跳转到 SilentExitExceptionHandler.exitCurrentThread 方法
不想让 eclipse 调试时一直跳转到该方法解决方法: Eclipse->[Preferences]->[Java]->[Debug]:去掉[Suspend execution ...

Effective Spark RDDs with Alluxio【转】