Spark缓存策略

当对同一个rdd多次执行action时，如果在磁盘上则每次执行action都会从磁盘将数据加载，如果将其缓存到内存中会提高再次action的读取速度，Spark缓存主要有cache()和persist()两种，当缓存一个rdd时，每一个节点上都会存放这个rdd的partition，当要使用rdd的时候可以直接从内存读出。

cache源码：

def cache(self):

        """

        Persist this RDD with the default storage level (C{MEMORY_ONLY}).

        """

        self.is_cached = True

        self.persist(StorageLevel.MEMORY_ONLY)

        return self

从源码可以看出，cache底层调用的是persist方法，传入的参数是：StorageLevel.MEMORY_ONLY，再看persist()方法：

def persist(self, storageLevel=StorageLevel.MEMORY_ONLY):

        self.is_cached = True

        javaStorageLevel = self.ctx._getJavaStorageLevel(storageLevel)

        self._jrdd.persist(javaStorageLevel)

        return self

persist方法，传入的参数是StorageLevel，从StorageLevel的源码可以看出它的值总共有6种，因此persist()相比cache()在缓存形式上更为丰富，不仅支持内存的方式，还支持内存和磁盘、内存副本等方式。

StorageLevel.DISK_ONLY = StorageLevel(True, False, False, False)

StorageLevel.DISK_ONLY_2 = StorageLevel(True, False, False, False, 2)

StorageLevel.MEMORY_ONLY = StorageLevel(False, True, False, False)

StorageLevel.MEMORY_ONLY_2 = StorageLevel(False, True, False, False, 2)

StorageLevel.MEMORY_AND_DISK = StorageLevel(True, True, False, False)

StorageLevel.MEMORY_AND_DISK_2 = StorageLevel(True, True, False, False, 2)

StorageLevel.OFF_HEAP = StorageLevel(True, True, True, False, 1)

持久化到内存和直接从磁盘读取时间对比：

import os

import time

from pyspark import SparkContext, SparkConf

conf = SparkConf()

sc = SparkContext(conf=conf)

current_dir = os.path.dirname(os.path.realpath(__file__))

file_path = "{}/name_age.txt".format(current_dir)

def cached():

    start_time = time.time()

    text_rdd = sc.textFile("file://{}".format(file_path)).cache()

    text_rdd.count()

    text_rdd.count()

    end_time = time.time()

    print("{}:{}".format("first cache", end_time - start_time))

    start1_time = time.time()

    text1_rdd = sc.textFile("file://{}".format(file_path)).cache()

    text1_rdd.count()

    text1_rdd.count()

    end1_time = time.time()

    print("{}:{}".format("second cache", end1_time - start1_time))

def uncached():

    start_time = time.time()

    text_rdd = sc.textFile("file://{}".format(file_path))

    text_rdd.count()

    text_rdd.count()

    end_time = time.time()

    print("{}:{}".format("first uncache", end_time - start_time))

    start1_time = time.time()

    text1_rdd = sc.textFile("file://{}".format(file_path))

    text1_rdd.count()

    text1_rdd.count()

    end1_time = time.time()

    print("{}:{}".format("second uncache", end1_time - start1_time))

sc.stop()

执行cached()结果：

first cache:1.7104301452636719

second cache:0.2717571258544922

执行uncached()结果：

first uncache:1.4453039169311523

second uncache:0.49161386489868164

从执行结果可以看出，当第二次执行rdd.count()时，有cache情况下是0.2717571258544922；无cache情况下是0.49161386489868164，由于我的内存空间不足，所以不太明显，当数据量大且内存充足的时候，持久化到内存的效率会远远高于磁盘。

对pyspark有兴趣的小伙伴可以关注我的github，spark for python 持续更新

Spark缓存策略的更多相关文章

RDD缓存策略
Spark支持将数据集放置在集群的缓存中,以便于数据重用. Spark缓存策略对应的类: class StorageLevel private( private var useDisk_ : Bool ...
RDD概念、特性、缓存策略与容错
一.RDD概念与特性 1. RDD的概念 RDD(Resilient Distributed Dataset),是指弹性分布式数据集.数据集:Spark中的编程是基于RDD的,将原始数据加载到内存变成 ...
Spark持久化策略
spark持久化策略_缓存优化persist.cache都是持久化到内存缓存策略 StorageLevel_useDisk:是否使用磁盘_useMemory:是否使用内存_useOffHeap:不用堆 ...
Spark 缓存机制
Spark中的缓存机制:避免spark每次都重算RDD以及它的所有依赖,cache().persist(). checkpoint(). 1.cache():会被重复使用,但是不能太大的RDD,将其c ...
【腾讯Bugly干货分享】彻底弄懂 Http 缓存机制 - 基于缓存策略三要素分解法
本文来自于腾讯Bugly公众号(weixinBugly),未经作者同意,请勿转载,原文地址:https://mp.weixin.qq.com/s/qOMO0LIdA47j3RjhbCWUEQ 作者:李 ...
【转】理解Java Integer的缓存策略
本文将介绍 Java 中 Integer 缓存的相关知识.这是 Java 5 中引入的一个有助于节省内存.提高性能的特性.首先看一个使用 Integer 的示例代码,展示了 Integer 的缓存行为 ...
Redis的缓存策略和主键失效机制
作为缓存系统都要定期清理无效数据,就需要一个主键失效和淘汰策略. >>EXPIRE主键失效机制在Redis当中,有生存期的key被称为volatile,在创建缓存时,要为给定的key设置 ...
Web开发基本准则-55实录-缓存策略
续上篇<Web开发基本准则-55实录-Web访问安全>. Web开发基本准则-55实录-缓存策略郑昀创建于2013年2月郑昀最后更新于2013年10月26日提纲: Web访问安全 ...
腾讯QQ你的缓存策略应该改下了
缓存策略基本原则大家都怎么考虑的? 缓存好友数量这个也是醉了,这个数字好像变化频率有点低吧,ok,就算你企鹅用户量大,需要缓存,那肉肉的问一句你这更新策略也不能只管网上涨的,不管往下降的吧?难不成你是 ...

随机推荐

[十二省联考2019]字符串问题——后缀自动机+parent树优化建图+拓扑序DP+倍增
题目链接: [十二省联考2019]字符串问题首先考虑最暴力的做法就是对于每个$B$串存一下它是哪些$A$串的前缀,然后按每组支配关系连边,做一遍拓扑序DP即可. 但即使忽略判断前缀的时间,光是连边的 ...
洛谷P1608路径统计
题目这个提示一个简单的最短路计数,除了用数组存上最短路的个数的做法以外,还有可以在得出最短路之后,搜索加剪枝的方法来通过该题. 可以反向搜索用A*的方法来通过,但是这个题的去重十分的恶心,需要一些玄 ...
codeforces 786E ALT
题目链接:CF786E 输出方案暗示网络流我们考虑最朴素的建图由源点$s$连向所有人,容量为1:树上所有的边视作节点连向$t$,流量为1:人向其路径上所有的树边连边,流量为$inf$, ...
Excel将一列数据变为两列
如下表可将第一列分散到第二列和第三列 A B C 1 =OFFSET($A$1,(ROW(A1)-1)*2+COLUMN(A1)-1,) &"" =OFFSET($A$2, ...
不定参数对arguments对象的影响
如果声明函数时定义了不定参数,则在函数被调用时,arguments对象包含了所有传入的参数: function checkArgs(...args){ console.log(args.length, ...
在vue中引入scss
先npm安装stylus和stylus-loader (我安装后,报错提示缺少stylus,所以第一步安装stylus,如果没有提示可省略第一步) 1.到 package.json ----- de ...
HTTP中application/x-www-form-urlencoded字符说明
一.概述在学习ajax的时候,如果用post请求,需要设置如下代码. ajax.setRequestHeader("content-type","application ...
jsonp简介
jsonp主要是利用script的跨域.简单点说就是像img,css,js这样的文件是跨域的,这也就是为什么我们能够利用cdn进行加速的原因.而且像js这样的文件,如果里面是一个自执行的代码,比如: ...
JAVA进阶4
间歇性混吃等死,持续性踌躇满志系列-------------第4天 1.静态内部类求极值 class MaxMin{ public static class Result{ //表示最大值.最小值 p ...
vivado中使用MMCM ip核
1.在project中选择IP Catalog 在IP Catalog中选择FPGA Features and Design----->Clocking------>Clocking Wi ...

Spark缓存策略

Spark缓存策略的更多相关文章

随机推荐

热门专题