Spark-Task not serializable错误解析

2018年05月17日 15:33:03 沙拉控阅读数：1509

在学习SparkStreaming的时候偶然出现的一个问题，先看下面一段代码：

import org.apache.log4j.{Level, Logger}

import org.apache.spark.streaming.{Seconds, StreamingContext}

import org.apache.spark.{SparkConf, SparkContext}

/**

  * Created by Administrator on 2017/11/6.

  */

object ForEachTest {

   val checkpointDirectory="hdfs://hadoop1:9000/streamingchekpoint4"

  def functionToCreateContext(): StreamingContext = {

    //程序入口

    val conf = new  SparkConf().setMaster("local[2]").setAppName(s"${this.getClass.getSimpleName}")

    val sc = new SparkContext(conf)

    sc.setLogLevel("ERROR")

    val ssc = new StreamingContext(sc,Seconds(1))

    //数据的输入

    val dStream = ssc.socketTextStream("192.168.32.10",9999)

    //数据的处理

    val resultDStream = dStream.flatMap(_.split(","))

      .map((_, 1))

      .updateStateByKey((values: Seq[Int], valuesState: Option[Int]) => {

        val currentCount = values.sum

        val lastCount = valuesState.getOrElse(0)

        Some(currentCount + lastCount)

      })

    //程序的输出

    resultDStream.foreachRDD( rdd  =>{

      //Driver

        val jdbcCoon = MysqlPool.getJdbcCoon()

        val statement = jdbcCoon.createStatement()

      rdd.foreachPartition( partition  =>{

        //Executor

        partition.foreach( recored  =>{

          //Executor

           val word = recored._1

           val count = recored._2

          val sql=s"insert into  aura.1706wordcount values(now(),'${word}',${count})"

          statement.execute(sql)

        })

        MysqlPool.releaseConn(jdbcCoon)

      })

    })

    //设置检查点

    ssc.checkpoint(checkpointDirectory)

    ssc

  }

  def main(args: Array[String]): Unit = {

    val ssc = StreamingContext.getOrCreate(checkpointDirectory, functionToCreateContext _)

    //启动程序

    ssc.start()

    ssc.awaitTermination()

  }

}

这段代码是一个SparkStraming与mysql交互的Demo，用到了foreachRDD算子，mysql连接池的代码这里先省略，因为不是重点，会在另一片专门写SparkStreaming的博客中给出。这段代码看似没有问题，但是运行报错：

org.apache.spark.SparkException: Task not serializable

Caused by: java.io.NotSerializableException: java.lang.Object

表示任务没有被序列化，那么这个序列化到底是指哪里呢？通过查阅官网，发现在介绍foreachRDD的时候有过这么一个介绍：

dstream.foreachRDD { rdd =>

  val connection = createNewConnection()  // executed at the driver

  rdd.foreach { record =>

    connection.send(record) // executed at the worker

  }

}

这个说明foreachRDD是在driver端执行的，而foreach是在worker端执行的。我们知道我们在提交代码的时候，提交这个动作是在driver端执行的，提交的这台服务器就是driver，那么哪些代码是在drvier端执行的呢？

    val conf = new SparkConf()

    conf.setAppName(s"${this.getClass.getSimpleName}").setMaster("local[2]")

    val sc = new SparkContext(conf)

    val ssc: StreamingContext = new StreamingContext(sc, Seconds(1))

以上的这些初始化的代码和：textfile、foreachRDD都是在driver端执行的；

而map、flatmap、reduceByKey、foreach、foreachPartition...这类算子都是在worker端执行的。

从driver到worker是要先序列化再可以传输的，所以你如果要在foreachRDD里面写代码，如果没有经过序列化，就会报错。那么怎么解决呢？

1、让它序列化啊

2、如果这个对象不支持序列化，那就不要写在foreachRDD里面啊

所以，原文的这段代码应该修改为：

    resultDStream.foreachRDD( rdd  =>{

      //Driver

      rdd.foreachPartition( partition  =>{

        //Executor

        val jdbcCoon = MysqlPool.getJdbcCoon()

        val statement = jdbcCoon.createStatement()

        partition.foreach( recored  =>{

          //Executor

           val word = recored._1

           val count = recored._2

          val sql=s"insert into  aura.1706wordcount values(now(),'${word}',${count})"

          statement.execute(sql)

        })

        MysqlPool.releaseConn(jdbcCoon)

      })

    })

[转载]Spark-Task not serializable错误解析的更多相关文章

Redis on Spark:Task not serializable
We use Redis on Spark to cache our key-value pairs.This is the code: import com.redis.RedisClient va ...
spark出现task不能序列化错误的解决方法 org.apache.spark.SparkException: Task not serializable
import org.elasticsearch.cluster.routing.Murmur3HashFunction; import org.elasticsearch.common.math.M ...
spark出现task不能序列化错误的解决方法
应用场景:使用JavaHiveContext执行SQL之后,希望能得到其字段名及相应的值,但却出现"Caused by: java.io.NotSerializableException: ...
Spark运行程序异常信息： org.apache.spark.SparkException: Task not serializable 解决办法
错误信息: 17/05/20 18:51:39 ERROR JobScheduler: Error running job streaming job 1495277499000 ms.0 org.a ...
spark2.1注册内部函数spark.udf.register("xx", xxx _)，运行时抛出异常：Task not serializable
函数代码: class MySparkJob{ def entry(spark:SparkSession):Unit={ def getInnerRsrp(outer_rsrp: Double, we ...
Spark程序运行常见错误解决方法以及优化
转载自:http://bigdata.51cto.com/art/201704/536499.htm Spark程序运行常见错误解决方法以及优化 task倾斜原因比较多,网络io,cpu,mem都有可 ...
Kafka：ZK+Kafka+Spark Streaming集群环境搭建（二十九）：推送avro格式数据到topic，并使用spark structured streaming接收topic解析avro数据
推送avro格式数据到topic 源代码:https://github.com/Neuw84/structured-streaming-avro-demo/blob/master/src/main/j ...
再提供一种解决Nginx文件类型错误解析漏洞的方法
[文章作者:张宴本文版本:v1.2 最后修改:2010.05.24 转载请注明原文链接:http://blog.zyan.cc/nginx_0day/] 注:2010年5月23日14:00前阅读本文 ...
【原创】大叔问题定位分享（19）spark task在executors上分布不均
最近提交一个spark应用之后发现执行非常慢,点开spark web ui之后发现卡在一个job的一个stage上,这个stage有100000个task,但是绝大部分task都分配到两个execut ...

随机推荐

Pandas导入导出&pickle文件模块
Pandas可以读取与存储的文件格式有很多像csv,excel,json,html等,详细请看官方文档https://pandas.pydata.org/pandas-docs/stable/use ...
大数据之Zookeeper概述
Zookeeper概述 Zookeeper是一个开放源码的分布式应用程序协调服务,是 Google的Chubby一个开源的实现,是 Hadoop和 HBASE的重要组件.主要解决分布式应用一致性问题. ...
web／服务器知识
一 PV 推到出 QPS 你想建设一个能承受500万PV/每天的网站吗? 500万PV是什么概念?服务器每秒要处理多少个请求才能应对?如果计算呢?? PV是什么:PV是page view的简写.PV是 ...
GitHub 将源代码保存在北极洞穴，至少使用 1000 年！
最近,GitHub分享了开放Arctic Code Vault的计划,该计划旨在存储和保存Flutter和TensorFlow等开源软件. 所有开放源代码项目的代码都将存储在胶片上,该胶片每帧包含88 ...
Nginx安装SSL证书，开启HTTPS加密
效果就是访问博客的时候出现一把小绿锁,更加安(好)全(看). 实现步骤如下: 申请SSL证书阿里云可以申请一年的免费证书,下载到本地上传证书到服务器 scp [文件名] root@[ip地址]:/ ...
第十三章字符串（四）之Scanner类
一.Scanner简述 Scanner扫描器类本质上是由正则表达式实现的,可以接受任何能产生数据的数据源对象,默认以空白符进行分词(包括\n等),使用各种next方法进行扫描匹配,获取匹配的数据. 二 ...
@click.prevent.self和@click.self.prevent区别
注意:prevent 阻止的是“跳转事件”而不是“弹出警告” v-on:click.prevent.self的demo如下: <div id="box"> <di ...
linux node 安装
百度搜索出来的按照方式都是下载linux的解压包后,解压出可执行文件然后创建软连接, 我试了一下不知为何node可以创建软连接,但是npm 创建软连接执行不了还是使用官方的安装方式成功了 https ...
Spring Boot源码分析-配置文件加载原理
在Spring Boot源码分析-启动过程中我们进行了启动源码的分析,大致了解了整个Spring Boot的启动过程,具体细节这里不再赘述,感兴趣的同学可以自行阅读.今天让我们继续阅读源码,了解配置文 ...
CentOS 7安装Maven
echo "安装Java环境,先安装JDK" yum -y install java-openjdk echo "切换到/usr/local/src下载目录" ...

[转载]Spark-Task not serializable错误解析

Spark-Task not serializable错误解析

[转载]Spark-Task not serializable错误解析的更多相关文章

随机推荐

热门专题