Spark运行程序异常信息： org.apache.spark.SparkException: Task not serializable 解决办法

最新推荐文章于 2024-06-18 19:33:35 发布

junzhou134

最新推荐文章于 2024-06-18 19:33:35 发布

阅读量3.2k

点赞数

分类专栏： spark 文章标签： Spark 错误信息Task not s

本文链接：https://blog.csdn.net/m0_37138008/article/details/72583655

版权

spark 专栏收录该内容

8 篇文章 0 订阅

订阅专栏

错误信息：

17/05/20 18:51:39 ERROR JobScheduler: Error running job streaming job 1495277499000 ms.0
org.apache.spark.SparkException: Task not serializable
	at org.apache.spark.util.ClosureCleaner$.ensureSerializable(ClosureCleaner.scala:298)
	at org.apache.spark.util.ClosureCleaner$.org$apache$spark$util$ClosureCleaner$$clean(ClosureCleaner.scala:288)
	at org.apache.spark.util.ClosureCleaner$.clean(ClosureCleaner.scala:108)

问题原因：再对RDD进行操作时引用了类的成员变量而该成员变量无法被序列化所导致的

例如如下代码：

object Test2 extends App{
   val conf = new SparkConf().setAppName("RVM").setMaster("local")
   val sc = new SparkContext(conf)
   val matrix = new DenseMatrix(2,2,Array(1.0,2,3,4))
   new Test(sc,matrix).run()

}

class Test(scc:SparkContext,PHI:DenseMatrix) extends Serializable{
   val ts = 0.1
   def run(): Unit ={
      val rdds = scc.parallelize(0 to 3)
      val a = rdds.map(
         x =>{
            PHI.toArray.apply(x)*x
         }
      )
      a.collect.foreach(println(_))
   }
}

这一段代码运行确实会报错，而且报错如预期一样，最开始以为是因为DenseMatrix不能序列化导致的，结果将DenseMatrix换成了其它类型如Double等基本类型同样会报错，然后发现是scc(SparkContext)不能序列化导致的错误。

解决办法是在不能序列化的变量前添加注释@transient告诉编译器该变量不需要进行序列化。网上还有其它的一些处理方法暂时未深入研究，

如果还是没有得到解决：

可以试下如下方法：

出现“org.apache.spark.SparkException: Task not serializable"这个错误，一般是因为在map、filter等的参数使用了外部的变量，但是这个变量不能序列化。特别是当引用了某个类（经常是当前类）的成员函数或变量时，会导致这个类的所有成员（整个类）都需要支持序列化。解决这个问题最常用的方法有：