Spark 广播变量：SparkContext.broadcast定义及使用注意事项

最新推荐文章于 2024-06-04 18:25:35 发布

nnnancyyy

最新推荐文章于 2024-06-04 18:25:35 发布

阅读量3.8k

点赞数 4

文章标签： spark 大数据 scala hdfs

本文链接：https://blog.csdn.net/weixin_42155006/article/details/118517464

版权

今天来讨论一下spark里面的闭包问题，当用户提交了一个用scala语言写的Spark程序，首先这个Spark程序就是一个“Application”，程序里面的mian函数就是“Driver Program”，dirver程序的可能运行在客户端，也有可有可能运行在spark集群中，这取决于spark作业提交时参数的选定，比如，yarn-client和yarn-cluster就是分别运行在客户端和spark集群中。在driver程序中会有RDD对象的相关代码操作，它们是在Worker节点上面运行的，所以spark会透明地帮用户把这些涉及到RDD操作的代码传给相应的worker节点。

如果在RDD map函数中调用了在函数外部定义的对象，因为这些对象需要通过网络从driver所在节点传给其他的worker节点，所以要求这些类是可序列化的，比如在Java或者scala中实现Serializable类，除了java这种序列化机制，还可以选择其他方式，使得序列化工作更加高效。

使用场景

worker节点接收到程序之后，在spark资源管理器的指挥下运行RDD程序。

在worker节点上所运行的RDD中代码的变量是保存在worker节点上面的，在spark编程中，很多时候用户需要在driver程序中进行相关数据操作之后把该数据传给RDD对象的方法以做进一步处理，这时候，spark框架会自动帮用户把这些数据通过网络传给相应的worker节点。

除了这种以变量的形式定义传输数据到worker节点之外，Spark两种共享变量：广播变量（broadcast variable）与累加器（accumulator）。其中累加器用来对信息进行聚合，而广播变量用来高效分发较大的对象。

最低0.47元/天解锁文章

nnnancyyy

关注

4
点赞
踩
6

收藏

觉得还不错? 一键收藏
2
评论
Spark 广播变量：SparkContext.broadcast定义及使用注意事项

今天来讨论一下spark里面的闭包问题，当用户提交了一个用scala语言写的Spark程序，首先这个Spark程序就是一个“Application”，程序里面的mian函数就是“Driver Program”，dirver程序的可能运行在客户端，也有可有可能运行在spark集群中，这取决于spark作业提交时参数的选定，比如，yarn-client和yarn-cluster就是分别运行在客户端和spark集群中。在driver程序中会有RDD对象的相关代码操作，它们是在Worker节点上面运行的，所以spa
复制链接

扫一扫