Spark Boradcast原理

Broadcast简介

Spark提供的广播变量可以解决闭包函数引用外部大变量引起的性能问题。Spark使用高效的广播算法分发广播变量,以降低通信成本。广播变量会以只读形式缓存在每个机器的本地,可以使用它们以高效的方式为每个节点提供大型输入数据集的副本

广播变量的一个最重要的特点就是,在同一个执行器上的所有任务都可以共享此Broadcast,而不是每个任务使用一个变量副本。

广播变量是从一个不可变变量val v,通过调用SparkContext.broadcast(v)方法创建得到。广播变量是变量v的一个包装器,其值可以通过调用value方法得到。

scala> val broadcastVar = sc.broadcast(Array(1,2,3,4))
broadcastVar: org.apache.spark.broadcast.Broadcast[Array[Int]] = Broadcast(2
  • 1
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值