- 博客(3)
- 问答 (1)
- 收藏
- 关注
原创 对Spark中shuffle机制的浅谈
Shuffle,洗牌、搅乱的意思。顾名思义就是把有规则或者有顺序的东西,打乱。打过扑克和麻将的童鞋们会有切身的体验。而在Spark中,Shuffle的过程正好相反,它是将一组无规则的数据,变成一个有规则的数据的一个过程。因为Spark是一个并行分布式的计算框架,数据是按照Key进行分区的,一块块的分区分散在集群中的各个节点上,并不是所有的计算算子都满足于按照一种方式分区进行计算。例如,当需要对数据
2015-01-13 21:35:52 1150
原创 Checkpoint
应用的场景1)DAG中Lineage过长,如果要重新计算的,则开销会很大(如在PageRank中)。2)在Shuffle Dependency上采用Lineage的话,由于子RDD分区中的一个分区可能依赖于父RDD的中所有分区,所以需要对父RDD中的每个区进行计算,因为在子RDD中有可能其它分区也依赖于父RDD中的多个分区,这样就会造成很大的冗余计算开销。传统方式在RDD计算中,通
2015-01-13 20:32:52 821
原创 RDD与DSM的区别
RDD(Resilient Distributed DataSet)弹性分布式数据集,是Spark的核心数据结构。DSM(Distributed Shared Memory)分布式共享内存,它是一种通用的内存数据抽象。在DSM中,应用可以向全局地址空间的任意位置进行读写操作。RDD与DSM主要区别在于,不仅可以通过批量转换创建(即“写”)RDD,还可以对任意内存位置对写。RDD限制应用执行
2015-01-05 10:38:55 1537
空空如也
eclipse下使用hibernate tools实现hibernate逆向工程
2015-04-05
TA创建的收藏夹 TA关注的收藏夹
TA关注的人