2015年01月_二楼后座的香蕉园

12月 11月 06月 04月 03月 01月

原创对Spark中shuffle机制的浅谈

Shuffle，洗牌、搅乱的意思。顾名思义就是把有规则或者有顺序的东西，打乱。打过扑克和麻将的童鞋们会有切身的体验。而在Spark中，Shuffle的过程正好相反，它是将一组无规则的数据，变成一个有规则的数据的一个过程。因为Spark是一个并行分布式的计算框架，数据是按照Key进行分区的，一块块的分区分散在集群中的各个节点上，并不是所有的计算算子都满足于按照一种方式分区进行计算。例如，当需要对数据

2015-01-13 21:35:52 1150

原创 Checkpoint

应用的场景1）DAG中Lineage过长，如果要重新计算的，则开销会很大（如在PageRank中）。2）在Shuffle Dependency上采用Lineage的话，由于子RDD分区中的一个分区可能依赖于父RDD的中所有分区，所以需要对父RDD中的每个区进行计算，因为在子RDD中有可能其它分区也依赖于父RDD中的多个分区，这样就会造成很大的冗余计算开销。传统方式在RDD计算中，通

2015-01-13 20:32:52 821

原创 RDD与DSM的区别

RDD（Resilient Distributed DataSet)弹性分布式数据集，是Spark的核心数据结构。DSM（Distributed Shared Memory）分布式共享内存，它是一种通用的内存数据抽象。在DSM中，应用可以向全局地址空间的任意位置进行读写操作。RDD与DSM主要区别在于，不仅可以通过批量转换创建（即“写”）RDD，还可以对任意内存位置对写。RDD限制应用执行

2015-01-05 10:38:55 1537

空空如也

eclipse下使用hibernate tools实现hibernate逆向工程

2015-04-05

TA创建的收藏夹 TA关注的收藏夹