2015年11月_heayin123

12月 11月 10月 09月 07月 06月 05月 03月 02月 01月

原创 spark RDD系列------2.HadoopRDD分区的创建以及计算

Spark经常需要从hdfs读取文件生成RDD，然后进行计算分析。这种从hdfs读取文件生成的RDD就是HadoopRDD。那么HadoopRDD的分区是怎么计算出来的？如果从hdfs读取的文件非常大，如何高效的从hdfs加载文件生成HadoopRDD呢？本篇文章探讨这两个问题。 SparkContext.objectFile方法经常用于从hdfs加载文件，从加载hdfs文件到生成Had

2015-11-26 14:21:51 6828 1

原创 Spark RDD系列-------1. 决定Spark RDD分区算法因素的总结

RDD在调用引起Shuffle的方法的时候，如果没有显示指定ShuffledRDD的分区，那么会调用Partitioner.defaultPartitioner方法来确定ShuffledRDD的分区，比如RDD.combineByKey:def combineByKey[C](createCombiner: V => C, mergeValue: (C, V) => C, mergeCombi

2015-11-25 17:51:46 4384

原创 java nio原理和它的优点

要想讲清楚nio的原理和它的优点得先清楚Java应用程序的文件读写原理和虚拟内存的原理。Java文件读取原理可参见如下图：当应用程序需要读取文件的时候，内核首先通过DMA技术将文件内容从磁盘读入内核中的buffer，然后Java应用进程再从内核的buffer将数据读取到应用程序的buffer。为了提升I/O效率和处理能力，操作系统采用虚拟内存的机制。虚拟内存也就是我们常说的交换内存

2015-11-06 15:20:14 16450 1

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人