RDD创建操作
1)从集合创建RDD
parallelize
makeRDD
2)从外部存储创建RDD
textFile
从hdfs文件创建
从本地文件创建
从其他HDFS文件格式创建
hadoopFile
sequenceFile
objectFile
newAPIHadoopFile
从Hadoop接口API创建
hadoopRDD
newAPIHadoopRDD
比如:从HBase创建RDD
RDD基本转换操作:
1)map、flatMap、distinct
2)coalesce、repartition
3)randomSplit、glom
4)union、intersection、subtract
5)mapPartitions、mapPartitionsWithIndex
6)zip、zipPartitions
7)zipWithIndex、zipWithUniqeId
RDD键值转换操作
1)partitionBy、mapValues、flatMapValues
2)combineBy、foldByKey
3)groupByKey、reduceByKey、reduceByKeyLocally
4)cogroup、join
5)leftOuterJoin、rightOuterJoin、subtractByKey
RDD行动Action操作
1)first、count、reduce、collect
2)take、top、takeOrdered
3)aggregate、fold、lookup
4)countByKey、foreach、foreachPartition、sortBy
5)saveAsHadoopFile、saveAsHadoopDataset
6)saveAsTextFile、saveAsSequenceFile、saveeAsObjectFile
7)saveAsNewAPIHadoopFile、saveAsNewAPIHadoopDataset
参考大神文章:http://lxw1234.com/archives/tag/spark%E7%AE%97%E5%AD%90