Spark的数据读取及数据保存可以从两个维度来作区分:文件格式以及文件系统。
文件格式分为:Text文件、Sequence文件以及Object文件;
文件系统分为:本地文件系统、HDFS以及数据库。
1.Text文件
2.Sequence文件
SequenceFile文件是Hadoop用来存储二进制形式的key-value对而设计的一种平面文件(Flat File)。在SparkContext中,可以调用sequenceFile[keyClass, valueClass](path)。
3.Object对象文件
对象文件是将