SparkSQL编程——DataSet(3)
一、DataSet
- Dataset 是 Dataframe API的一个扩展,是Spark最新的数据抽象。Dataset是类型安全的结构化API,用于在Java和Scala中编写静态类型的代码。Dataset API在Python和R中不可用,因为这些语言是动态类型的。
- Dataframe是Dataset的特列,DataFrame=Dataset[Row] ,所以可以通过as方法将Dataframe转换为Dataset。Row是一个类型,跟Car、Person这些的类型一样,所有的表结构信息我都用Row来表示。DataSet是强类型的。比如可以有 Dataset[Car],Dataset[Person].
- DataFrame只是知道字段,但是不知道字段的类型,所以在执行这些操作的时候是没办法在编译的时候检查是否类型失败的,比如你可以对一个String进行减法操作,在执行的时候才报错,而DataSet不仅仅知道字段,而且知道字段类型,所以有更严格的错误检查。就跟JSON对象和类对象之间的类比。
- 通常样例类被用来在Dataset中定义数据的结构信息,样例类中每个属性的名称直接映射到DataSet中的字段名称。
二、何时使用DataSet
- DataFrame 的Row类型是Spark内部已经优化的类型,且在各种语言都能使用。当使用Dataset API 时,将Spark Row格式的每一行转换为指定的特定领域类型的对象(case类或 Java 类),此转换会有性能的下降。你可能会想,如果在使用Dataset时损失性能,那为什么我们还要使用它们呢?有下面几个主要原因:
- ①当你要执行的操作无法使用DataFrame操作表示时。
- ②如果需要类型安全,并且愿意牺牲一定性能来实现它。
- 最常用的应用场景可能是先用DataFrame和再用Dataset,这可以手动在性能和类型安全之间进行权衡。这在有些情况时是很有用的,比如当基于DataFrame执行的提取、转换和加载 (ETL) 转换作业之后,想将数据送入驱动器并使用单机库操作时,或者是当需要在Spark SQL 中执行过滤和进一步操作之前,进行每行分析的预处理转换操作的时候。
三、创建DataSet
- 创建DataSet最最常用的两种方法: 从RDD创建DataSet 和 从DataFrame转换。两种方式都需要使用样例类,方便类型转换。
1.从RDD创建DataSet
- 首先回顾下使用case class 创建的DataFrame。
import spark.implicits._ case class People(name: String, age: Int) val peopleRDD = sc.textFile("/Users/xxx/opt/module/spark/examples/src/main/resources/people.json") peopleRDD.map{ x => val para = x.split(" ") (para(0),para(1).trim.toInt) }.toDF
- DataSet的创建一般也使用case class,Dataframe是Dataset的特列,DataFrame=Dataset[Row]
import spark.implicits._ case class People(name: String, age: Int) val peopleRDD =sc.textFile("/Users/xxx/opt/module/spark/examples/src/main/resources/people.json") peopleRDD.map{ x => val para = x.split(" ") People(para(0),para(1).trim.toInt) }.toDS
可以看出DataSet创建方式和DataFrame类似,区别就是DataFrame是Row类型的,而DataSet可以是其他类型的。
2.从DataFrame转换DataSet
- 从DataFrame转换DataSet比较简单,需要,我们使用
as
方法将其强制转换为指定的行类型,例如:
df.as[People] // df 是一个DataFrame,People 是指定的类型
四、DataSet的操作
- Dataset和DataFrame拥有完全相同的成员函数,Dataset上的转换/行动操作与DataFrame相同,区别只是每一行的数据类型不同。
五、RDD、DataFrame和DateSet
1.三者共性
- 1、RDD、DataFrame、Dataset全都是spark平台下的分布式弹性数据集,为处理超大型数据提供便利
- 2、三者都有惰性机制,在进行创建、转换,如map方法时,不会立即执行,只有在遇到Action如foreach时,三者才会开始遍历运算。
- 3、三者都会根据spark的内存情况自动缓存运算,这样即使数据量很大,也不用担心会内存溢出。
- 4、三者都有partition的概念
- 5、三者有许多共同的函数,如filter,排序等
- 6、在对DataFrame和Dataset进行操作许多操作都需要这个包进行支持
import spark.implicits._
- 7、DataFrame和Dataset均可使用模式匹配获取各个字段的值和类型
2.三者区别
-
1、RDD:RDD一般和spark mlib同时使用,不支持sparksql操作
-
2、DataFrame:
- 与RDD和Dataset不同,DataFrame每一行的类型固定为Row,每一列的值没法直接访问,只有通过getAS方法解析或者模式匹配才能获取各个字段的值。
- DataFrame与Dataset一般不与spark mlib同时使用
- DataFrame与Dataset均支持sparksql的操作,比如select,groupby之类,还能注册临时表/视窗,进行sql语句操作。
- DataFrame与Dataset支持一些特别方便的保存方式,比如保存成csv,可以带上表头,这样每一列的字段名一目了然
-
3、Dataset:
- Dataset和DataFrame拥有完全相同的成员函数,区别只是每一行的数据类型不同。
- DataFrame也可以叫Dataset[Row],每一行的类型是Row,不解析,每一行究竟有哪些字段,各个字段又是什么类型都无从得知,而Dataset中,每一行是什么类型是不一定的,在自定义了case class之后可以很自由的获得每一行的信息。