- 博客(2)
- 收藏
- 关注
原创 dataframe与RDD之间具体转化
import org.apache.spark.sql.Row import org.apache.spark.sql.types._ import scala.collection.mutable import org.apache.spark.sql.SparkSession object sqlTest { def main(args: Array[String]) { ...
2019-09-19 17:47:48 160
原创 dataframe与RDD
RDD是分布式的 Java对象的集合,比如,RDD[Person]是以Person为类型参数,但是,Person类的内部结构对于RDD而言却是不可知的。 DataFrame是一种以RDD为基础的分布式数据集,也就是分布式的Row对象的集合(每个Row对象代表一行记录),提供了详细的结构信息,也就是我们经常说的模式(schema),Spark SQL可以清楚地知道该数据集中包含哪些列、每列的名称和...
2019-07-24 16:44:56 420
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人