SparkSQL
卡其色的夏日
大数据爱好者
展开
-
2.大数据技术之_第三章到第五章:SparkSQL数据源
第3章 SparkSQL数据源 3.1 通用加载/保存方法 3.1.1 手动指定选项 Spark SQL的DataFrame接口支持多种数据源的操作。一个DataFrame可以进行RDDs方式的操作,也可以被注册为临时表。把DataFrame注册为临时表之后,就可以对该DataFrame执行SQL查询。 Spark SQL的默认数据源为Parquet格式。数据源为Parquet文件时,Spark SQL可以方便的执行所有的操作。修改配置项spark.sql.sources.default,可修改默认原创 2020-08-19 13:23:59 · 327 阅读 · 0 评论 -
1.大数据技术之SparkSQL_SparkSQL基础和SparkSQL编程
第1章 Spark SQL概述 1什么是Spark SQL Spark SQL是Spark用来处理结构化数据的一个模块,它提供了2个编程抽象:DataFrame和 DataSet,并且作为分布式SQL查询引擎的作用。 我们已经学习了Hive,它是将Hive SQL转换成MapReduce然后提交到集群上执行,大大简化了编写MapReduc的程序的复杂性,由于MapReduce这种计算模型执行效率比较慢。所有Spark SQL的应运而生,它是将Spark SQL转换成RDD,然后提交到集群执行,执行效.原创 2020-08-19 13:21:51 · 414 阅读 · 0 评论