Spark SQL结构化数据文件处理

Xiaozou_Q

已于 2024-05-16 11:14:36 修改

阅读量910

点赞数 17

文章标签： spark sql 大数据

于 2024-05-16 11:14:06 首次发布

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/Xiaozou_Q/article/details/138952023

版权

目录

一，Spark SQL概述

1，Spark SQL简介

2，Spark SQL架构

二，DataFrame概述

1，DataFrame简介

2，DataFrame的创建

（1）数据准备

（2）通过文件直接创建DataFrame

（3）RDD直接转换为DataFrame

3，DataFrame的常用操作

（1）DSL风格操作

三，Dataset概述

1，RDD、DataFrame及Dataset的区别

（1）通过SparkSession中的createDataset来创建Dataset

（2）DataFrame通过“as[ElementType]”方法转换得到Dataset

四， RDD转换DataFrame

一，Spark SQL概述

1，Spark SQL简介

Spark SQL是Spark用来处理结构化数据的一个模块，它提供了一个编程抽象结构叫做DataFrame的数据模型（即带有Schema信息的RDD），Spark SQL作为分布式SQL查询引擎，让用户可以通过SQL、DataFrames API和Datasets API三种方式实现对结构化数据的处理。

2，Spark SQL架构

Spark SQL架构与Hive架构相比，把底层的MapReduce执行引擎更改为Spark，还修改了Catalyst优化器，Spark SQL快速的计算效率得益于Catalyst优化器。从HiveQL被解析成语法抽象树起，执行计划生成和优化的工作全部交给Spark SQL的Catalyst优化器进行负责和管理。

二，DataFrame概述

1，DataFrame简介

最低0.47元/天解锁文章

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。