Spark的DataFrame创建实例

最新推荐文章于 2024-07-07 07:15:00 发布

lds_include

最新推荐文章于 2024-07-07 07:15:00 发布

阅读量313

点赞数 1

分类专栏：大数据 Spark 文章标签： Spark的DataFrame创建实例大数据的SparkSQL 大数据

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/lds_include/article/details/89300074

版权

大数据同时被 2 个专栏收录

70 篇文章 4 订阅

订阅专栏

21 篇文章 0 订阅

订阅专栏

Spark的DataFrame创建实例

说明

是一个分布式数据集（是一个数据描述），封装了RDD和Schema信息，底层还是调用的RDD，我们可以像操作二维表的方式进行操作，简单来说，DataFream就是RDD和Schema信息的结合体

什么是DataFrames

与RDD类似，DataFrame也是一个分布式数据容器。然而DataFrame更像传统数据库的二维表格，除了数据以外，还记录数据的结构信息，即schema。同时，与Hive类似，DataFrame也支持嵌套数据类型（struct、array和map）。从API易用性的角度上看，DataFrame API提供的是一套高层的关系操作，比函数式的RDD API要更加友好，门槛更低。由于与R和Pandas的DataFrame类似，Spark DataFrame很好地继承了传统单机数据分析的开发体验。

创建一个DataFrames

创建文件

在本地创建一个文件，有三列，分别是id、name、age，用空格分隔，然后上传到hdfs上

hdfs dfs -put person.txt/

生成RDD

在spark shell执行下面命令，读取数据，将每一行的数据使用列分隔符分割

val lineRDD = sc.textFile("hdfs://min1:9000/person.txt").map(_.split(" "))

定义匹配类

定义case class（相当于表的schema）

case class Person(id:Int, name:String, age:Int)

关联数据

将RDD和case class关联

val personRDD = lineRDD.map(x => Person(x(0).toInt, x(1), x(2).toInt))

生成DataFrame

将RDD转换成DataFrame

val personDF = personRDD.toDF

显示

对DataFrame进行处理

personDF.show

在这里插入图片描述

关注

1
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。