【Spark】Spark Dataframe 常用操作（一行数据映射为多行）_spark 一行变多行

最新推荐文章于 2024-07-07 12:05:15 发布

2401_84183726

最新推荐文章于 2024-07-07 12:05:15 发布

阅读量452

点赞数 10

分类专栏：程序员文章标签：大数据面试学习

本文链接：https://blog.csdn.net/2401_84183726/article/details/138877235

版权

程序员专栏收录该内容

120 篇文章 0 订阅

订阅专栏

既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，涵盖了95%以上大数据知识点，真正体系化！

由于文件比较多，这里只是将部分目录截图出来，全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频，并且后续会持续更新

需要这份系统化资料的朋友，可以戳这里获取

spark dataframe派生于RDD类，但是提供了非常强大的数据操作功能。当然主要对类SQL的支持。

在实际工作中会遇到这样的情况，主要是会进行两个数据集的筛选、合并，重新入库。

首先加载数据集，然后在提取数据集的前几行过程中，才找到limit的函数。

而合并就用到union函数，重新入库，就是registerTemple注册成表，再进行写入到HIVE中。

不得不赞叹dataframe的强大。

具体示例：对文件中某一列的空值进行统计过滤，并实现一行数据映射为多行

scala> uf.filter(col("friends").isNotNull).select(col("user"),col("friends")).show(3)
+----------+--------------------+
|      user|             friends|
+----------+--------------------+
|3197468391|1346449342 387324...|
|3537982273|1491560444 395798...|
| 823183725|1484954627 195038...|
+----------+--------------------+
only showing top 3 rows


scala> uf.filter(col("friends").isNotNull).select(col("user"),col("friends")).withColumn("friends",explode(split(col("friends")," "))).show(5)
+----------+----------+
|      user|   friends|
+----------+----------+
|3197468391|1346449342|
|3197468391|3873244116|
|3197468391|4226080662|
|3197468391|1222907620|
|3197468391| 547730952|
+----------+----------+
only showing top 5 rows

最后附上dataframe的一些操作及用法：

DataFrame 的函数
Action 操作
1、 collect() ,返回值是一个数组，返回dataframe集合所有的行
2、 collectAsList() 返回值是一个java类型的数组，返回dataframe集合所有的行
3、 count() 返回一个number类型的，返回dataframe集合的行数
4、 describe(cols: String*) 返回一个通过数学计算的类表值(count, mean, stddev, min, and max)，这个可以传多个参数，中间用逗号分隔，如果有字段为空，那么不参与运算，只这对数值类型的字段。例如df.describe(“age”, “height”).show()
5、 first() 返回第一行，类型是row类型
6、 head() 返回第一行，类型是row类型
7、 head(n:Int)返回n行，类型是row 类型
8、 show()返回dataframe集合的值默认是20行，返回类型是unit
9、 show(n:Int)返回n行，，返回值类型是unit
10、 table(n:Int) 返回n行，类型是row 类型

dataframe的基本操作
1、 cache()同步数据的内存
2、 columns 返回一个string类型的数组，返回值是所有列的名字
3、 dtypes返回一个string类型的二维数组，返回值是所有列的名字以及类型
4、 explan()打印执行计划物理的
5、 explain(n:Boolean) 输入值为 false 或者true ，返回值是unit 默认是false ，如果输入true 将会打印逻辑的和物理的
6、 isLocal 返回值是Boolean类型，如果允许模式是local返回true 否则返回false

既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，涵盖了95%以上大数据知识点，真正体系化！

由于文件比较多，这里只是将部分目录截图出来，全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频，并且后续会持续更新

需要这份系统化资料的朋友，可以戳这里获取

义、实战项目、大纲路线、讲解视频，并且后续会持续更新**

需要这份系统化资料的朋友，可以戳这里获取

2401_84183726

关注

10
点赞
踩
8

收藏

觉得还不错? 一键收藏
0
评论
【Spark】Spark Dataframe 常用操作（一行数据映射为多行）_spark 一行变多行

4、 describe(cols: String*) 返回一个通过数学计算的类表值(count, mean, stddev, min, and max)，这个可以传多个参数，中间用逗号分隔，如果有字段为空，那么不参与运算，只这对数值类型的字段。5、 explain(n:Boolean) 输入值为 false 或者true ，返回值是unit 默认是false ，如果输入true 将会打印逻辑的和物理的。8、 show()返回dataframe集合的值默认是20行，返回类型是unit。
复制链接

扫一扫