【Spark】Spark Dataframe 常用操作（一行数据映射为多行）_spark 一行变多行(2)

2401_84181731

于 2024-05-06 19:27:19 发布

阅读量829

点赞数 12

分类专栏：程序员文章标签： spark 大数据分布式

本文链接：https://blog.csdn.net/2401_84181731/article/details/138505487

版权

程序员专栏收录该内容

153 篇文章 0 订阅

订阅专栏

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化资料的朋友，可以戳这里获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

首先加载数据集，然后在提取数据集的前几行过程中，才找到limit的函数。

而合并就用到union函数，重新入库，就是registerTemple注册成表，再进行写入到HIVE中。

不得不赞叹dataframe的强大。

具体示例：对文件中某一列的空值进行统计过滤，并实现一行数据映射为多行

scala> uf.filter(col("friends").isNotNull).select(col("user"),col("friends")).show(3)
+----------+--------------------+
|      user|             friends|
+----------+--------------------+
|3197468391|1346449342 387324...|
|3537982273|1491560444 395798...|
| 823183725|1484954627 195038...|
+----------+--------------------+
only showing top 3 rows


scala> uf.filter(col("friends").isNotNull).select(col("user"),col("friends")).withColumn("friends",explode(split(col("friends")," "))).show(5)
+----------+----------+
|      user|   friends|
+----------+----------+
|3197468391|1346449342|
|3197468391|3873244116|
|3197468391|4226080662|
|3197468391|1222907620|
|3197468391| 547730952|
+----------+----------+
only showing top 5 rows

最后附上dataframe的一些操作及用法：

DataFrame 的函数
Action 操作
1、 collect() ,返回值是一个数组，返回dataframe集合所有的行
2、 collectAsList() 返回值是一个java类型的数组，返回dataframe集合所有的行
3、 count() 返回一个number类型的，返回dataframe集合的行数
4、 describe(cols: String*) 返回一个通过数学计算的类表值(count, mean, stddev, min, and max)，这个可以传多个参数，中间用逗号分隔，如果有字段为空，那么不参与运算，只这对数值类型的字段。例如df.describe(“age”, “height”).show()
5、 first() 返回第一行，类型是row类型
6、 head() 返回第一行，类型是row类型
7、 head(n:Int)返回n行，类型是row 类型
8、 show()返回dataframe集合的值默认是20行，返回类型是unit
9、 show(n:Int)返回n行，，返回值类型是unit
10、 table(n:Int) 返回n行，类型是row 类型

dataframe的基本操作
1、 cache()同步数据的内存
2、 columns 返回一个string类型的数组，返回值是所有列的名字
3、 dtypes返回一个string类型的二维数组，返回值是所有列的名字以及类型
4、 explan()打印执行计划物理的
5、 explain(n:Boolean) 输入值为 false 或者true ，返回值是unit 默认是false ，如果输入true 将会打印逻辑的和物理的
6、 isLocal 返回值是Boolean类型，如果允许模式是local返回true 否则返回false
7、 persist(newlevel:StorageLevel) 返回一个dataframe.this.type 输入存储模型类型
8、 printSchema() 打印出字段名称和类型按照树状结构来打印
9、 registerTempTable(tablename:String) 返回Unit ，将df的对象只放在一张表里面，这个表随着对象的删除而删除了
10、 schema 返回structType 类型，将字段名称和类型按照结构体类型返回
11、 toDF()返回一个新的dataframe类型的
12、 toDF(colnames：String*)将参数中的几个字段返回一个新的dataframe类型的，
13、 unpersist() 返回dataframe.this.type 类型，去除模式中的数据
14、 unpersist(blocking:Boolean)返回dataframe.this.type类型 true 和unpersist是一样的作用false 是去除RDD

集成查询：
1、 agg(expers:column*) 返回dataframe类型，同数学计算求值