SparkSQL之DataFrame API

测试文件

测试文件employees.json,内容如下:

{"name":"Michael", "salary":3000, "age": 28}
{"name":"Andy", "salary":4500}
{"name":"Justin", "salary":3500}
{"name":"Berta", "salary":4000}
{"name":"vincent", "salary":90000}

CREATE DataFrame

package cn.ac.iie.spark

import org.apache.spark.sql.SparkSession

/**
 * DataFrame API基本操作
 */

object DataFrameApp {
  def main(args: Array[String]): Unit = {
    val spark = SparkSession.builder().appName("DataFrameApp").master("local[2]").getOrCreate()
    // 本地文件系统或者HDFS都支持
    // 将Json文件加载成一个DataFrame
    val peopleDF = spark.read.format("json").load("file:///E:/test/employees.json")
    // 输出DataFrame对应的Schema信息
    peopleDF.printSchema()
    // 默认展示数据集前20条记录
    peopleDF.show()
    //查询某列的所有数据,相当于mysql中的 select name from
    peopleDF.select("name").show()
    peopleDF.select(peopleDF.col("name"), peopleDF.col("age") + 10).show()
    peopleDF.select(peopleDF.col("name"), (peopleDF.col("age") + 10).as("age2")).show()

    // 根据某一列的值进行过滤: select * from table where age > 20
    peopleDF.filter(peopleDF.col("age") > 20).show()

    // 根据某一列进行分组,然后在进行聚合操作:select age, count(1) from table group by age
    peopleDF.groupBy(peopleDF.col("age")).count().show()
    spark.stop()
  }
}

show()方法默认展示前20条记录,如果要展示多条,则写为show(100)

printSchema

peopleDF.printSchema()
在这里插入图片描述

show

peopleDF.show()
在这里插入图片描述

select

查询某一列数据

peopleDF.select("name").show()
在这里插入图片描述

查询某几列所有的数据

peopleDF.select(peopleDF.col("name"), peopleDF.col("age") + 10).show(),并且还可以对某一列数据进行相应的计算。
在这里插入图片描述

给某列名起别名

peopleDF.select(peopleDF.col("name"), (peopleDF.col("age") + 10).as("age2")).show()
在这里插入图片描述

filter

peopleDF.filter(peopleDF.col("age") > 20).show()
在这里插入图片描述

group

根据某一列进行分组,然后在进行聚合操作.
原始数据:
在这里插入图片描述
peopleDF.groupBy(peopleDF.col("age")).count().show()
在这里插入图片描述

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值