SparkSQL基本操作----作业一

题目:

SparkSQL基本操作将下列JSON格式数据复制到Linux系统中, 并保存命名为employee. json。

{ "id": 1 , "name":" Ella" , "age": 36 }

{ "id": 2, "name":" Bob","age": 29 }

{ "id": 3 , "name":" Jack","age": 29 }

{ "id": 4 , "name":" Jim","age": 28 }

{ "id": 4 , "name":" Jim","age": 28 }

{ "id": 5 , "name":" Damon" }

{ "id": 5 , "name":" Damon" }

为 employee. json创建DataFrame, 并写出Scala语句完成下列操作:

  1. 查询所有数据;
  2. 查询所有数据, 并去除重复的数据;
  3. 查询所有数据, 打印时去除id字段;
  4. 筛选出 age> 30的记录;
  5. 将数据按 age 分组;
  6. 将数据按 name 升序排列;
  7. 取出前 3 行数据;
  8. 查询所有记录的 name 列, 并为其取别名为 username;
  9. 查询年龄 age 的平均值;
  10. 查询年龄 age 的最小值。

 

代码:

启动hadoop,spark;

spark-shell

1、查询所有数据;

 

 

2、查询所有数据, 并去除重复的数据;

 

 

3、查询 所有 数据, 打印 时 去除 id 字段;

 

 

4、筛选 出 age> 30 的 记录;

 

 

5、将 数据 按 age 分组;

 

 

6、将 数据 按 name 升序 排列;

 

 

7、取出 前 3 行 数据;

 

 

8、查询 所有 记录 的 name 列, 并为 其 取 别名 为 username;

 

 

9、查询 年龄 age 的 平均值;

 

 

10、查询 年龄 age 的 最小值。

 

 

  • 7
    点赞
  • 49
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值