spark【例子】count(distinct 字段) 简易版 使用groupByKey和zip

例子描述:

有个网站访问日志,有4个字段:(用户id,用户名,访问次数,访问网站)

需要统计:

1.用户的访问总次数去重

2.用户一共访问了多少种不同的网站

这里用sql很好写

select id,name,count(distinct url) from table group by id,name

其实这个题目是继官方和各种地方讲解聚合函数(aggregate)的第二个例子,第一个例子是使用aggregate来求平均数。

我们先用简易版来做一遍,后续我更新一份聚合函数版


原始数据:

id1,user1,2,http://www.baidu.com
id1,user1,2,http://www.baidu.com
id1,user1,3,http://www.baidu.com
id1,user1,100,http://www.baidu.com
id2,user2,2,http://www.baidu.com
id2,user2,1,http://www.baidu.com
id2,user2,50,http://www.baidu.com
id2,user2,2,http://www.sina.com


结果数据:

((id1,user1),4,1)
((id2,user2),4,2)


代码片段:

[java]  view plain  copy
  在CODE上查看代码片 派生到我的代码片
  1. val sparkConf = new SparkConf().setAppName("DisFie").setMaster("local")  
  2. val sc = new SparkContext(sparkConf)  
  3.   
  4.   
  5. val source = Source.fromFile("C:\\10.txt").getLines.toArray  
  6. val RDD0 = sc.parallelize(source)  
  7.   
  8. RDD0.map {  
  9.   lines =>  
  10.     val line = lines.split(",")  
  11.     ((line(0), line(1)), (1, line(3)))  
  12. }.groupByKey().map {  
  13.   case (x, y) =>  
  14.     val(n,url) = y.unzip  
  15.     (x,n.size,url.toSet.size)  
  16. }.foreach(println)  
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值