hadoop学习笔记（四）MapReduce常见实例一：去重、求平均值

最新推荐文章于 2022-11-05 16:10:14 发布

晴是有风

最新推荐文章于 2022-11-05 16:10:14 发布

阅读量1.5k

点赞数 2

分类专栏： hadoop 文章标签： hadoop MapReduce

本文链接：https://blog.csdn.net/qq_34239412/article/details/85123796

版权

本文介绍了使用Hadoop MapReduce进行数据去重和求平均值的实例。在去重场景中，针对用户收藏商品的数据文件，通过MapReduce流程实现每个商品id只出现一次。在求平均值部分，展示了如何处理商品点击次数数据，计算各类商品的平均点击率。

摘要由CSDN通过智能技术生成

去重

问题：有一个名为buyer_favorite1的数据文件，记录了用户收藏的商品以及收藏的日期文件中包含（用户id，商品id，收藏日期）三个字段，数据内容以“\t”分割要求根据商品id进行去重，统计用户收藏商品中都有哪些商品被收藏，输出去重后所有的商品id和收藏了该商品的用户id 。

数据内容如下：

用户id   商品id    收藏日期
10181   1000481   2010-04-04 16:54:31
20001   1001597   2010-04-07 15:07:52
20001   1001560   2010-04-07 15:08:27
20042   1001368   2010-04-08 08:20:30
20067   1002061   2010-04-08 16:45:33
20056   1003289   2010-04-12 10:50:55
20056   1003290   2010-04-12 11:57:35
20056   1003292   2010-04-12 12:05:29
20054   1002420   2010-04-14 15:24:12
20055   1001679   2010-04-14 19:46:04
20054   1010675   2010-04-14 15:23:53
20054   1002429   2010-04-14 17:52:45
20076   1002427   2010-04-14 19:35:39
20054   1003326   2010-04-20 12:54:44
20056   1002420   2010-04-15 11:24:49
20064   1002422   2010-04-15 11:35:54
20056   1003066   2010-04-15 11:43:01
20056   1003055   2010-04-15 11:43:06
20056   1010183   2010-04-15 11:45:24
20056   1002422   2010-04-15 11:45:49
20056   1003100   2010-04-15 11:45:54
20056   1003094   2010-04-15 11:45:57
20056   1003064   2010-04-15 11:46:04
20056   1010178   2010-04-15 16:15:20
20076   1003101   2010-04-15 16:37:27
20076   1003103   2010-04-15 16:37:05
20076   1003100   2010-04-15 16:37:18
20076   1003066   2010-04-15 16:37:31
20054   1003103   2010-04-15 16:40:14
20054   1003100   2010-04-15 16:40:16

“数据去重”主要是为了掌握和利用并行化思想来对数据进行有意义的筛选。统计大数据集上的数据种类个数、从网站日志中计算访问地等这些看似庞杂的任务都会涉及数据去重。

数据去重的最终目标是让原始数据中

最低0.47元/天解锁文章

晴是有风

关注

2
点赞
踩
12

收藏

觉得还不错? 一键收藏
2
评论
hadoop学习笔记（四）MapReduce常见实例一：去重、求平均值

去重问题：有一个名为buyer_favorite1的数据文件，记录了用户收藏的商品以及收藏的日期文件中包含（用户id，商品id，收藏日期）三个字段，数据内容以“\t”分割要求根据商品id进行去重，统计用户收藏商品中都有哪些商品被收藏，输出去重后所有的商品id和收藏了该商品的用户id 。数据内容如下：用户id 商品id 收藏日期10181 1000481 20...
复制链接

扫一扫