MR实战:实现数据去重

本文详述了一次使用Hadoop MapReduce进行数据去重的实战过程,包括创建Maven项目,设置Mapper和Reducer,以及优化代码以提高效率。Map阶段将数据作为key,value设为空,Reduce阶段利用MapReduce默认机制去重。通过执行Driver类,验证了去重操作的成功。此外,还提供了拓展练习,以帮助巩固MapReduce的学习。
摘要由CSDN通过智能技术生成

一、实战概述

在本次实战中,我们致力于使用Hadoop MapReduce技术对两个包含重复数据的文本文件file1.txt和file2.txt进行去重操作,并将结果整合到一个文件中。以下是我们进行的一些优化步骤,以提高代码的效率和可维护性:

  1. Hadoop服务启动: 在开始之前,确保成功启动Hadoop服务,以搭建分布式计算环境,为MapReduce任务提供必要的基础。

  2. 数据准备与上传: 在虚拟机上创建了file1.txtfile2.txt两个文本文件,并将它们上传到HDFS的/dedup/input目录。这确保了数据能够被MapReduce任务访问。

  3. Mapper类优化: 我们创建了自定义MapperDeduplicateMapper,在Map阶段将TextInputFormat默认组件解析的键值对进行优化,将需要去重的数据作为key,value设为空。这种优化提高了Mapper的效率和清晰度。

  4. Reducer类优化: 自定义Reducer类DeduplicateReducer直接复制输入的key作为输出的key,利用MapReduce默认机制对key进行自动去重。这一步骤的优化关注于简化代码同时保持高效性。

  5. Driver类优化: 编写了MapReduce程序运行主类DeduplicateDriver,设置了工作任务的相关参数,包括输入路径、输出路径等。这确保了MapReduce任务能够在集群上正确执行,并且提升了代码的可配置性。

  6. 结果文件整合: 我们将结果输出到HDFS的/dedup/output目录,确保整合的文件能够方便地被访问和下载。

  7. 执行和验证: 最后,通过运行DeduplicateDriver类,我们能够查看并下载去重后的结果文件,从而确认去重操作成功完成。这一步骤有助于验证整个MapReduce任务的准确性和完整性。

通过以上优化,我们更加高效地运用Hadoop MapReduce进行大数据处理和去重操作,深化了对分布式计算的理解和应用能力。整个实战任务展示了如何利用MapReduce处理大规模数据,以及如何通过优化提升代码的可读性和性能。

二、提出任务

  • 文件file1.txt本身包含重复数据,并且与file2.txt同样出现重复数据,现要求使用Hadoop大数据相关技术对以上两个文件进行去重操作,并最终将结果汇总到一个文件中。
  • 编写MapReduce程序,在Map阶段采用Hadoop默认作业输入方式后,将key设置为需要去重的数据,而输出的value可以任意设置为空。
  • 在Reduce阶段,不需要考虑每一个key有多少个value,可以直接将输入的key复制为输出的key,而输出的value可以任意设置为空,这样就会使用MapReduce默认机制对key(也就是文件中的每行内容)自动去重。

三、完成任务

(一)准备数据文件

  • 启动hadoop服务
    在这里插入图片描述

1、在虚拟机上创建文本文件

  • 创建dedup目录,在其中创建两个文本文件 - file1.txtfile2.txt
    在这里插入图片描述

2、上传文件到HDFS指定目录

  • 创建/dedup/input目录,执行命令:hdfs dfs -mkdir -p /dedup/input
    在这里插入图片描述

  • 将两个文本文件 file1.txtfile2.txt,上传到HDFS的/dedup/input目录
    在这里插入图片描述

(二)实现步骤

1、Map阶段实现

使用IntelliJ开发工具创建Maven项目Deduplicate,并且新创建net.linlong包,在该路径下编写自定义Mapper类DeduplicateMapper,主要用于读取数据集文件将TextInputFormat默认组件解析的类似<0,2022-11-1 a >键值对修改为<2022-11-1 a,null>

(1)创建Maven项目

  • 打开IDEA,创建Maven项目 - Deduplicate
    在这里插入图片描述
  • 单击【Create】按钮,得到初始化项目
    在这里插入图片描述

(2)添加相关依赖

  • pom.xml文件里添加hadoopjunit依赖
    在这里插入图片描述
<dependencies>                                  
    <!--hadoop客户端-->                            
    <dependency>                                
        <groupId>org.apache.hadoop</groupId>    
        <artifactId>hadoop-client
  • 16
    点赞
  • 22
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
4S店客户管理小程序-毕业设计,基于微信小程序+SSM+MySql开发,源码+数据库+论文答辩+毕业论文+视频演示 社会的发展和科学技术的进步,互联网技术越来越受欢迎。手机也逐渐受到广大人民群众的喜爱,也逐渐进入了每个用户的使用。手机具有便利性,速度快,效率高,成本低等优点。 因此,构建符合自己要求的操作系统是非常有意义的。 本文从管理员、用户的功能要求出发,4S店客户管理系统中的功能模块主要是实现管理员服务端;首页、个人中心、用户管理、门店管理、车展管理、汽车品牌管理、新闻头条管理、预约试驾管理、我的收藏管理、系统管理,用户客户端:首页、车展、新闻头条、我的。门店客户端:首页、车展、新闻头条、我的经过认真细致的研究,精心准备和规划,最后测试成功,系统可以正常使用。分析功能调整与4S店客户管理系统实现的实际需求相结合,讨论了微信开发者技术与后台结合java语言和MySQL数据库开发4S店客户管理系统的使用。 关键字:4S店客户管理系统小程序 微信开发者 Java技术 MySQL数据库 软件的功能: 1、开发实现4S店客户管理系统的整个系统程序; 2、管理员服务端;首页、个人中心、用户管理、门店管理、车展管理、汽车品牌管理、新闻头条管理、预约试驾管理、我的收藏管理、系统管理等。 3、用户客户端:首页、车展、新闻头条、我的 4、门店客户端:首页、车展、新闻头条、我的等相应操作; 5、基础数据管理:实现系统基本信息的添加、修改及删除等操作,并且根据需求进行交流信息的查看及回复相应操作。
现代经济快节奏发展以及不断完善升级的信息化技术,让传统数据信息的管理升级为软件存储,归纳,集中处理数据信息的管理方式。本微信小程序医院挂号预约系统就是在这样的大环境下诞生,其可以帮助管理者在短时间内处理完毕庞大的数据信息,使用这种软件工具可以帮助管理人员提高事务处理效率,达到事半功倍的效果。此微信小程序医院挂号预约系统利用当下成熟完善的SSM框架,使用跨平台的可开发大型商业网站的Java语言,以及最受欢迎的RDBMS应用软件之一的MySQL数据库进行程序开发。微信小程序医院挂号预约系统有管理员,用户两个角色。管理员功能有个人中心,用户管理,医生信息管理,医院信息管理,科室信息管理,预约信息管理,预约取消管理,留言板,系统管理。微信小程序用户可以注册登录,查看医院信息,查看医生信息,查看公告资讯,在科室信息里面进行预约,也可以取消预约。微信小程序医院挂号预约系统的开发根据操作人员需要设计的界面简洁美观,在功能模块布局上跟同类型网站保持一致,程序在实现基本要求功能时,也为数据信息面临的安全问题提供了一些实用的解决方案。可以说该程序在帮助管理者高效率地处理工作事务的同时,也实现数据信息的整体化,规范化与自动化。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值