Hadoop中Mapreduce的WordCount案例实操

这篇博客详细介绍了如何在Hadoop中实现MapReduce的WordCount案例,从编程规范到具体步骤,包括Mapper、Reducer的编写,以及在本地和集群上的测试方法,最后强调了实践承诺的重要性。
摘要由CSDN通过智能技术生成

一、MapReduce编程规范

1.1 Mapper阶段

  1. 用户自定义的Mapper要继承自己的父类
  2. Mapper的输入数据时KV对的形式(KV的类型可自定义)
  3. Mapper中的业务逻辑写在map() 方法中
  4. Mapper的输出数据是KV对的形式(KV的类型可自定义)
  5. map() 方法(MapTask进程)对每一个<K,V>调用一次

2.1 Reduce阶段

  1. 用户自定义的Reducer要继承自己的父类
  2. Reducer的输入数据类型对应Mapper的输出数据类型,也是KV
  3. Reducer的业务逻辑写在reduce()方法中
  4. ReduceTask进程对每一组相同的k的<k,v>组调用一次reduce()方法

3.1 Driver阶段

相当于Yarn集群的客户端,用于提交我们整个儿程序到Yarn集群,提交的是封装了MapReduce程序相关运行参数的job对象

二、WordCount需求

输入数据:
在这里插入图片描述
输出数据:
在这里插入图片描述

三、WordCount案例实操

3.1 创建Maven并添加依赖

<dependencies>
		<dependency>
			<groupId>junit</groupId>
			<artifactId>junit</artifactId>
			<version>RELEASE</version>
		</dependency>
		<dependency>
			<groupId>org.apache.logging.log4j</groupId>
			<artifactId>log4j-core</artifactId>
			<version>2.8.2</version>
		</dependency>
		<dependency>
			<groupId>org.apache.hadoop</groupId>
			<artifactId>hadoop-common</artifactId>
			<version>2.7.2</version>
		</dependency>
		<dependency>
			<groupId>org.apache.hadoop</groupId>
			<artifactId>hadoop-client</artifactId>
			<version>2.7.2</version>
		<
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值