hadoop mapreduce的WordCount案例

最新推荐文章于 2022-08-30 11:16:57 发布

fengqing5578

最新推荐文章于 2022-08-30 11:16:57 发布

阅读量248

点赞数

分类专栏： hadoop

本文链接：https://blog.csdn.net/fengqing5578/article/details/79897166

版权

hadoop 专栏收录该内容

8 篇文章 0 订阅

订阅专栏

1.引入依赖

<properties>
        <project.build.sourceEncoding>UTF-8</project.build.sourceEncoding>
        <hadoop.version>2.6.0</hadoop.version>
    </properties>

    <repositories>
        <repository>
            <id>cloudera</id>
            <url>https://repository.cloudera.com/artifactory/cloudera-repos/</url>
        </repository>
    </repositories>

    <dependencies>

        <dependency>
            <groupId>org.apache.hadoop</groupId>
            <artifactId>hadoop-client</artifactId>
            <version>${hadoop.version}</version>
        </dependency>

        <dependency>
            <groupId>org.apache.hadoop</groupId>
            <artifactId>hadoop-mapreduce-client-app</artifactId>
            <version>${hadoop.version}</version>
        </dependency>
        
        <dependency>
            <groupId>junit</groupId>
            <artifactId>junit</artifactId>
            <version>4.10</version>
            <scope>test</scope>
        </dependency>
    </dependencies>

2.编写map和reduce处理类

package com.lhjava.mapreduce;

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.LongWritable;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Job;
import org.apache.hadoop.mapreduce.Mapper;
import org.apache.hadoop.mapreduce.Reducer;
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;

import java.io.IOException;

public class WordCountApp {

    public static class MyMapper extends Mapper<LongWritable, Text, Text, LongWritable>{
        LongWritable one = new LongWritable(1);

        @Override
        protected void map(LongWritable key, Text value, Context context) throws IOException, InterruptedException {
            //接收的每一行数据
            String line = value.toString();
            //按照指定的分隔符拆分
            String[] words = line.split("\t");

            for(String word : words){
                //把处理结果输出
                context.write(new Text(word), one);
            }


        }
    }

    public static class MyReducer extends Reducer<Text, LongWritable, Text, LongWritable>{
        @Override
        protected void reduce(Text key, Iterable<LongWritable> values, Context context) throws IOException, InterruptedException {
            long sum = 0;
            for(LongWritable value : values){
                System.out.println("value.get:" + value.get());
                sum += value.get();
            }
            //最后统计结果的输出
            context.write(key, new LongWritable(sum));
        }
    }

    public static void main(String[] args) throws Exception {
        //创建Configuration
        Configuration cfg = new Configuration();

        //创建Job
        Job job = Job.getInstance(cfg, "workcount");

        //设置job的处理类
        job.setJarByClass(WordCountApp.class);

        //设置作业处理的输入路径
        FileInputFormat.setInputPaths(job, new Path(args[0]));

        //设置map相关的
        job.setMapperClass(MyMapper.class);
        job.setMapOutputKeyClass(Text.class);
        job.setMapOutputValueClass(LongWritable.class);

        //设置reduce相关的
        job.setReducerClass(MyReducer.class);
        job.setOutputKeyClass(Text.class);
        job.setOutputValueClass(LongWritable.class);

        //设置作业的输出路径
        FileOutputFormat.setOutputPath(job, new Path(args[1]));

        boolean result = job.waitForCompletion(true);

        System.exit(result ? 0 : 1);
    }
}

4.打包项目

cmd进入项目的目录

执行命令： mvn clean package -DskipTests

3.上传到服务器上执行

hadoop jar /home/fengqing/software/hadoop-mapreduce-1.0.jar com.lhjava.mapreduce.WordCountApp /wc/input /wc/output2

fengqing5578

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
hadoop mapreduce的WordCount案例

1.引入依赖&lt;properties&gt; &lt;project.build.sourceEncoding&gt;UTF-8&lt;/project.build.sourceEncoding&gt; &lt;hadoop.version&gt;2.6.0&lt;/hadoop.version&gt; &lt;/properties&gt; ...
复制链接

扫一扫