大数据Hadoop之倒排索引,求平均值

本文介绍了如何使用Hadoop进行倒排索引的实现,以统计单词在各文件中的出现次数,并展示了计算平均成绩的案例。通过数据准备、实验代码和实验总结,详细阐述了MapReduce在处理此类问题中的应用。
摘要由CSDN通过智能技术生成

一.题目
倒排索引
数据准备
file_1
Welcome to MapReduce World

file_2
MapReduce is simple

file_3
MapReduce is powerful and simple

file_4
Hello MapReduce and Bye MapReduce

需求
实现输出某个单词在每个文件中出现的次数。输出如下格式:
具体单词 file_1:出现次数, file_2:出现次数, file_3:出现次数, file_4:出现次数
示例:
is file_1:0, file_2:1, file_3:1, file_4:0

计算平均成绩
数据准备
subject1
a|李一|88
a|王二|26
a|张三|99
a|刘四|58
a|陈五|45
a|杨六|66
a|赵七|78
a|黄八|100
a|周九|62
a|吴十|12

sbuject2
b|李一|36
b|王二|66
b|张三|86
b|刘四|56
b|陈五|43
b|杨六|86
b|赵七|99
b|黄八|80
b|周九|70
b|吴十|33

subject3
c|李一|83
c|王二|36
c|张三|92
c|刘四|58
c|陈五|75
c|杨六|66
c|赵七|63
c|黄八|60
c|周九|62
c|吴十|72

数据说明:
三门subject的数据,数据用 | 分割,第一列代表科目,第二列是名字,第三列是成绩。

需求
输出每个人的总分以及平均分。
输出示例:
刘四 a:58 b:56 c:58 Total:172 Avg:75
吴十 a:12 b:72 c:33 Total:117 Avg:39

二.实验代码
1.倒排索引

package Hadoop1;

import java.io.IOException;
import java.util.StringTokenizer;
import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.IntWritable;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Job;
import org.apache.hadoop.mapreduce.Mapper;
import org.apache.hadoop.mapreduce.Reducer;
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
import org.apache.hadoop.mapreduce.lib.input.FileSplit;
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;
import org.apache.hadoop.util.GenericOptionsParser;

public class InvertedIndex {
   
    

    public static class Map extends Mapper<Object, Text, Text, Text> {
   

        private Text keyInfo = new Text(); // 存储单词和URL组合
        private Text valueInfo = new Text(); // 存储词频
        private FileSplit split; // 存储Split对象

        // 实现map函数
        public void map(Object key, Text value, Context context) throws IOException, InterruptedException {
   
            // 获得<key,value>对所属的FileSplit对象
        	//把词频作为值,把单词和URI组成key值
            split = (FileSplit) context.getInputSplit();
            StringTokenizer itr = new StringTokenizer(value.toString());
            while (itr.hasMoreTokens()) {
   
            	int splitIndex = split.getPath().toString().indexOf("file");
                keyInfo.set(itr.nextToken() + ":" + split.getPath().toString</
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值