Hadoop实战之专利数据处理

最新推荐文章于 2020-06-13 00:26:07 发布

VIP文章 super_ozman

最新推荐文章于 2020-06-13 00:26:07 发布

阅读量1k

点赞数

分类专栏： Hadoop in Action 文章标签： hadoop mapreduce

本文链接：https://blog.csdn.net/super_ozman/article/details/47657055

版权

运行环境VMware10、CentOS6.6、hadoop1.2.1

本实验依照Hadoop in action一书第四章进行

首先拿到专利数据：http://data.nber.org/patents/，并上传到hdfs中

本文使用是的cite75-99.txt，该文件涵盖了自1975年到1999年间对美国专利的引用，包含超过1600万条数据，前几行如下图：

其中第一列为专利号、第二列为被第一列引用的专利号，可见专利3858241共引用了5个专利。

编写MapReduce程序读取专利引用数据并进行倒排，对于每一个专利找到哪些专列对他进行了引用并进行合并。

package HIA;
import java.io.IOException;
import java.util.StringTokenizer;

import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.LongWritable;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Job;
import org.apache.hadoop.mapreduce.Mapper;
import org.apache.hadoop.mapreduce.Mapper.Context;
import org.apache.hadoop.mapreduce.Reducer;
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;


public class job1 {

最低0.47元/天解锁文章

super_ozman

关注

0
点赞
踩
4

收藏

觉得还不错? 一键收藏
0
评论
Hadoop实战之专利数据处理

运行环境VMware10、CentOS6.6、hadoop1.2.1本实验依照Hadoop in action一书第四章进行首先拿到专利数据：http://data.nber.org/patents/，并上传到hdfs中本文使用是的cite75-99.txt，该文件涵盖了自1975年到1999年间对美国专利的引用，包含超过1600万条数据，前几行如下图：其中第一列为专利号、
复制链接

扫一扫