用Java编写Hadoop MapReduce任务

最新推荐文章于 2024-05-11 23:29:58 发布

dnc8371

最新推荐文章于 2024-05-11 23:29:58 发布

阅读量1.6k

点赞数

文章标签： java python hadoop 大数据 mapreduce

尽管Hadoop框架本身是使用Java创建的，但MapReduce作业可以用许多不同的语言编写。在本文中，我将展示如何像其他Java项目一样，基于Maven项目在Java中创建MapReduce作业。

- 准备示例输入

让我们从一个虚构的商业案例开始。在这种情况下，我们需要一个CSV文件，其中包含字典中的英语单词，并添加了其他语言的所有翻译，并以'|'分隔符号。我已经根据这篇文章给出了这个例子。因此，这项工作将阅读不同语言的词典，并将每个英语单词与另一种语言的翻译匹配。作业的输入字典是从此处获取的。我下载了几种不同语言的文件，并将它们放到一个文件中（Hadoop处理多个大文件比处理多个小文件更好）。我的示例文件可以在这里找到。

- 创建Java MapReduce项目

下一步是为MapReduce作业创建Java代码。就像我在使用Maven项目之前所说的那样，所以我在自己的IDE IntelliJ中创建了一个新的空Maven项目。我修改了默认pom以添加必要的插件和依赖项：
我添加的依赖项：

<dependency>
   <groupId>org.apache.hadoop</groupId>
   <artifactId>hadoop-core</artifactId>
   <version>1.2.0</version>
   <scope>provided</scope>
</dependency>

Hadoop依赖关系对于使用MapReduce作业中的Hadoop类是必需的。由于我想在AWS EMR上运行作业，因此请确保我具有匹配的Hadoop版本。此外，由于Hadoop框架将在Hadoop群集上可用，因此可以将范围设置为“已提供”。

除了依赖关系之外，我还在pom.xml中添加了以下两个插件：

<plugins>
  <plugin>
    <groupId>org.apache.maven.plugins</groupId>
    <artifactId>maven-jar-plugin</artifactId>
    <configuration>
      <archive>
        <manifest>
          <addClasspath>true</addClasspath>
          <mainClass>net.pascalalma.hadoop.Dictionary</mainClass>
        </manifest>
      </archive>
    </configuration>
  </plugin>
  <plugin>
    <groupId>org.apache.maven.plugins</groupId>
    <artifactId>maven-compiler-plugin</artifactId>
    <configuration>
      <source>1.6</source>
      <target>1.6</target>
    </configuration>
  </plugin>
</plugins>

第一个插件用于创建我们项目的可执行jar。这使JAR在Hadoop集群上的运行更加容易，因为我们不必声明主类。

为了使创建的JAR与AWS EMR集群的实例兼容，第二个插件是必需的。该AWS集群随附JDK 1.6。如果您忽略此选项，则群集将失败（我收到类似“不支持的major.minor版本51.0”之类的消息）。稍后，我将在另一篇文章中介绍如何设置此AWS EMR集群。

这是基本项目，就像常规的Java项目一样。接下来让我们实现MapReduce作业。

- 实现MapReduce类

最低0.47元/天解锁文章

dnc8371

关注

0
点赞
踩
8

收藏

觉得还不错? 一键收藏
0
评论
用Java编写Hadoop MapReduce任务

尽管Hadoop框架本身是使用Java创建的，但MapReduce作业可以用许多不同的语言编写。在本文中，我将展示如何像其他Java项目一样，基于Maven项目在Java中创建MapReduce作业。准备示例输入让我们从一个虚构的商业案例开始。在这种情况下，我们需要一个CSV文件，其中包含字典中的英语单词，并添加了其他语言的所有翻译，并以'|'分隔符号。我已经根据这篇文章...
复制链接

扫一扫