大数据Hadoop分布式（MapReduce编程）& python可视化分析

最新推荐文章于 2024-04-29 03:44:58 发布

繁星和孤岛的故事

最新推荐文章于 2024-04-29 03:44:58 发布

阅读量3.5k

点赞数 1

分类专栏： Hadoop学习文章标签：大数据分布式 hadoop mapreduce hdfs

本文链接：https://blog.csdn.net/weixin_43818177/article/details/107346767

版权

Hadoop分布式大数据 & python可视化分析

一、MapReduce

MapReduce作为Hadoop专门用作计算的一个组件，虽然相比spark略有不足，但是他的与原生Hadoop的紧密配合还是可观的。

分布式存储指的是HDFS组件，现在的MapReduce计算组件也被看做分布式并发计算，因为YARN资源控制组件，将资源调度和分配处理的清清楚楚。

本次note主要记载了MapReduce的第一个小实验：入门分词wordcount（类似python的jieba库，但处理的数据是来源于大数据Hadoop的hdfs）

二、初始工作

搭建maven框架
修改pom.xml文件

<?xml version="1.0" encoding="UTF-8"?>
<project xmlns="http://maven.apache.org/POM/4.0.0"
         xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
         xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/xsd/maven-4.0.0.xsd">
    <modelVersion>4.0.0</modelVersion>

    <properties>
        <project.build.sourceEncoding>UTF-8</project.build.sourceEncoding>
    </properties>

    <groupId>com.mrtest</groupId>
    <artifactId>mapreduce</artifactId>
    <version>1.0-SNAPSHOT</version>
    <dependencies>
        <dependency>
            <groupId>junit</groupId>
            <artifactId>junit</artifactId>
            <version>4.12</version>
            <scope>test</scope>
        </dependency>

        <dependency>
            <groupId>org.apache.hadoop</groupId>
            <artifactId>hadoop-common</artifactId>
            <version>2.7.3</version>
        </dependency>
        <dependency>
            <groupId>org.apache.hadoop</groupId>
            <artifactId>hadoop-hdfs</artifactId>
            <version>2.7.3</version>
        </dependency>

        <!-- https://mvnrepository.com/artifact/org.apache.hadoop/hadoop-mapreduce-client-core -->
        <dependency>
            <groupId>org.apache.hadoop</groupId>
            <artifactId>hadoop-mapreduce-client-core</artifactId>
            <version>2.7.3</version>
        </dependency>

        <!-- https://mvnrepository.com/artifact/org.apache.hadoop/hadoop-mapreduce-client-jobclient -->
        <dependency>
            <groupId>org.apache.hadoop</groupId>
            <artifactId>hadoop-mapreduce-client-jobclient</artifactId>
            <version>2.7.3</version>
        </dependency>


        <dependency>
            <groupId>org.apache.hbase</groupId>
            <artifactId>hbase-client</artifactId>
            <version>1.2.4</version>
        </dependency>


        <dependency>
            <groupId>log4j</groupId>
            <artifactId>log4j</artifactId>
            <version>1.2.17</version>
        </dependency>
    </dependencies>


    <build>
        <plugins>

            <plugin>
                <groupId>org.apache.maven.plugins</groupId>
                <artifactId>maven-jar-plugin</artifactId>
                <version>2.6</version>
                <configuration>
                    <archive>
                        <manifest>

最低0.47元/天解锁文章