Mapreduce和注册gitte

Zxmmy_77

已于 2024-06-21 10:16:03 修改

阅读量252

点赞数 4

文章标签： mapreduce 大数据

于 2024-06-20 21:43:35 首次发布

本文链接：https://blog.csdn.net/Zxmmy_77/article/details/139843249

版权

1.Mapreduce

2.gittee的注册和使用

经过昨天对Hadoop的初步了解，今天我们深入学习了MapReduce的编程模型，并进行了一些基础的编程实践。通过编写MapReduce程序，我对大数据处理有了更直观的认识。此外，我们还学习了Git版本控制系统的基础知识，并在GitLab上注册了账号。

1.Mapreduce

Mapreduce工作流程图

在上图中， MapReduce 的工作流程大致可以分为5步

输入 Map 阶段的数据源，必须经过分片和格式化操作。

分片操作：指的是将源文件划分为大小相等的小数据块( Hadoop 2.x 中默认 128MB )，也就是分片( split )，Hadoop 会为每一个分片构建一个 Map 任务，并由该任务运行自定义的 map() 函数，从而处理分片里的每一条记录;

格式化操作：将划分好的分片( split )格式化为键值对<key,value>形式的数据，其中， key 代表偏移量， value 代表每一行内容。

执行 MapTask
每个 Map 任务都有一个内存缓冲区(缓冲区大小 100MB )，输入的分片( split )数据经过 Map 任务处理后的中间结果会写入内存缓冲区中。

如果写人的数据达到内存缓冲的阈值( 80MB )，会启动一个线程将内存中的溢出数据写入磁盘，同时不影响 Map 中间结果继续写入缓冲区。

在溢写过程中， MapReduce 框架会对 key 进行排序，如果中间结果比较大，会形成多个溢写文件，最后的缓冲区数据也会全部溢写入磁盘形成一个溢写文件，如果是多个溢写文件，则最后合并所有的溢写文件为一个文件。

执行 Shuffle 过程
MapReduce 工作过程中， Map 阶段处理的数据如何传递给 Reduce 阶段，这是 MapReduce 框架中关键的一个过程，这个过程叫作 Shuffle 。
Shuffle 会将 MapTask 输出的处理结果数据分发给 ReduceTask ，并在分发的过程中，对数据按 key 进行分区和排序。

执行 ReduceTask
输入 ReduceTask 的数据流是<key, {value list}>形式，用户可以自定义 reduce()方法进行逻辑处理，最终以<key, value>的形式输出。

写入文件
MapReduce 框架会自动把 ReduceTask 生成的<key, value>传入 OutputFormat 的 write 方法，实现文件的写入操作。