Hadoop新手学习指导之hadoop核心知识学习

最新推荐文章于 2021-06-09 01:33:42 发布

程序猿广坤

最新推荐文章于 2021-06-09 01:33:42 发布

阅读量310

点赞数

分类专栏：大数据编程语言 it资讯人工智能文章标签：大数据程序员编程语言 hadoop

本文链接：https://blog.csdn.net/bigagag/article/details/90313812

版权

本文是针对Hadoop新手的学习指导，重点介绍Hadoop2.x的MapReduce和HDFS核心知识。MapReduce作为编程模型，涉及工作原理、编程模型和相关概念，如shuffle、partition和combiner。同时，文章讨论了HDFS的存储、读取、写入以及副本策略。此外，还提到了Hadoop生态系统中的Hive和HBase在大数据处理中的角色，以及YARN的重要性。建议初学者从基础扎实开始，逐步学习相关组件和技术。

摘要由CSDN通过智能技术生成

hadoop核心知识学习:

hadoop分为hadoop1.X和hadoop2.X，并且还有hadoop生态系统。这里只能慢慢介绍了。一口也吃不成胖子。

那么下面我们以hadoop2.x为例进行详细介绍：

Hadoop的核心是mapreduce和hdfs。

Mapreduce：mapreduce是很多人都需要迈过去的槛，它比较难以理解，我们有时候即使写出了mapreduce程序，但是还是摸不着头脑。我们都知道mapreduce是一种编程模型，那么它能干什么，对我有什么用。它的原理是什么，为什么我们编写了map函数，reduce函数就可以在多台机器上运行，这些问题或许都给初学者带来了困扰。

那么我们就要了解：

什么是mapreduce?
Mapreduce的工作原理是什么?
Mapreduce的工作流程是什么?
Mapreduce的编程模型是什么?
shuffle是什么?
partition是什么?
combiner是什麽?
他们三者之间的关系是什么?
map的个数由谁来决定，如何计算?
reduce个数由谁来决定，如何计算?
mapreduce熟悉了，还有一些问题困扰着初学者，虽然有了Java基础，但是我们需要搭建开发环境，该如何搭建开发环境?

那么就需要我们学习Windows上如何使用Eclipse远程连接Hadoop并进行程序开发

因为在操作mapredcue过程中伴随着操作hdfs，就像我们传统开发，编程是离不开数据库一样。hdfs可以理解为传统编程的数据库，但是其实他不是，真正的数据库是hadoop dat