Hadoop之Hadoop基础知识面试复习

最新推荐文章于 2024-09-18 20:52:30 发布

Lumos`

最新推荐文章于 2024-09-18 20:52:30 发布

阅读量756

点赞数

分类专栏： Hadoop 文章标签： hadoop hdfs

本文链接：https://blog.csdn.net/weixin_41910694/article/details/91338614

版权

27 篇文章 1 订阅

订阅专栏

本文深入探讨了Hadoop及其生态系统的多个核心组件，包括Zookeeper、Flume、Hbase、Hive、Sqoop的功能与应用，同时解析了Hadoop与Hadoop生态系统的区别，以及Hadoop的安装配置流程和关键配置文件的作用。

摘要由CSDN通过智能技术生成

Hadoop之Hadoop基础知识常问面试题

列举几个hadoop生态圈的组件并做简要描述。
1. Zookeeper:是一个开源的分布式应用程序协调服务,基于zookeeper可以实现同步服务，配置维护，命名服务。
2. Flume:一个高可用的，高可靠的，分布式的海量日志采集、聚合和传输的系统。
3. Hbase:是一个分布式的、面向列的开源数据库, 利用Hadoop HDFS作为其存储系统。
4. Hive:基于Hadoop的一个数据仓库工具，可以将结构化的数据档映射为一张数据库表，并提供简单的sql 查询功能，可以将sql语句转换为MapReduce任务进行运行。
5. Sqoop:将一个关系型数据库中的数据导进到Hadoop的 HDFS中，也可以将HDFS的数据导进到关系型数据库中。
解释“hadoop”和“hadoop 生态系统”两个概念。
1. Hadoop是指Hadoop框架本身；hadoop生态系统，不仅包含hadoop，还包括保证hadoop框架正常高效运行其他框架，比如zookeeper、Flume、Hbase、Hive、Sqoop等辅助框架。

1）core-site.xml：

fs.defaultFS:hdfs://cluster1(域名)，这里的值指的是默认的HDFS路径。
hadoop.tmp.dir:/export/data/hadoop_tmp,这里的路径默认是NameNode、DataNode、secondaryNamenode等存放数据的公共目录。用户也可以自己单独指定这三类节点的目录。
ha.zookeeper.quorum:hadoop101:2181,hadoop102:2181,hadoop103:2181,这里是ZooKeeper集群的地址和端口。注意，数量一定是奇数，且不少于三个节点。

2）hadoop-env.sh: 只需设置jdk的安装路径，如：export JAVA_HOME=/usr/local/jdk。

3）hdfs-site.xml：

4）mapred-site.xml：mapreduce.framework.name: 指定mr运行在yarn上。