最全hadoop修改配置文件和环境变量_hadoop命令环境变量export配置，2024年最新2024大数据开发开发面试题及答案

最新推荐文章于 2024-10-31 16:17:19 发布

m0_74932057

最新推荐文章于 2024-10-31 16:17:19 发布

阅读量270

点赞数 5

文章标签：大数据面试学习

本文链接：https://blog.csdn.net/m0_74932057/article/details/138931299

版权

既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，涵盖了95%以上大数据知识点，真正体系化！

由于文件比较多，这里只是将部分目录截图出来，全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频，并且后续会持续更新

需要这份系统化资料的朋友，可以戳这里获取

2）修改文件

vi core-site.xml

#在configuration标签内添加以下内容

<!-- 设置默认使用的文件系统 Hadoop支持file、HDFS、GFS、ali|Amazon云等文件系统 -->
<property>
    <name>fs.defaultFS</name>
    <value>hdfs://node1:8020</value>
</property>

<!-- 设置Hadoop本地保存数据路径 -->
<property>
    <name>hadoop.tmp.dir</name>
    <value>/export/data/hadoop-3.3.0</value>
</property>

<!-- 设置HDFS web UI用户身份 -->
<property>
    <name>hadoop.http.staticuser.user</name>
    <value>root</value>
</property>

<!-- 整合hive 用户代理设置 -->
<property>
    <name>hadoop.proxyuser.root.hosts</name>
    <value>*</value>
</property>

<property>
    <name>hadoop.proxyuser.root.groups</name>
    <value>*</value>
</property>

<!-- 文件系统垃圾桶保存时间 -->
<property>
    <name>fs.trash.interval</name>
    <value>1440</value>
</property>

3、hdfs-site.xml

作用：指定SNN进程的位置信息和每个block的备份数量

vi hdfs-site.xml

#在configuration标签内添加内容

<!-- 设置SNN进程运行机器位置信息 -->
<property>
    <name>dfs.namenode.secondary.http-address</name>
    <value>node2:9868</value>
</property>

补充：这里指定secondarynamenode在node2上，也就意味着我们jps时，这个进程是显示在node2节点上，而不是node1，如果想要放在node1上，只需修改value的值即可。

4、mapred-site.xml

作用：mapreduce相关的
注意：有些版本是没有mapred-site.xml文件的，只有mapred-site.xml.template模板，可以先复制一份这样的模板，再去修改。
1）备份mapred-site.xml.template

cp mapred-site.xml.template mapred-site.xml

如果有mapred-site.xml，忽略这一步。

2）修改文件

vi mapred-site.xml

<!-- 设置MR程序默认运行模式： yarn集群模式 local本地模式 -->
<property>
  <name>mapreduce.framework.name</name>
  <value>yarn</value>
</property>

<!-- MR程序历史服务地址 -->
<property>
  <name>mapreduce.jobhistory.address</name>
  <value>node1:10020</value>
</property>

<!-- MR程序历史服务器web端地址 -->
<property>
  <name>mapreduce.jobhistory.webapp.address</name>
  <value>node1:19888</value>
</property>

<property>
  <name>yarn.app.mapreduce.am.env</name>
  <value>HADOOP_MAPRED_HOME=${HADOOP\_HOME}</value>
</property>

<property>
  <name>mapreduce.map.env</name>
  <value>HADOOP_MAPRED_HOME=${HADOOP\_HOME}</value>
</property>

<property>
  <name>mapreduce.reduce.env</name>
  <value>HADOOP_MAPRED_HOME=${HADOOP\_HOME}</value>
</property>

5、yarn-site.xml

作用：与yarn相关的,指定resourcemanager的位置信息。

vi yarn-site.xml

#在configuration标签内添加内容

<!-- 设置YARN集群主角色运行机器位置 -->
<property>
    <name>yarn.resourcemanager.hostname</name>
    <value>node1</value>
</property>

<property>
    <name>yarn.nodemanager.aux-services</name>
    <value>mapreduce_shuffle</value>
</property>

<!-- 是否将对容器实施物理内存限制 -->
<property>
    <name>yarn.nodemanager.pmem-check-enabled</name>
    <value>false</value>
</property>

<!-- 是否将对容器实施虚拟内存限制。 -->
<property>
    <name>yarn.nodemanager.vmem-check-enabled</name>
    <value>false</value>
</property>

<!-- 开启日志聚集 -->
<property>
  <name>yarn.log-aggregation-enable</name>
  <value>true</value>
</property>

<!-- 设置yarn历史服务器地址 -->
<property>
    <name>yarn.log.server.url</name>
    <value>http://node1:19888/jobhistory/logs</value>
</property>

<!-- 历史日志保存的时间 7天 -->
<property>
  <name>yarn.log-aggregation.retain-seconds</name>
  <value>604800</value>
</property>

6、workers

作用：指定工作的节点有哪些。
注意：在hadoop3.0以前，这个文件叫slaves，3.0之后叫做workers。由于我这里是hadoop3.3.0，所以

vi workers

把文件里面的localhost删除，添加以下内容

node1
node2
node3

补充： /etc/hosts 和 workers 这两个文件里的主机名写法应该保持一致，否则会导致启动集群时，系统无法识别主机名。比如我/etc/hosts 里写的是node1，那 workers 里写的也应该是node1，而不是node1.itcast.cn。

至此，配置文件修改完成。

三、分发同步hadoop

先前并没有同步hadoop服务，是因为想等修改好配置文件后，再把整个hadoop目录同步过去。
1）回到服务安装路径下，也就是我这里的/export/servers。

cd /export/servers

2）执行以下命令

scp -r hadoop-3.3.0 root@node2:$PWD


![img](https://img-blog.csdnimg.cn/img_convert/66167b3d6d6ef0804c05025cd2e41d25.png)
![img](https://img-blog.csdnimg.cn/img_convert/1f3e5d6da429fe1463ba252f0399ccd8.png)

**网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。**

**[需要这份系统化资料的朋友，可以戳这里获取](https://bbs.csdn.net/topics/618545628)**


**一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！**

中...(img-hLUcnZp1-1715794821692)]

**网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。**

**[需要这份系统化资料的朋友，可以戳这里获取](https://bbs.csdn.net/topics/618545628)**


**一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！**