Hadoop
爱学习的小肥猪
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
初学者如何正确看待大数据这件事
Hadoop说起。 经常看到有大咖在语录中提及:有了Spark,就永远不要Hadoop了,真有大咖这么说的,不信百度能看见。 仔细想下,有点道理:如果只是作为业务层面的开发者,对于大数据技术而言,确实只学Spark就可以了,但是如果是系统架构师的话,hadoop还是要学的,因为作为大数据的系统架构师,没办法回避hadoop。 Hadoop的三个概念组件, s...原创 2019-12-04 11:38:28 · 187 阅读 · 0 评论 -
Hadoop集群搭建
1.Hadoop集群的搭建的准备 关闭防火墙 centos防火墙操作 [cnetos 6.5之前的版本] $>sudo service firewalld stop //停止服务 $>sudo service firewalld start //启动服务 $>sudo service firewalld status //查看状态 [...原创 2019-11-29 10:57:05 · 165 阅读 · 0 评论 -
无基础学习hadoop到上手工作线路指导初级篇
此篇是在零基础学习hadoop到上手工作线路指导(初级篇)的基础,一个继续总结。五一假期:在写点内容,也算是总结。上面我们会了基本的编程,我们需要对hadoop有一个更深的理解:hadoop分为hadoop1.X、hadoop2.X,并且还有hadoop生态系统。这里只能慢慢介绍了。一口也吃不成胖子。 hadoop 1.x分为mapreduce与hdfs其中mapreduce是很多人都需要迈...原创 2019-11-28 11:59:44 · 209 阅读 · 0 评论 -
Hadoop的详细安装过程
安装HDFS,其实就是准备大量的Linux服务器,安装hadoop软件,然后在不同的机器上启动不同的程序,包括namenode,datanode,客户端。 准备4台Linux服务器,1台用于启动namenode,3台用于启动datanode。 安装步骤:1:准备4台Linux机器,并做好基础配置 IP地址 ...原创 2019-11-27 15:56:11 · 184 阅读 · 0 评论 -
基于Hadoop的RPC原理实现
简单来说就是一台机器上的应用想调用另一台机器上的函数或者方法,由于不在同一个内存空间中,所以不能直接调用,要使用RPC协议来调用 下边就来基于Hadoop来实现RPC调用 1.加入Hadoop的依赖包 <repositories> <repository> <id>cloudera</id> <url>ht...原创 2019-11-12 15:42:27 · 192 阅读 · 0 评论 -
无法停止hadoop集群(stop-all.sh)
执行 ./bin/stop-all.sh 脚本一直提示没有可停止的namenode、datanode、secondarynode。可是输入 jps 命令,发现hadoop 已经启动。 [root@xxxxxx src]# bash hadoop-2.6.5/sbin/stop-all.sh This script is Deprecated. Instead use stop-dfs.sh an...原创 2019-11-04 15:20:54 · 1137 阅读 · 0 评论 -
Hadoop学习-hive的安装和命令行使用和java操作
Hive的用处,就是把hdfs里的文件建立映射转化成数据库的表 但hive里的sql语句都是转化成了mapruduce来对hdfs里的数据进行处理 ,并不是真正的在数据库里进行了操作。 而那些表的定义则是储存在了mysql数据库中,他只是记录相应表的定义 所以你的集群中要有一台机器装了mysql 装hive...原创 2019-10-29 14:26:28 · 280 阅读 · 0 评论 -
Hadoop和Spark的Shuffer过程对比解析
Hadoop Shuffer# Hadoop 的shuffer主要分为两个阶段:Map、Reduce。 Map-Shuffer:# 这个阶段发生在map阶段之后,数据写入内存之前,在数据写入内存的过程就已经开始shuffer,通过设置mapreduce.task.io.sort.mb的参数,可改变内存的大小,默认为100M。数据在写入内存大于80%时,会发生溢写spil...原创 2019-10-29 14:22:47 · 412 阅读 · 0 评论
分享