Hadoop介绍与配置环境

最新推荐文章于 2024-05-09 15:54:21 发布

一名初学袁

最新推荐文章于 2024-05-09 15:54:21 发布

阅读量1.3k

点赞数

文章标签： hadoop 大数据 mapreduce

本文链接：https://blog.csdn.net/wt2337493578/article/details/126511060

版权

HADOOP在大数据、云计算中的位置和关系

1.8 配置SSH免密登录（root用户）

Hadoop体系介绍

HADOOP快速入门

什么是HADOOP

1.HADOOP是apache旗下的一套开源软件平台
2.HADOOP提供的功能：利用服务器集群，根据用户的自定义业务逻辑，对海量数据进行分布式处理
3.HADOOP的核心组件有

A.HDFS（分布式文件系统）

B.YARN（运算资源调度系统）

C.MAPREDUCE（分布式运算编程框架）
4.广义上来说，HADOOP通常是指一个更广泛的概念——HADOOP生态圈

HADOOP产生背景

1.HADOOP最早起源于Nutch。Nutch的设计目标是构建一个大型的全网搜索引擎，包括网页抓取、索引、查询等功能，但随着抓取网页数量的增加，遇到了严重的可扩展性问题——如何解决数十亿网页的存储和索引问题。
2.2003年、2004年谷歌发表的两篇论文为该问题提供了可行的解决方案。

分布式文件系统（GFS），可用于处理海量网页的存储

分布式计算框架MAPREDUCE，可用于处理海量网页的索引计算问题。
3.Nutch的开发人员完成了相应的开源实现HDFS和MAPREDUCE，并从Nutch中剥离成为独立项目HADOOP，到2008年1月，HADOOP成为Apache顶级项目，迎来了它的快速发展期

HADOOP在大数据、云计算中的位置和关系

1.云计算是分布式计算、并行计算、网格计算、多核计算、网络存储、虚拟化、负载均衡等传统计算机技术和互联网技术融合发展的产物。借助IaaS(基础设施即服务)、PaaS(平台即服务)、SaaS（软件即服务）等业务模式，把强大的计算能力提供给终端用户。
2.现阶段，云计算的两大底层支撑技术为“虚拟化”和“大数据技术”
3.而HADOOP则是云计算的PaaS层的解决方案之一，并不等同于PaaS，更不等同于云计算本身。

国内外HADOOP应用案例介绍

1、HADOOP应用于数据服务基础平台建设

HADOOP用于用户画像

通过访问网页亦或者是点击某点的频率确定兴趣爱好，推送相关服务，提高成交额度

HADOOP用于网站点击流日志数据挖掘

从网点上套索数据

HADOOP生态圈以及各组成部分的简介

重点组件：

HDFS：分布式文件存储系统

MAPREDUCE：分布式运算程序开发框架

HIVE：基于大数据技术（文件系统+运算框架）的SQL数据仓库工具

HBASE：基于HADOOP的分布式海量数据库

ZOOKEEPER：分布式协调服务基础组件

Mahout：基于mapreduce/spark/flink等分布式运算框架的机器学习算法库

Oozie：工作流调度框架（类似于kettle）

Sqoop：数据导入导出工具

Flume：日志数据采集框架

离线数据分析流程介绍

一个应用广泛的数据分析系统：“web日志数据挖掘”

思维导图脑图驾驶舱仪表盘

需求分析

案例名称

网站或APP点击流日志数据挖掘系统

一般中型的网站(10W的PV以上)，每天会产生1G以上Web日志文件。大型或超大型的网站，可能每小时就会产生10G的数据量。
具体来说，比如某电子商务网站，在线团购业务。每日PV数100w，独立IP数5w。用户通常在工作日上午1000和下午1500访问量最大。日间主要是通过PC端浏览器访问，休息日及夜间通过移动设备访问较多。网站搜索浏量占整个网站的80%，PC用户不足1%的用户会消费，移动用户有5%会消费。
对于日志的这种规模的数据，用HADOOP进行日志分析，是最适合不过的了。

案例需求描述

“Web点击流日志”包含着网站运营很重要的信息，通过日志分析，我们可以知道网站的访问量，哪个网页访问人数最多，哪个网页最有价值，广告转化率、访客的来源信息，访客的终端信息等。

数据来源

本案例的数据主要由用户的点击行为记录
获取方式：在页面预埋一段js程序，为页面上想要监听的标签绑定事件，只要用户点击或移动到标签，即可触发ajax请求到后台servlet程序，用log4j记录下事件信息，从而在web服务器（nginx、tomcat等）上形成不断增长的日志文件。
形如：

58.215.204.118 - - [18/Sep/2013:06:51:35 +0000] "GET /wp-includes/js/jquery/jquery.js?ver=1.10.2 HTTP/1.1" 304 0 "http://blog.fens.me/nodejs-socketio-chat/" "Mozilla/5.0 (Windows NT 5.1; rv:23.0) Gecko/20100101 Firefox/23.0"

数据处理流程

流程图解析

整体流程如下：

1)数据采集：定制开发采集程序，或使用开源框架FLUME

2)数据预处理：定制开发mapreduce程序运行于hadoop集群

3)数据仓库技术：基于hadoop之上的Hive

4)数据导出：基于hadoop的sqoop数据导入导出工具

5)数据可视化：定制开发web程序或使用kettle等产品

6)整个过程的流程调度：hadoop生态圈中的oozie工具或其他类似开源产品

项目技术架构图

项目相关截图

最低0.47元/天解锁文章

一名初学袁

关注

0
点赞
踩
4

收藏

觉得还不错? 一键收藏
打赏
0
评论
Hadoop介绍与配置环境

修改完成后，重启虚拟机即可。进入此配置文件后，将“HOSTNAME”修改为“hadoop02”，这个名称可以随意修改，最好不要和之前已存在的虚拟机的主机名一样，最后按Esc热键进入末行模式，输入“:wq”保存退出即可。“Web点击流日志”包含着网站运营很重要的信息，通过日志分析，我们可以知道网站的访问量，哪个网页访问人数最多，哪个网页最有价值，广告转化率、访客的来源信息，访客的终端信息等。修改完成，如下图所示，之后按Esc热键进入末行模式，输入“:wq”保存退出，这样我们的网络就修改成功了！
复制链接

扫一扫