Hadoop数据处理流程

最新推荐文章于 2024-06-24 19:36:47 发布

web18224617243

最新推荐文章于 2024-06-24 19:36:47 发布

阅读量1.6k

点赞数

分类专栏： java 文章标签： hadoop 大数据分布式容器 java

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/web18224617243/article/details/126369853

版权

java 专栏收录该内容

305 篇文章 14 订阅

订阅专栏

为什么80%的码农都做不了架构师？>>> [外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-z48Yiedi-1660640111687)(https://www.oschina.net/img/hot3.png)]

用户行为日志：用户每次访问网站时所有的行为数据（访问、浏览、搜索、点击…）
用户行为轨迹、流量日志

日志数据内容：
1）访问的系统属性：操作系统、浏览器等等
2）访问特征：点击的url、从哪个url跳转过来的(referer)、页面上的停留时间等
3）访问信息：session_id、访问ip(访问城市)等

2013-05-19 13:00:00 http://www.taobao.com/17/tracker_u=1624169&type=1 B58W48U4WKZCJ5D1T3Z9ZY88RU7QA7B1 http://hao.360.cn/ 1.196.34.243

数据处理流程
1）数据采集
Flume： web日志写入到HDFS

2）数据清洗
脏数据
Spark、Hive、MapReduce 或者是其他的一些分布式计算框架
清洗完之后的数据可以存放在HDFS(Hive/Spark SQL)

3）数据处理
按照我们的需要进行相应业务的统计和分析
Spark、Hive、MapReduce 或者是其他的一些分布式计算框架

4）处理结果入库
结果可以存放到RDBMS、NoSQL

5）数据的可视化
通过图形化展示的方式展现出来：饼图、柱状图、地图、折线图
ECharts、HUE、Zeppelin

UserAgent

hadoop jar /home/hadoop/lib/hadoop-train-1.0-jar-with-dependencies.jar com.imooc.hadoop.project.LogApp /10000_access.log /browserout

转载于:https://my.oschina.net/zz006/blog/1913794

4

关注

0
点赞
踩
10

收藏

觉得还不错? 一键收藏
0
评论
Hadoop数据处理流程

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传(img-z48Yiedi-1660640111687)(https://www.oschina.net/img/hot3.png)]2）访问特征：点击的url、从哪个url跳转过来的(referer)、页面上的停留时间等。用户行为日志：用户每次访问网站时所有的行为数据（访问、浏览、搜索、点击…通过图形化展示的方式展现出来：饼图、柱状图、地图、折线图。1）访问的系统属性：操作系统、浏览器等等。按照我们的需要进行相应业务的统计和分析。...
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。