一、Spark
1、《Spark 大型电商项目实战》
* 用户访问session分析
* 页面单跳转化率统计
* 热门商品离线统计
博客地址:http://blog.csdn.net/u012318074/article/category/6744423
GitHub地址:https://github.com/Erik-ly/SprakProject
2、基于spark streaming和kafka,hbase的日志统计分析系统
https://github.com/wankunde/logcount
Kafka:作为日志事件的消息系统,具有分布式,可分区,可冗余的消息服务功能。
Spark:使用spark stream功能,实时分析消息系统中的数据,完成计算分析工作。
Hbase:做为后端存储,存储spark计算结构,供其他系统进行调用
3、日志分析统计
Spark Streaming+Flume+Kafka+HBase+Hadoop+Zookeeper实现实时;SpringBoot+Echarts实现数据可视化展示
https://github.com/ljcan/SparkStreaming
二、Flink
1、基于Flink实现的商品实时推荐系统。flink统计商品热度,放入redis缓存,分析日志信息,将画像标签和实时记录放入Hbase。在用户发起推荐请求后,根据用户画像重排序热度榜,并结合协同过滤和标签两个推荐模块为新生成的榜单的每一个产品添加关联产品,最后返回新的用户列表。
GitHub:https://github.com/CheckChe0803/flink-recommandSystem-demo
2、基于Flink对用户行为数据的实时分析
https://github.com/Tiankx1003/Data-Warehouse-Flink
三、PySpark
drabastomek/learningPySpark
https://github.com/drabastomek/learningPySpark
(
大数据入门与实战-PySpark的使用教程
https://www.jianshu.com/p/5a42fe0eed4d
第1天:PySpark简介及环境搭建
https://www.missshi.cn/api/view/blog/5cd03277cb99636e72000001
)
四、大数据优质博客
1、大数据施工现场
https://blog.sev7e0.site/