Kafka实现淘宝亿万级数据统计

最新推荐文章于 2023-01-05 20:40:17 发布

Java架构师-VIP班

最新推荐文章于 2023-01-05 20:40:17 发布

阅读量1k

点赞数

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/csdnteach/article/details/112568415

版权

一、了解淘宝Kafka架构

在ActiveMQ、RabbitMQ、RocketMQ、Kafka消息中间件之间，我们为什么要选择Kafka?

下面详细介绍一下，2012年9月份我在支付宝做余额宝研发，2013年6月支付宝正式推出余额宝，2013年8月担任支付宝淘宝彩票项目经理带领兄弟们一起做研发，期间需要与淘宝和500万对接竞彩接口数据。

通过业余时间与淘宝同事沟通，了解到天猫在电商节如何处理大数据？技术架构上采用了哪些策略？

1、应用无状态(淘宝session框架)

2、有效使用缓存(Tair)

3、应用拆分(HSF)

4、数据库拆分(TDDL)

5、异步通信(Notify)

6、非结构化数据存储 ( TFS,NOSQL)

7、监控、预警系统

8、配置统一管理

天猫的同事把大致的架构跟我描述了一番，心有感悟。咱们来看一下2018年双11当天的成交额。
在这里插入图片描述

二、kafka实现天猫亿万级数据统计架构

Flume是Cloudera提供的一个高可用的，高可靠的，分布式的海量日志采集、聚合和传输的系统，Flume支持在日志系统中定制各类数据发送方，用于收集数据；同时，Flume提供对数据进行简单处理，并写到各种数据接受方（可定制）的能力。
在这里插入图片描述

Data Access：数据通道

Computing：计算

Persistence：执行保存方式

spout：表示一个流的源头，产生tuple

bolt：处理输入流并产生多个输出流，可以做简单的数据转换计算，复杂的流处理一般需要经过多个bolt进行处理。

为什么不能用分布式文件HDFS集群？

1、实时性：hdfs的实时性没有kafka高。

2、消费量的记录：hdfs不会记录你这个块文件消费到了哪里，而基于zookeeper的kafka会记录你消费的点。

3、并发消费：hdfs不支持并发消费，而kafka支持并发消费，即多个consumer。

4、弹性且有序：当数据量会很大，而且处理完之后就可以删除时，频繁的读写会对hdfs中NameNode造成很大的压力。而kafka

最低0.47元/天解锁文章

Java架构师-VIP班

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
Kafka实现淘宝亿万级数据统计

一、了解淘宝Kafka架构在ActiveMQ、RabbitMQ、RocketMQ、Kafka消息中间件之间，我们为什么要选择Kafka?下面详细介绍一下，2012年9月份我在支付宝做余额宝研发，2013年6月支付宝正式推出余额宝，2013年8月担任支付宝淘宝彩票项目经理带领兄弟们一起做研发，期间需要与淘宝和500万对接竞彩接口数据。通过业余时间与淘宝同事沟通，了解到天猫在电商节如何处理大数据？技术架构上采用了哪些策略？1、应用无状态(淘宝session框架)2、有效使用缓存(Tair)3、应用拆
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。