大数据开发-实时范围-统计系统设计

最新推荐文章于 2021-10-19 11:15:07 发布

Hoult-吴邪

最新推荐文章于 2021-10-19 11:15:07 发布

阅读量504

点赞数

本文链接：https://blog.csdn.net/hu_lichao/article/details/115609330

版权

本文探讨了在大数据环境中，如何设计一个实时统计系统以快速响应时间范围内的count查询。提出了预计算count、索引优化及回溯起点策略，通过在MySQL中建立新表进行增量计算来实现高效查询。同时，针对数据重复和延迟问题，讨论了根据业务需求选择合适的设计方案。

摘要由CSDN通过智能技术生成

1.背景

在大数据生产环境下，往往需求是越快越好，对于实时系统开发，需求往往是一个状态值，比如多少次，多少个，而对于离线数据开发，因为不是实时，所以可以开发各种复杂需求，另外一种基于Lambda架构或者Kappa架构的，往往场合时实时统计系统，实时统计系统在前面Lambda架构的设计中已经谈过，本文时另外一种更复杂的应用场景，对于Lambda架构中产生的流水，要尽可能快地满足范围查询，什么意思呢，Lambda架构中，虽说可以查询一个范围统计的流水，但是为了尽可能地快，将离线计算结果是count，count(distinct) 这两种可以更细地划分，做初步的聚合，比如生成一个Set的集合，这样可以满足在查询层更快地合并数据，但是同时也增加了架构的复杂性和非通用性，同理本文的实时范围查询，是基于需求的一种复杂设计，解决的是这样的一个问题，我想求一段范围的count，怎么保证最快地计算结果。

## 原始数据表t1流水如下
transactionId,id1,id2,money,create_time
## 目的
## 输入id1, 一段范围create_time, 得到count(money)

2.设计

前面背景中主要抛出一个问题，如何设计这样的系统，满足快速求时间范围的count, 需要达到生产级别的实时查询系统。

（1）为了快速count，必然不能只有流水，只有流水的count，遇到数据量大的范围count，很耗时，所以设计预计

最低0.47元/天解锁文章

Hoult-吴邪

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫