分布式实时统计系统--Rainbird

最新推荐文章于 2024-10-13 15:54:09 发布

weixin_33982670

最新推荐文章于 2024-10-13 15:54:09 发布

阅读量105

点赞数

文章标签：大数据

最近Twitter开发了一款分布式实时统计系统Rainbird。

用处

Rainbird可以用于实时数据的统计：

1 统计网站中每一个页面，域名的点击次数

2 内部系统的运行监控（统计被监控服务器的运行状态）

3 记录最大值和最小值

性能要求

作为大型网站的分布式应用，需要具备以下性能：

1 极高的写入性能，可以达到100,000的WPS

2 非常高的读取性能，可以达到10,000s的RPS

3 高度的可扩展性，包括读取和存储等等，能够扩展到100+ TB的量级

4 读取速度响应间隔短，绝大多数的读取速度应该不超过100ms

系统组件

Rainbird一款基于Zookeeper, Cassandra, Scribe, Thrift的分布式实时统计系统，这些基础组件的基本功能如下：

1 Zookeeper，Hadoop子项目中的一款分布式协调系统，用于控制分布式系统中各个组件中的一致性。

2 Cassandra，NoSQL中一款非常出色的产品，集合了Dynamo和Bigtable特性的分布式存储系统，用于存储需要进行统计的数据，统计数据，并且提供客户端进行统计数据的查询。（需要使用分布式Counter补丁CASSANDRA-1072）

3 Scribe，Facebook开源的一款分布式日志收集系统，用于在系统中将各个需要统计的数据源收集到Cassandra中。

4 Thrift，Facebook开源的一款跨语言C/S网络通信框架，开发人员基于这个框架可以轻易地开发C/S应用。

整体设计

Rainbird的设计架构图如下：

整个Rainbird系统中各个组件之间的协调和容灾处理由ZooKeeper负责，Cassandra负责整个数据的存储和统计。

Front End中部署了Scribe，收集需要统计的数据，然后将收集到数据实时地发生到Rainbird Aggregator中。

Rainbird Aggregator将缓存收集的数据（1M），并将缓存的数据进行一次预处理，然后再将数据一次性批量写入到Cassandra中。这里预处理的作用类似于MapReduce框架中的combiner的作用，在Maper端做Reduce。

Rainbird Query接受用户的查询请求，直接到Cassandra中查询已经统计好的数据返回给客户端。

页面URL统计示例

将设我们需要统计网站的页面点击的情况，那么如何使用Rainbird来进行统计呢？

在统计的过程中，本博客中一篇文章的URL为：http://www.cnblogs.com/gpcuster/tag/Cassandra/

我们可以将这个URL分拆为以下四个部分

com

cnblogs

www

http://www.cnblogs.com/gpcuster/tag/Cassandra/

然后以分拆后的这四个部分组合为以下Key：

com,cnblogs,www,http://www.cnblogs.com/gpcuster/tag/Cassandra/

com,cnblogs,www

com,cnblogs

com

最后将这些Key的数据写入Cassandra中。这样就完成了整个统计的过程。

如果需要查询页面http://www.cnblogs.com/gpcuster/tag/Cassandra/被访问了多少次，只要在Cassandra中查询Key为com,cnblogs,www,http://www.cnblogs.com/gpcuster/tag/Cassandra/的值即可。

如果需要查询页面http://www.cnblogs.com被访问了多少次，只要在Cassandra中查询Key为com,cnblogs,www的值即可。

如果要查询页面http://*cnblogs.com被访问了多少次，也可以进行类似的查询即可。

更多参考

如果希望了解更详细的信息，可以参考：http://www.slideshare.net/kevinweil/rainbird-realtime-analytics-at-twitter-strata-2011

另外，想了解更多关于Cassandra的信息，可以参考：http://www.cnblogs.com/gpcuster/tag/Cassandra/

想了解更多关于ZooKeeper的信息，可以参考：http://www.cnblogs.com/gpcuster/tag/ZooKeeper/

weixin_33982670

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。