基于Flink的日志采集

最新推荐文章于 2024-08-18 09:00:00 发布

pucheung

最新推荐文章于 2024-08-18 09:00:00 发布

阅读量3.7k

点赞数

分类专栏： Flink

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/u013516966/article/details/105852523

版权

本文探讨了基于Flink的日志采集平台，以解决ELK架构下日志重复消费和延迟问题。介绍了如何通过Flink对日志进行拆分，避免重复消费，并实现日志转储到HDFS，同时强调了日志格式规范和可配置化的重要性。

摘要由CSDN通过智能技术生成

目前基于ELK架构的日志系统，通过filebeat收集上来的日志都会发送到同一个kafka topic中，然后再由Logstash消费处理写入Elasticsearch中，这种方式导致该topic包含所有业务日志，那么各个业务去做实时统计分析就会造成重复消费，使得流量成本的浪费；对于离线分析的日志来源是通过在应用服务端定时上传的方式，对于日志量比较大的业务，一方面上传时会对应用服务器造成比较大的压力，另一方面这种上传方式对于后续小时或者分钟级别分析造成一定延时。

本文将会介绍基于Flink的日志采集平台来解决这些问题。

采集架构

•拆分：最上层Kafka A表示由filebeat收集上来的应用日志，然后通过Flink程序对Kafka topic进行拆分，根据不同的业务拆分到到下游Kafka B不同的topic中，那么对于下游的实时处理任务只需要消费对应的业务日志即可，避免了重复消费；

•转储：对于发送到Kafka B不同的业务日志，通过Flink程序转储写入到HDFS上，生成小时分区文件，供后续的离线日志分析

拆分实现

避免重复消费：为了避免对大topic的重复消费，对于同一个topic只会消费一次，也就是只会启动一个Flink任务，按照一定的规则对数据进行拆分，常见的规则就

最低0.47元/天解锁文章

关注

0
点赞
踩
6

收藏

觉得还不错? 一键收藏
1
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论 1

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。