flink中有了水印为什么还要设计allowed lateness

1.原理阐述

水印和allowed lateness(以下简称延迟间隔)主要服务于flink 窗口,前者会推迟窗口的触发时间,让有一定程度的乱序和接收延迟的数据也能纳入窗口计算,尽可能保证在窗口第一次(不配置延迟间隔,大部分场景只触发一次)触发时数据准确。而后者是在窗口触发后,延迟窗口关闭,让触发后,关闭前的符合条件的数据接着触发窗口,且每一条数据都会触发窗口

2.设计原因

大家都知道,实时计算相对于离线批处理,受数据源差异影响其结果是不准确的,且计算延迟设计的越低(窗口触发越早),数据越不准确,大家也都接受这个特性。那么如何设计一种策略,让实时数据既满足低延迟,又能保证准确呢?延迟间隔的来了,延迟间隔怎么解决上述问题的呢?接下来我们看一个场景

3.场景

1.假如上线一个活动,需要在每小时01秒统计上个小时的累计在线人数
2.首先将统计窗口设为1h,问题来了,水印延迟该设置多长呢?
3.大家都知道,水印直接影响窗口的触发时间,谁赢设置太大,延迟太高,太小会丢失乱序或延迟记录。在这里,为了保证延迟,我们取最大值1s。但是,上个窗口的数据准确性就难以保证了
4.所以我们急需另一种机制:修复数据的机制
5.延迟间隔闪亮登场,当水印抵达窗口end time,咱们先不清理窗口,保留窗口状态,后续每一条符合条件且在延迟间隔内的记录到来,就触发一次窗口计算,修复窗口数据

4.总结

延迟间隔是在水印之后,对数据完整性的第二次保证。

  • 2
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 1
    评论
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值