Kafka
需要在吞吐量和延迟之间取得平衡,可以通过下面两个参数控制.
batch.size
- 当多个消息发送到相同分区时,生产者会将消息打包到一起,以减少请求交互. 而不是一条条发送
- 批次的大小可以通过
batch.size
参数设置.默认是16KB
- 较小的批次大小有可能降低吞吐量(批次大小为0则完全禁用批处理)。
- 一个非常大的批次大小可能会浪费内存。因为我们会预先分配这个资源。
例子
比如说发送消息的频率就是每秒300条,那么如果比如batch.size
调节到了32KB
,或者64KB
,是否可以提升发送消息的整体吞吐量。
因为理论上来说,提升batch
的大小,可以允许更多的数据缓冲在里面,那么一次Request
发送出去的数据量就更多了,这样吞吐量可能会有所提升。
但是这个东西也不能无限的大,过于大了之后,要是数据老是缓冲在Batch
里迟迟不发送出去,那么岂不是你发送消息的延迟
就会很高。
比如说,一条消息进入了Batch
,但是要等待5秒
钟Batch
才凑满了64KB
,才能发送出去。那这条消息的延迟就是5秒钟
。
所以需要在这里按照生产环境的发消息的速率,调节不同的Batch大小
自己测试一下最终出去的吞吐量
以及消息的延迟
,设置一个最合理的参数。
linger.ms
- 上面比如我们设置
batch size
为32KB
,但是比如有的时刻消息比较少,过了很久,比如5min
也没有凑够32KB
,这样延时就很大,所以需要一个参数. 再设置一个时间,到了这个时间,即使数据没达到32KB
,也将这个批次发送出去. 比如设置5ms
,就是到了5ms
,大小没到32KB
,也会发出去
总结
- 同时设置
batch.size
和linger.ms
,就是哪个条件先满足就都会将消息发送出去 Kafka
需要考虑高吞吐量
与延时
的平衡.