kafka分区、group和消费者原理

最新推荐文章于 2024-05-26 21:59:24 发布

测试__昵称

最新推荐文章于 2024-05-26 21:59:24 发布

阅读量1.1k

点赞数

分类专栏： java 文章标签： java kafka 开发语言

本文链接：https://blog.csdn.net/zuokaopuqingnian/article/details/126465768

版权

java 专栏收录该内容

21 篇文章 0 订阅

订阅专栏

原理：

一个topic 可以配置几个partition，produce发送的消息分发到不同的partition中，consumer接受数据的时候是按照group来接受，kafka确保每个partition只能同一个group中的同一个consumer消费，如果想要重复消费，那么需要其他的组来消费。Zookeerper中保存这每个topic下的每个partition在每个group中消费的offset 。
新版kafka把这个offsert保存到了一个__consumer_offsert的topic下
这个__consumer_offsert 有50个分区，通过将group的id哈希值%50的值来确定要保存到那一个分区. 这样也是为了考虑到zookeeper不擅长大量读写的原因。
所以，如果要一个group用几个consumer来同时读取的话，需要多线程来读取，一个线程相当于一个consumer实例。当consumer的数量大于分区的数量的时候，有的consumer线程会读取不到数据。
假设一个topic test 被groupA消费了，现在启动另外一个新的groupB来消费test，默认test-groupB的offset不是0，而是没有新建立，除非当test有数据的时候，groupB会收到该数据，该条数据也是第一条数据，groupB的offset也是刚初始化的ofsert, 除非用显式的用–from-beginnging 来获取从0开始数据

消费者可以通过使用samegroup.id加入一个组。一般一个组就是一个应用。这个应用内的多台机器就可以只消费一次kafka消息

一个组的最大并行度是该组中的消费者的数量 ← 分区的数量。
Kafka将一个主题的分区分配给组中的使用者，以便每个分区仅由组中的一位消费者使用(如果想要重复消费，那么需要其他的组来消费)。
Kafka保证只有群组中的单个消费者阅读消息。
消费者可以按照存储在日志中的顺序查看消息。