- Producer :消息生产者,就是向kafka broker发消息的客户端。
- Consumer :消息消费者,向kafka broker取消息的客户端
- Topic:目标发送的目的地,是一个逻辑概念,落到磁盘上是多个partition,一个partition对应多个segment组合(index,log)
一个segment默认1G
如果partition有副本,则会选举一个partition为leader,所有的读写操作都是通过leader来进行的 - Consumer Group (CG):这是kafka用来实现一个topic消息的广播(发给所有的consumer)和单播(发给任意一个consumer)的手段。一个topic可以有多个CG。topic的消息会复制(不是真的复制,是概念上的)到所有的CG,但每个partion只会把消息发给该CG中的一个consumer。如果需要实现广播,只要每个consumer有一个独立的CG就可以了。要实现单播只要所有的consumer在同一个CG。用CG还可以将consumer进行自由的分组而不需要多次发送消息到不同的topic。
- Broker :一台kafka服务器就是一个broker。一个集群由多个broker组成。一个broker可以容纳多个topic。
- Partition:为了实现扩展性,一个非常大的topic可以分布到多个broker(即服务器)上,一个topic可以分为多个partition,每个partition是一个有序的队列。partition中的每条消息都会被分配一个有序的id(offset)。kafka只保证按一个partition中的顺序将消息发给consumer,不保证一个topic的整体(多个partition间)的顺序。
- Offset:kafka的存储文件都是按照offset.kafka来命名,用offset做名字的好处是方便查找。例如你想找位于2049的位置,只要找到2048.kafka的文件即可。当然the first offset就是00000000000.kafka
使用:
- 使用:
启动自带的zookeeper:
bin/zookeeper-server-start.sh config/zookeeper.properties &
启动kafka:
bin/kafka-server-start.sh config/server.properties &
创建topic;
bin/kafka-topics.sh --create --topic tp1 --zookeeper 192.168.226.128:2181 --replication-factor 1 --partitions 3
查看topic:
bin/kafka-topics.sh --list --zookeeper 192.168.226.128:2181
生产者:
消费者:
关闭上面两窗口
重新创建一个生产者:>nihao
创建多个消费者并分组:
这说明,一个topic会发数据给所有的group,但一个partition只会给同一个group的某个消费者
关于Kafka的API使用请见上一篇文章!