kafka-python

范欣德

已于 2023-06-25 10:24:38 修改

阅读量298

点赞数

分类专栏： kafka 文章标签： kafka python 分布式

于 2023-06-25 00:18:45 首次发布

本文链接：https://blog.csdn.net/weixin_49131823/article/details/131368408

版权

kafka 专栏收录该内容

3 篇文章 0 订阅

订阅专栏

一些链接：
https://blog.csdn.net/grfstc/article/details/125184062
https://blog.csdn.net/luanpeng825485697/article/details/81036028
https://blog.csdn.net/u011651342/article/details/126592933

一. 安装kafka-python

pip install kafka-python -i  http://pypi.douban.com/simple/ --trusted-host pypi.douban.com

二. 生产者（Producer）与消费者（Consumer）

生产者和消费者的简易Demo，这里一起演示：

from kafka import KafkaProducer, KafkaConsumer
from kafka.errors import kafka_errors
import traceback
import json
 
 
def producer_demo():
    # 假设生产的消息为键值对（不是一定要键值对），且序列化方式为json
    producer = KafkaProducer(
        bootstrap_servers=['localhost:9092'], 
        key_serializer=lambda k: json.dumps(k).encode(),
        value_serializer=lambda v: json.dumps(v).encode())
    # 发送三条消息
    for i in range(0, 3):
        future = producer.send(
            'kafka_demo',
            key='count_num',  # 同一个key值，会被送至同一个分区
            value=str(i),
            partition=1)  # 向分区1发送消息
        print("send {}".format(str(i)))
        try:
            future.get(timeout=10) # 监控是否发送成功           
        except kafka_errors:  # 发送失败抛出kafka_errors
            traceback.format_exc()
 
 
def consumer_demo():
    consumer = KafkaConsumer(
        'kafka_demo', 
        bootstrap_servers=':9092',
        group_id='test'
    )
    for message in consumer:
        print("receive, key: {}, value: {}".format(
            json.loads(message.key.decode()),
            json.loads(message.value.decode())
            )
        )

这里建议起两个terminal，或者两个jupyter notebook页面来验证。
先执行消费者：

consumer_demo()

再执行生产者：

producer_demo()

会看到如下输出：

>>> producer_demo()
send 0
send 1
send 2

>>> consumer_demo()
receive, key: count_num, value: 0
receive, key: count_num, value: 1
receive, key: count_num, value: 2

三. 消费者进阶操作

（1）初始化参数：

列举一些KafkaConsumer初始化时的重要参数：

group_id
高并发量，则需要有多个消费者协作，消费进度，则由group_id统一。例如消费者A与消费者B，在初始化时使用同一个group_id。在进行消费时，一条消息被消费者A消费后，在kafka中会被标记，这条消息不会再被B消费（前提是A消费后正确commit）。
key_deserializer， value_deserializer
与生产者中的参数一致，自动解析。
auto_offset_reset
消费者启动的时刻，消息队列中或许已经有堆积的未消费消息，有时候需求是从上一次未消费的位置开始读（则该参数设置为earliest），有时候的需求为从当前时刻开始读之后产生的，之前产生的数据不再消费（则该参数设置为latest）。
enable_auto_commit， auto_commit_interval_ms
是否自动commit，当前消费者消费完该数据后，需要commit，才可以将消费完的信息传回消息队列的控制中心。enable_auto_commit设置为True后，消费者将自动commit，并且两次commit的时间间隔为auto_commit_interval_ms。

（2）手动commit

def consumer_demo():
    consumer = KafkaConsumer(
        'kafka_demo', 
        bootstrap_servers=':9092',
        group_id='test',
        enable_auto_commit=False
    )
    for message in consumer:
        print("receive, key: {}, value: {}".format(
            json.loads(message.key.decode()),
            json.loads(message.value.decode())
            )
        )
        consumer.commit()