Kafka与数据入库架构知识

数据入库架构图:

Kafka小知识:
1. kafka消费者客户端周期性地向kafka服务端发起心跳,请求保持与服务端的连接;

2. 在kafka中,消费和心跳是在同一个线程中进行;当消费的处理逻辑堵塞是,心跳发送也会被堵塞,无法在规定的session.timeout,ms时间内发出,Broker就会认为消费者已经挂了,从而触发Rebalance;

3. Python共享队列

from multiprocessing import Manager
queue = manager.Queue(maxsize=16384)

当你执行queue.put(data)操作时,如果队列已满(即队列中的元素数量已经达到maxsize指定的数量),那么PUT操作会被阻塞,也就是说这一行代码会被暂时挂起不往下执行,直到队列中有元素被取走,队列有足够的空间放入新的元素,put操作才会继续执行并把元素放入队列。

需要注意的是,put方法还有一个可选参数block,默认为True。当block=False时,如果队列已满,put操作将会立即抛出queue.Full异常,而不会发生阻塞。

4. “消费和心跳是在同一个线程中进行的,心跳会强制中断消费吗?”

不会。在Kafka客户端的设计中,消费消息(即poll操作)和发送心跳是在同一个线程中进行的,但这并不意味着心跳会强制中断消息消费操作。

在Kafka Consumer的实现中,心跳发送采用了轮询的方式,即只有当执行poll操作时,才可能会发送心跳。而大部分的时间,线程都在执行消息消费操作,因此并不会被心跳操作强制中断。只有当消息消费完毕,线程进入轮询时,心跳操作才可能被执行。

但是,如果消息消费速度太慢,或者每一次消费的消息数(由max.poll.records控制)过大,导致一次poll操作的处理时间过长,可能会导致在一段时间内(由session.timeout.ms控制)没有发送任何心跳给Kafka Broker,此时Kafka Broker便会误以为该Consumer已经离线,从而触发了rebalance操作,重新分配partition。

 5. “下游的kafka数据很多时,会影响上游的kafka数据生产吗?”

一般来说,下游(消费者)对Kafka数据的消费速度,不会直接影响到上游(生产者)对Kafka的数据生产。因为在Kafka的设计中,生产者和消费者是解耦和的,各自基于自己的缓冲策略和处理速率进行处理。

6. “python的time.sleep会占用CPU时间吗?”

 在Python中,time.sleep()函数是让当前的执行线程暂停指定的秒数。在此期间,该线程不会占用CPU进行计算,因为它进入了阻塞(休眠)状态,直到设定的时间到达。所以,time.sleep()函数本身不会占用CPU时间。

  • 1
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值