MQ如何保证消息的可靠性传输(绝对通俗易懂)

转载自:

https://github.com/doocs/advanced-java/blob/master/docs/high-concurrency/how-to-ensure-the-reliable-transmission-of-messages.md

面试题

如何保证消息的可靠性传输?或者说,如何处理消息丢失的问题?

面试官心理分析

这个是肯定的,用 MQ 有个基本原则,就是数据不能多一条,也不能少一条,不能多,就是前面说的重复消费和幂等性问题。不能少,就是说这数据别搞丢了。那这个问题你必须得考虑一下。

如果说你这个是用 MQ 来传递非常核心的消息,比如说计费、扣费的一些消息,那必须确保这个 MQ 传递过程中绝对不会把计费消息给弄丢

面试题剖析

数据的丢失问题,可能出现在生产者、MQ、消费者中,咱们从 RabbitMQ 和 Kafka 分别来分析一下吧。

RabbitMQ

rabbitmq-message-lose

生产者弄丢了数据

生产者将数据发送到 RabbitMQ 的时候,可能数据就在半路给搞丢了,因为网络问题啥的,都有可能。

此时可以选择用 RabbitMQ 提供的事务功能,就是生产者发送数据之前开启 RabbitMQ 事务channel.txSelect,然后发送消息,如果消息没有成功被 RabbitMQ 接收到,那么生产者会收到异常报错,此时就可以回滚事务channel.txRollback,然后重试发送消息;如果收到了消息,那么可以提交事务channel.txCommit

// 开启事务
channel.txSelect
try {
    // 这里发送消息
} catch (Exception e) {
    channel.txRollback

    // 这里再次重发这条消息
}

// 提交事务
channel.txCommit

但是问题是,RabbitMQ 事务机制(同步)一搞,基本上吞吐量会下来,因为太耗性能

所以一般来说,如果你要确保说写 RabbitMQ 的消息别丢,可以开启 confirm 模式,在生产者那里设置开启 confirm 模式之后,你每次写的消息都会分配一个唯一的 id,然后如果写入了 RabbitMQ 中,RabbitMQ 会给你回传一个 ack 消息,告诉你说这个消息 ok 了。如果 RabbitMQ 没能处理这个消息,会回调你的一个 nack 接口,告诉你这个消息接收失败,你可以重试。而且你可以结合这个机制自己在内存里维护每个消息 id 的状态,如果超过一定时间还没接收到这个消息的回调,那么你可以重发。

事务机制和 cnofirm 机制最大的不同在于,事务机制是同步的,你提交一个事务之后会阻塞在那儿,但是 confirm 机制是异步的,你发送个消息之后就可以发送下一个消息,然后那个消息 RabbitMQ 接收了之后会异步回调你的一个接口通知你这个消息接收到了。

所以一般在生产者这块避免数据丢失,都是用 confirm 机制的。

RabbitMQ 弄丢了数据

就是 RabbitMQ 自己弄丢了数据,这个你必须开启 RabbitMQ 的持久化,就是消息写入之后会持久化到磁盘,哪怕是 RabbitMQ 自己挂了,恢复之后会自动读取之前存储的数据,一般数据不会丢。除非极其罕见的是,RabbitMQ 还没持久化,自己就挂了,可能导致少量数据丢失,但是这个概率较小。

设置持久化有两个步骤

  • 创建 queue 的时候将其设置为持久化
    这样就可以保证 RabbitMQ 持久化 queue 的元数据,但是它是不会持久化 queue 里的数据的。
  • 第二个是发送消息的时候将消息的 deliveryMode 设置为 2
    就是将消息设置为持久化的,此时 RabbitMQ 就会将消息持久化到磁盘上去。

必须要同时设置这两个持久化才行,RabbitMQ 哪怕是挂了,再次重启,也会从磁盘上重启恢复 queue,恢复这个 queue 里的数据。

注意,哪怕是你给 RabbitMQ 开启了持久化机制,也有一种可能,就是这个消息写到了 RabbitMQ 中,但是还没来得及持久化到磁盘上,结果不巧,此时 RabbitMQ 挂了,就会导致内存里的一点点数据丢失。

所以,持久化可以跟生产者那边的 confirm 机制配合起来,只有消息被持久化到磁盘之后,才会通知生产者 ack 了,所以哪怕是在持久化到磁盘之前,RabbitMQ 挂了,数据丢了,生产者收不到 ack,你也是可以自己重发的。

消费端弄丢了数据

RabbitMQ 如果丢失了数据,主要是因为你消费的时候,刚消费到,还没处理,结果进程挂了,比如重启了,那么就尴尬了,RabbitMQ 认为你都消费了,这数据就丢了。

这个时候得用 RabbitMQ 提供的 ack 机制,简单来说,就是你必须关闭 RabbitMQ 的自动 ack,可以通过一个 api 来调用就行,然后每次你自己代码里确保处理完的时候,再在程序里 ack 一把。这样的话,如果你还没处理完,不就没有 ack 了?那 RabbitMQ 就认为你还没处理完,这个时候 RabbitMQ 会把这个消费分配给别的 consumer 去处理,消息是不会丢的。

rabbitmq-message-lose-solution

Kafka

消费端弄丢了数据

唯一可能导致消费者弄丢数据的情况,就是说,你消费到了这个消息,然后消费者那边自动提交了 offset,让 Kafka 以为你已经消费好了这个消息,但其实你才刚准备处理这个消息,你还没处理,你自己就挂了,此时这条消息就丢咯。

这不是跟 RabbitMQ 差不多吗,大家都知道 Kafka 会自动提交 offset,那么只要关闭自动提交 offset,在处理完之后自己手动提交 offset,就可以保证数据不会丢。但是此时确实还是可能会有重复消费,比如你刚处理完,还没提交 offset,结果自己挂了,此时肯定会重复消费一次,自己保证幂等性就好了。

生产环境碰到的一个问题,就是说我们的 Kafka 消费者消费到了数据之后是写到一个内存的 queue 里先缓冲一下,结果有的时候,你刚把消息写入内存 queue,然后消费者会自动提交 offset。然后此时我们重启了系统,就会导致内存 queue 里还没来得及处理的数据就丢失了。

Kafka 弄丢了数据

这块比较常见的一个场景,就是 Kafka 某个 broker 宕机,然后重新选举 partition 的 leader。大家想想,要是此时其他的 follower 刚好还有些数据没有同步,结果此时 leader 挂了,然后选举某个 follower 成 leader 之后,不就少了一些数据?这就丢了一些数据啊。

生产环境也遇到过,我们也是,之前 Kafka 的 leader 机器宕机了,将 follower 切换为 leader 之后,就会发现说这个数据就丢了。

所以此时一般是要求起码设置如下 4 个参数:

  • 给 topic 设置 replication.factor 参数:这个值必须大于 1,要求每个 partition 必须有至少 2 个副本。
  • 在 Kafka 服务端设置 min.insync.replicas 参数:这个值必须大于 1,这个是要求一个 leader 至少感知到有至少一个 follower 还跟自己保持联系,没掉队,这样才能确保 leader 挂了还有一个 follower 吧。
  • 在 producer 端设置 acks=all:这个是要求每条数据,必须是写入所有 replica 之后,才能认为是写成功了
  • 在 producer 端设置 retries=MAX(很大很大很大的一个值,无限次重试的意思):这个是要求一旦写入失败,就无限重试,卡在这里了。

我们生产环境就是按照上述要求配置的,这样配置之后,至少在 Kafka broker 端就可以保证在 leader 所在 broker 发生故障,进行 leader 切换时,数据不会丢失。

生产者会不会弄丢数据?

如果按照上述的思路设置了 acks=all,一定不会丢,要求是,你的 leader 接收到消息,所有的 follower 都同步到了消息之后,才认为本次写成功了。如果没满足这个条件,生产者会自动不断的重试,重试无限次。

<think>嗯,用户让我介绍一个智能楼道安全系统,包含实时监控、智能分析、紧急预警、自动灭火和信息发布这几个功能。首先,我需要理解每个部分的具体需求。实时监控部分涉及多种传感器,比如烟雾、温度和红外传感器,可能还需要夜视功能。这部分需要解释传感器如何工作,以及如何集成到嵌入式系统中。然后,智能分析需要处理采集的数据,用算法判断异常,比如烟雾超标或外人闯入。这里可能需要提到数据处理和算法预设的逻辑。 紧急预警部分包括声光报警和发送信息到手机和消防中心。这里要说明触发报警的条件和通知机制,可能需要涉及网络模块的选择,比如Wi-Fi或4G。自动灭火部分需要模拟喷淋系统,可能需要描述启动条件和执行机构,比如电磁阀控制。信息发布方面,用户提到手机APP查看实时数据和云平台日志,这里需要考虑数据上传到云端的实现方式,以及APP的设计。 接下来,我需要确保每个部分的技术细节准确,比如传感器的型号选择,例如MQ-2烟雾传感器和DHT11温度传感器。红外传感器可能需要说明其工作原理,比如热释电红外传感器。夜视功能可能需要用到红外摄像头,补充可见光不足的情况。 在智能分析部分,需要提到微控制器如何处理数据,比如使用阈值比较或机器学习模型,但考虑到嵌入式系统的资源限制,可能更倾向于简单的阈值判断。紧急预警的联网功能可能需要使用SIM模块或Wi-Fi模块,比如ESP8266,来发送短信或推送通知。 自动灭火的喷淋系统模拟,可能需要一个水泵或电磁阀的控制电路,当检测到火灾时触发。这里要强调安全性,比如防止误触发,可能需要双重验证,比如同时检测温度和烟雾才启动。 信息发布部分,云平台可以选择阿里云或AWS,数据存储和实时显示需要考虑数据库和API的设计。手机APP可能需要开发一个简单的界面,显示传感器数据和报警状态。 需要检查是否有遗漏的功能点,比如用户提到的所有五个部分是否都被覆盖。同时,要确保语言通俗易懂,避免过于专业的术语,但又要保持技术准确性。可能还需要考虑系统的可靠性和实时性,比如传感器的响应时间,系统的稳定性。 最后,组织内容结构,分点详细说明每个模块,从硬件到软件,再到工作流程,确保用户能够逐步理解整个系统的工作原理和实现方式。还要注意使用正确的中文术语,避免翻译腔,保持自然流畅。</think>我将按照您提出的5个功能模块,分步骤说明该智能楼道安全系统的设计与实现: 一、实时监控模块 $$硬件组成 = \begin{cases} MQ-2烟雾传感器 & 检测CO/CH4浓度\\ DHT11温湿度传感器 & 温度检测范围0-50℃\\ HC-SR501热释电红外 & 探测距离7米(夜视用940nm红外补光)\\ OV2640摄像头 & 支持1080P@30fps带IR-CUT昼夜切换 \end{cases}$$ ▶ 工作流程:所有传感器通过I2C总线连接STM32F407主控,采样频率设置为: $$f_{s}=\frac{1}{T_s}=10Hz \quad (T_s=100ms)$$ 二、智能分析模块 1. 数据预处理: - 滑动窗口滤波:$y[n] = \frac{1}{N}\sum_{k=0}^{N-1}x[n-k]$(N=5) - 特征提取:温度变化率$\Delta T = \frac{T_{current}-T_{prev}}{\Delta t}$ 2. 安全算法: ```python if (smoke > 1000ppm) or (ΔT > 3℃/min) : fire_risk = True elif PIR_detect & (not RFID_authorized): intruder_alert = True ``` 三、紧急预警模块 $$报警响应时间 \leq 300ms$$ - 声光报警电路:采用SGM8557运放驱动120dB蜂鸣器 + 3W LED爆闪 - 短信报警:SIM800C模块通过AT指令发送: ``` AT+CMGS="13800138000"\r > ALERT: Fire detected at Staircase B2!\r ``` 四、自动灭火模块 $$\text{启动条件} = \begin{cases} T > 70℃ & \text{且}\\ 烟雾浓度 > 1500ppm & \text{持续10s} \end{cases}$$ ▶ 喷淋系统模拟: ```c void activate_sprinkler(){ HAL_GPIO_Write(GPIOB, SOLENOID_PIN, HIGH); // 打开电磁阀 HAL_Delay(5000); // 持续喷水5秒 HAL_GPIO_Write(GPIOB, SOLENOID_PIN, LOW); } ``` 五、信息发布系统 $$数据流:传感器 \xrightarrow{SPI} MCU \xrightarrow{MQTT} 阿里云IoT \xrightarrow{API} APP$$ - 云平台数据结构: ```json { "timestamp": "2023-08-20T15:30:00Z", "temperature": 25.6, "smoke": 432, "PIR_status": 0, "GPS": "31.2304°N,121.4737°E" } ``` - APP功能:通过WebSocket实现实时数据刷新,刷新率1Hz 系统特点: 1. 低功耗设计:采用STM32的Stop Mode,待机功耗<1mA 2. 双模通信:同时支持4G(中国移动OneNET)和LoRa无线传输 3. 防火设计:所有电路板涂覆三防漆,满足IP65防护等级 实际部署建议: - 每层楼安装2组传感器节点(间距≤15米) - 灭火喷头覆盖半径按$r = \sqrt{\frac{Q}{K\sqrt{P}}}$计算(Q流量系数,K材料系数) - 定期校准:温度传感器每6个月用黑体炉校准,烟雾传感器用标准气体标定 需要进一步讨论的工程问题包括:防误报算法优化、多节点组网策略、以及电池供电时的能量管理方案。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值