大数据Hadoop学习(6)-Kafka集群部署

最新推荐文章于 2024-08-10 14:21:01 发布

LoongKK

最新推荐文章于 2024-08-10 14:21:01 发布

阅读量262

点赞数

文章标签： kafka 大数据

本文链接：https://blog.csdn.net/qq_33956508/article/details/105905612

版权

Kafka简介

Kafka是一种高吞吐量的分布式发布订阅消息系统，它可以处理消费者规模的网站中的所有动作流数据。它提供了类似于JMS的特性，但是在设计实现上完全不同，此外它并不是JMS规范的实现。kafka对消息保存时根据Topic进行归类，发送消息者成为Producer,消息接受者成为Consumer,此外kafka集群有多个kafka实例组成，每个实例(server)成为broker。无论是kafka集群，还是producer和consumer都依赖于zookeeper来保证系统可用性集群保存一些meta信息。
在这里插入图片描述

一个Topic的多个partitions,被分布在kafka集群中的多个server上;每个server(kafka实例)负责partitions中消息的读写操作;此外kafka还可以配置partitions需要备份的个数(replicas),每个partition将会被备份到多台机器上,以提高可用性。

基于replicated方案,那么就意味着需要对多个备份进行调度;每个partition都有一个server为"leader";leader负责所有的读写操作,如果leader失效,那么将会有其他follower来接管(成为新的leader);follower只是单调的和leader跟进,同步消息即可…由此可见作为leader的server承载了全部的请求压力,因此从集群的整体考虑,有多少个partitions就意味着有多少个"leader",kafka会将"leader"均衡的分散在每个实例上,来确保整体的性能稳定。

生产者：Producer将消息发布到指定的Topic中,同时Producer也能决定将此消息归属于哪个partition;比如基于"round-robin"方式或者通过其他的一些算法等。

消费者：本质上kafka只支持Topic.每个consumer属于一个consumer group;反过来说,每个group中可以有多个consumer.发送到Topic的消息,只会被订阅此Topic的每个group中的一个consumer消费。

如果所有的consumer都具有相同的group,这种情况和queue模式很像;消息将会在consumers之间负载均衡。

如果所有的consumer都具有不同的group,那这就是"发布-订阅";消息将会广播给所有的消费者。

在kafka中,一个partition中的消息只会被group中的一个consumer消费;每个group中consumer消息消费互相独立;我们可以认为一个group是一个"订阅"者,一个Topic中的每个partions,只会被一个"订阅者"中的一个consumer消费,不过一个consumer可以消费多个partitions中的消息.kafka只能保证一个partition中的消息被某个consumer消费时,消息是顺序的.事实上,从Topic角度来说,消息仍不是有序的。

kafka的设计原理决定,对于一个topic,同一个group中不能有多于partitions个数的consumer同时消费,否则将意味着某些consumer将无法得到消息。

Guarantees

（1）发送到partitions中的消息将会按照它接收的顺序追加到日志中。

（2）对于消费者而言,它们消费消息的顺序和日志中消息顺序一致。

（3）如果Topic的"replicationfactor"为N,那么允许N-1个kafka实例失效。

Kafka使用场景

（1）Messaging

对于一些常规的消息系统,kafka是个不错的选择;partitons/replication和容错,可以使kafka具有良好的扩展性和性能优势.不过到目前为止,我们应该很清楚认识到,kafka并没有提供JMS中的"事务性"“消息传输担保(消息确认机制)”"消息分组"等企业级特性;kafka只能使用作为"常规"的消息系统,在一定程度上,尚未确保消息的发送与接收绝对可靠(比如,消息重发,消息发送丢失等)。

（2）Websit activity tracking

kafka可以作为"网站活性跟踪"的最佳工具;可以将网页/用户操作等信息发送到kafka中.并实时监控,或者离线统计分析等。

（3）Log Aggregation

kafka的特性决定它非常适合作为"日志收集中心";application可以将操作日志"批量""异步"的发送到kafka集群中,而不是保存在本地或者DB中;kafka可以批量提交消息/压缩消息等,这对producer端而言,几乎感觉不到性能的开支.此时consumer端可以使hadoop等其他系统化的存储和分析系统。

Kafka集群部署

环境准备

安装Zookeeper集群

Kafka数据保存在Zookeeper上，所以需要先安装好Zookeeper集群

集群规划

node1 node2 node3

zk zk zk

kafka kafka kafka

开始部署

下载http://kafka.apache.org/downloads.html

1）解压安装包

[root@node1 module]$ tar -zxvf kafka_2.10-0.10.2.1.tgz -C /opt/software/

2）修改解压后的文件名称

[root@node1 software]$ mv kafka_2.10-0.10.2.1/ kafka

3）在/opt/software/kafka目录下创建logs文件夹

[root@node1 kafka]$ mkdir logs

4）修改配置文件

[root@node1 kafka]$ vi config/server.properties
输入以下内容：

#broker的全局唯一编号，不能重复
broker.id=1
#删除topic功能使能
delete.topic.enable=true
#处理网络请求的线程数量
num.network.threads=3
#用来处理磁盘IO的线程数量
num.io.threads=8
#发送套接字的缓冲区大小
socket.send.buffer.bytes=102400
#接收套接字的缓冲区大小
socket.receive.buffer.bytes=102400
#请求套接字的缓冲区大小
socket.request.max.bytes=104857600
#kafka运行日志存放的路径	
log.dirs=/opt/software/kafka/logs
#topic在当前broker上的分区个数
num.partitions=1
#用来恢复和清理data下数据的线程数量
num.recovery.threads.per.data.dir=1
#segment文件保留的最长时间，超时将被删除
log.retention.hours=168
#配置连接Zookeeper集群地址
zookeeper.connect=node1:2181,node2:2181,node3:2181

5）分发安装包

[root@node1 kafka]# scp -r /opt/software/kafka/ node2:/opt/software/
[root@node1 kafka]# scp -r /opt/software/kafka/ node3:/opt/software/

6）分别在node2和node3上修改配置文件/opt/software/kafka/config/server.properties中的broker.id=2、broker.id=3

注：broker.id不得重复

7）启动集群

依次在node1、node2、node3节点上启动kafka

[root@node1 kafka]$ bin/kafka-server-start.sh config/server.properties &
[root@node2 kafka]$ bin/kafka-server-start.sh config/server.properties &
[root@node3 kafka]$ bin/kafka-server-start.sh config/server.properties &

8）关闭集群

[root@node1 kafka]$ bin/kafka-server-stop.sh stop
[root@node2 kafka]$ bin/kafka-server-stop.sh stop
[root@node3 kafka]$ bin/kafka-server-stop.sh stop

9）生产者消费者通讯

在任意一台机器上，执行以下命令创建topic：

(以下三行命令不要换行，是一整行)

bin/kafka-topics.sh --create \
--zookeeper node1:2181,node2:2181,node3:2181 \
--replication-factor 2 --partitions 2 --topic test

在任意一台机器上，执行以下命令(以下三行命令不要换行，是一整行)启动模拟producer：

bin/kafka-console-producer.sh \
 --broker-list node1:9092,node2:9092,node3:9092 \
 --topic test

在另一台机器上，执行以下命令(以下三行命令不要换行，是一整行)启动模拟consumer：

bin/kafka-console-consumer.sh \
 --zookeeper node1:2181,node2:2181,node3:2181 \
 --topic test --from-beginning

10）验证消息推送

在producer端输入任意信息，然后观察consumer端接收到的数据，如：
Hello, Kafka

11）查看结果

启动producer端和Consumer端后，在Kafka producer端发送消息后，在Consumer端收到信息内容
ginning

10）验证消息推送

在producer端输入任意信息，然后观察consumer端接收到的数据，如：
 Hello, Kafka 

11）查看结果

启动producer端和Consumer端后，在Kafka producer端发送消息后，在Consumer端收到信息内容

LoongKK

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
大数据Hadoop学习(6)-Kafka集群部署

Kafka简介Kafka是一种高吞吐量的分布式发布订阅消息系统，它可以处理消费者规模的网站中的所有动作流数据。它提供了类似于JMS的特性，但是在设计实现上完全不同，此外它并不是JMS规范的实现。kafka对消息保存时根据Topic进行归类，发送消息者成为Producer,消息接受者成为Consumer,此外kafka集群有多个kafka实例组成，每个实例(server)成为broker。无论是...
复制链接

扫一扫