大数据Hadoop学习(6)-Kafka集群部署

Kafka简介

Kafka是一种高吞吐量的分布式发布订阅消息系统,它可以处理消费者规模的网站中的所有动作流数据。 它提供了类似于JMS的特性,但是在设计实现上完全不同,此外它并不是JMS规范的实现。kafka对消息保存时根据Topic进行归类,发送消息者成为Producer,消息接受者成为Consumer,此外kafka集群有多个kafka实例组成,每个实例(server)成为broker。无论是kafka集群,还是producer和consumer都依赖于zookeeper来保证系统可用性集群保存一些meta信息。
在这里插入图片描述

一个Topic的多个partitions,被分布在kafka集群中的多个server上;每个server(kafka实例)负责partitions中消息的读写操作;此外kafka还可以配置partitions需要备份的个数(replicas),每个partition将会被备份到多台机器上,以提高可用性。

基于replicated方案,那么就意味着需要对多个备份进行调度;每个partition都有一个server为"leader";leader负责所有的读写操作,如果leader失效,那么将会有其他follower来接管(成为新的leader);follower只是单调的和leader跟进,同步消息即可…由此可见作为leader的server承载了全部的请求压力,因此从集群的整体考虑,有多少个partitions就意味着有多少个"leader",kafka会将"leader"均衡的分散在每个实例上,来确保整体的性能稳定。

生产者:Producer将消息发布到指定的Topic中,同时Producer也能决定将此消息归属于哪个partition;比如基于"round-robin"方式或者通过其他的一些算法等。

消费者:本质上kafka只支持Topic.每个consumer属于一个consumer group;反过来说,每个group中可以有多个consumer.发送到Topic的消息,只会被订阅此Topic的每个group中的一个consumer消费。

如果所有的consumer都具有相同的group,这种情况和queue模式很像;消息将会在consumers之间负载均衡。

如果所有的consumer都具有不同的group,那这就是"发布-订阅";消息将会广播给所有的消费者。

在kafka中,一个partition中的消息只会被group中的一个consumer消费;每个group中consumer消息消费互相独立;我们可以认为一个group是一个"订阅"者,一个Topic中的每个partions,只会被一个"订阅者"中的一个consumer消费,不过一个consumer可以消费多个partitions中的消息.kafka只能保证一个partition中的消息被某个consumer消费时,消息是顺序的.事实上,从Topic角度来说,消息仍不是有序的。

kafka的设计原理决定,对于一个topic,同一个group中不能有多于partitions个数的consumer同时消费,否则将意味着某些consumer将无法得到消息。

Guarantees

(1)发送到partitions中的消息将会按照它接收的顺序追加到日志中。

(2)对于消费者而言,它们消费消息的顺序和日志中消息顺序一致。

(3)如果Topic的"replicationfactor"为N,那么允许N-1个kafka实例失效。

Kafka使用场景

(1)Messaging

对于一些常规的消息系统,kafka是个不错的选择;partitons/replication和容错,可以使kafka具有良好的扩展性和性能优势.不过到目前为止,我们应该很清楚认识到,kafka并没有提供JMS中的"事务性"“消息传输担保(消息确认机制)”"消息分组"等企业级特性;kafka只能使用作为"常规"的消息系统,在一定程度上,尚未确保消息的发送与接收绝对可靠(比如,消息重发,消息发送丢失等)。

(2)Websit activity tracking

kafka可以作为"网站活性跟踪"的最佳工具;可以将网页/用户操作等信息发送到kafka中.并实时监控,或者离线统计分析等。

(3)Log Aggregation

kafka的特性决定它非常适合作为"日志收集中心";application可以将操作日志"批量""异步"的发送到kafka集群中,而不是保存在本地或者DB中;kafka可以批量提交消息/压缩消息等,这对producer端而言,几乎感觉不到性能的开支.此时consumer端可以使hadoop等其他系统化的存储和分析系统。

Kafka集群部署
环境准备

安装Zookeeper集群

Kafka数据保存在Zookeeper上,所以需要先安装好Zookeeper集群

集群规划

node1 node2 node3

zk zk zk

kafka kafka kafka

开始部署

下载http://kafka.apache.org/downloads.html

1)解压安装包
[root@node1 module]$ tar -zxvf kafka_2.10-0.10.2.1.tgz -C /opt/software/
2)修改解压后的文件名称
[root@node1 software]$ mv kafka_2.10-0.10.2.1/ kafka
3)在/opt/software/kafka目录下创建logs文件夹
[root@node1 kafka]$ mkdir logs 
4)修改配置文件

[root@node1 kafka]$ vi config/server.properties
输入以下内容:

#broker的全局唯一编号,不能重复
broker.id=1
#删除topic功能使能
delete.topic.enable=true
#处理网络请求的线程数量
num.network.threads=3
#用来处理磁盘IO的线程数量
num.io.threads=8
#发送套接字的缓冲区大小
socket.send.buffer.bytes=102400
#接收套接字的缓冲区大小
socket.receive.buffer.bytes=102400
#请求套接字的缓冲区大小
socket.request.max.bytes=104857600
#kafka运行日志存放的路径	
log.dirs=/opt/software/kafka/logs
#topic在当前broker上的分区个数
num.partitions=1
#用来恢复和清理data下数据的线程数量
num.recovery.threads.per.data.dir=1
#segment文件保留的最长时间,超时将被删除
log.retention.hours=168
#配置连接Zookeeper集群地址
zookeeper.connect=node1:2181,node2:2181,node3:2181

5)分发安装包
[root@node1 kafka]# scp -r /opt/software/kafka/ node2:/opt/software/
[root@node1 kafka]# scp -r /opt/software/kafka/ node3:/opt/software/
6)分别在node2和node3上修改配置文件/opt/software/kafka/config/server.properties中的broker.id=2、broker.id=3

注:broker.id不得重复

7)启动集群

依次在node1、node2、node3节点上启动kafka

[root@node1 kafka]$ bin/kafka-server-start.sh config/server.properties &
[root@node2 kafka]$ bin/kafka-server-start.sh config/server.properties &
[root@node3 kafka]$ bin/kafka-server-start.sh config/server.properties &
8)关闭集群
[root@node1 kafka]$ bin/kafka-server-stop.sh stop
[root@node2 kafka]$ bin/kafka-server-stop.sh stop
[root@node3 kafka]$ bin/kafka-server-stop.sh stop
9)生产者消费者通讯

在任意一台机器上,执行以下命令创建topic:

(以下三行命令不要换行,是一整行)

bin/kafka-topics.sh --create \
--zookeeper node1:2181,node2:2181,node3:2181 \
--replication-factor 2 --partitions 2 --topic test

在任意一台机器上,执行以下命令(以下三行命令不要换行,是一整行)启动模拟producer:

bin/kafka-console-producer.sh \
 --broker-list node1:9092,node2:9092,node3:9092 \
 --topic test

在另一台机器上,执行以下命令(以下三行命令不要换行,是一整行)启动模拟consumer:

bin/kafka-console-consumer.sh \
 --zookeeper node1:2181,node2:2181,node3:2181 \
 --topic test --from-beginning

10)验证消息推送

在producer端输入任意信息,然后观察consumer端接收到的数据,如:
Hello, Kafka

11)查看结果

启动producer端和Consumer端后,在Kafka producer端发送消息后,在Consumer端收到信息内容
ginning

10)验证消息推送

在producer端输入任意信息,然后观察consumer端接收到的数据,如:
 Hello, Kafka 

11)查看结果

启动producer端和Consumer端后,在Kafka producer端发送消息后,在Consumer端收到信息内容
  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值