Kafka

最新推荐文章于 2020-01-29 20:46:13 发布

paulgeorge9527

最新推荐文章于 2020-01-29 20:46:13 发布

阅读量135

点赞数

分类专栏：大数据之路

本文链接：https://blog.csdn.net/paulgeorge9527/article/details/89528713

版权

大数据之路专栏收录该内容

8 篇文章 0 订阅

订阅专栏

Kafka介绍
在流式计算中，Kafka一般用来缓存数据，Storm通过消费Kafka的数据进行计算。
高吞吐量发布订阅消息系统
KAFKA + STORM +REDIS

Apache Kafka是一个开源消息系统，由Scala写成。是由Apache软件基金会开发的一个开源消息系统项目。
Kafka最初是由LinkedIn开发，并于2011年初开源。2012年10月从Apache Incubator毕业。该项目的目标是为处理实时数据提供一个统一、高通量、低等待的平台。
Kafka是一个分布式消息队列：生产者、消费者的功能。它提供了类似于JMS的特性，但是在设计实现上完全不同，此外它并不是JMS规范的实现。
Kafka对消息保存时根据Topic进行归类，发送消息者称为Producer,消息接受者称为Consumer,此外kafka集群有多个kafka实例组成，每个实例(server)成为broker。
无论是kafka集群，还是producer和consumer都依赖于zookeeper集群保存一些meta信息，来保证系统可用性

Kafka核心组件
Topic ：消息根据Topic进行归类
Producer：发送消息者
Consumer：消息接受者
broker：每个kafka实例(server)
Zookeeper：依赖集群保存meta信息。

Kafka总结

把尽可能多的内存当作磁盘用，先把数据放到内存中。当都操作发生时，先从pagecache中查找，发现缺页时才进行磁盘调度，最终返回需要的数据

1、kafka是什么
类JMS消息队列，结合JMS中的两种模式，可以有多个消费者主动拉取数据，在JMS中只有点对点模式才有消费者主动拉取数据。
kafka是一个生产者-消费者模型。
Producer：生产者，只负责数据生产，生产者的代码可以集成到任务系统中。
数据的分发策略由producer决定，默认是defaultPartition Utils.abs(key.hashCode) % numPartitions

Broker：当前服务器上的Kafka进程 , 每个kafka实例(server)，一台kafka服务器就是一个broker，俗称拉皮条。只管数据存储，不管是谁生产，不管是谁消费。在集群中每个broker都有一个唯一brokerid，不得重复。

Topic: 目标发送的目的地，这是一个逻辑上的概念，落到磁盘上是一个partition的目录。partition的目录中有多个segment组合(index,log)
		一个Topic对应多个partition[0,1,2,3]，一个partition对应多个segment组合。一个segment有默认的大小是1G。
		每个partition可以设置多个副本(replication-factor 1),会从所有的副本中选取一个leader出来。所有读写操作都是通过leader来进行的。
		特别强调，和mysql中主从有区别，mysql做主从是为了读写分离，在kafka中读写操作都是leader。

ConsumerGroup：数据消费者组，ConsumerGroup可以有多个，每个ConsumerGroup消费的数据都是一样的。
		       可以把多个consumer线程划分为一个组，组里面所有成员共同消费一个topic的数据，组员之间不能重复消费。

Offset：kafka的存储文件都是按照offset.kafka来命名，用offset做名字的好处是方便查找。例如你想找位于2049的位置，只要找到2048.kafka的文件即可。当然the first offset就是00000000000.kafka

2、kafka生产数据时的分组策略
默认是defaultPartition Utils.abs(key.hashCode) % numPartitions
上文中的key是producer在发送数据时传入的，produer.send(KeyedMessage(topic,myPartitionKey,messageContent))

3、kafka如何保证数据的完全生产，即Producer消息发送的应答机制
ack机制：broker表示发来的数据已确认接收无误，表示数据已经保存到磁盘。
0：不等待broker返回确认消息
1：等待topic中某个partition leader保存成功的状态反馈
-1：等待topic中某个partition 所有副本都保存成功的状态反馈

4、broker如何保存数据
在理论环境下，broker按照顺序读写的机制，可以每秒保存600M的数据。主要通过pagecache机制，尽可能的利用当前物理机器上的空闲内存来做缓存。
当前topic所属的broker，必定有一个该topic的partition，partition是一个磁盘目录。partition的目录中有多个segment组合(index,log)

5、partition如何分布在不同的broker上
int i = 0
list{kafka01,kafka02,kafka03}

for(int i=0;i<5;i++){
	brIndex = i%broker;
	hostName = list.get(brIndex)
}

6、consumerGroup的组员和partition之间如何做负载均衡
最好是一一对应，一个partition对应一个consumer。
如果consumer的数量过多，必然有空闲的consumer。

最优的设计是：消费者组下的consumer thread的数量等于partition数量，效率最高
当一个消费者组消费一个topic的时候，无论topic里面有多少个partition，无论消费者组里面配置了多少个consumer thread ，这个消费者组下面的consumer thread 一定会消费全部的partition

算法：
	假如topic1,具有如下partitions: P0,P1,P2,P3
	加入group中,有如下consumer: C1,C2
	首先根据partition索引号对partitions排序: P0,P1,P2,P3
	根据consumer.id排序: C0,C1
	计算倍数: M = [P0,P1,P2,P3].size / [C0,C1].size,本例值M=2(向上取整)
	然后依次分配partitions: C0 = [P0,P1],C1=[P2,P3],即Ci = [P(i * M),P((i + 1) * M -1)]

7、如何保证kafka消费者消费数据是全局有序的
伪命题
如果要全局有序的，必须保证生产有序，存储有序，消费有序。
由于生产可以做集群，存储可以分片，消费可以设置为一个consumerGroup，要保证全局有序，就需要保证每个环节都有序。
只有一个可能，就是一个生产者，一个partition，一个消费者。这种场景和大数据应用场景相悖。
kafka只能保证一个partition中的消息被某个consumer消费时是顺序的；事实上，从Topic角度来说,当有多个partitions时,消息仍不是全局有序的。

消费者组：组内必然有多个消费者或者消费者实例，他们共享一个公共的id。即groupid
可以是一个进程或者一个线程
每个分区只能分配给某一个group下的comsumer（当然该分区还可以被分配到其他group）

partitioner发message到某个topic，message会被均匀分布到多个partition上
Broker收到mesage往对应partition的最后一个seagement上添加消息，当某个segment
只有flush到磁盘上的消息comsumer才能消费
1.7.Scala
scala概述
Scala是一种多范式的编程语言，其设计的初衷是要集成面向对象编程和函数式编程的各种特性。Scala运行于Java平台（Java虚拟机），并兼容现有的Java程序。

1.特点：
优雅：这是框架设计师第一个要考虑的问题，框架的用户是应用开发程序员，API是否优雅直接影响用户体验。
2.速度快：Scala语言表达能力强，一行代码抵得上Java多行，开发速度快；Scala是静态编译的，所以和JRuby,Groovy比起来速度会快很多。
能融合到Hadoop生态圈：Hadoop现在是大数据事实标准，Spark并不是要取代Hadoop，而是要完善Hadoop生态。JVM语言大部分可能会想到Java，但Java做出来的API太丑，或者想实现一个优雅的API太费劲。

paulgeorge9527

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Kafka

Kafka介绍在流式计算中，Kafka一般用来缓存数据，Storm通过消费Kafka的数据进行计算。高吞吐量发布订阅消息系统KAFKA + STORM +REDISApache Kafka是一个开源消息系统，由Scala写成。是由Apache软件基金会开发的一个开源消息系统项目。Kafka最初是由LinkedIn开发，并于2011年初开源。2012年10月从Apache Incuba...
复制链接

扫一扫