带你深度剖析Kafka架构知识点

最新推荐文章于 2024-07-28 19:10:22 发布

我想去吃ya

最新推荐文章于 2024-07-28 19:10:22 发布

阅读量346

点赞数

文章标签： kafka 数据库大数据数据仓库 python

本文链接：https://blog.csdn.net/weixin_51689029/article/details/124048297

版权

带你深度剖析Kafka架构知识点，学习了解Kafka数据处理、Kafka 核心组件、broker和集群、Consumer与topic关系、Kafka消息的分发、Consumer的负载均衡开发技术。
在这里插入图片描述
1. Kafka数据处理步骤

1.1 Producer产生消息发送到Broker中；
1.2 Leader状态的Broker接收消息，写入到相应topic中；
1.3 Leader状态的Broker接收完毕以后，传给Follow状态的Broker作为副本备份；
1.4 Consumer消费Broker中的消息。

2. Kafka 核心组件

2.1 Producer：消息生产者产生的消息将会被发送到某个topic；
2.2 Consumer：消息消费者，消费的消息内容来自某个topic；
2.3 Topic：消息根据topic进行归类，topic其本质是一个目录，即将同一主题消息归类到同一个目录；
2.4 Broker：每一个kafka实例（或者说每台kafka服务器节点）就是一个broker，一个broker可以有多个topic；
2.5 Zookeeper： Zookeeper集群不属于kafka内的组件，但kafka依赖 Zookeeper集群保存meta信息，所以在此做声明其重要性。

3. broker和集群

一个独立的Kafka服务器称为broker，broker接收来自生产者的消息为消息设置偏移量并提交消息到磁盘保存。broker为消费者提供服务，对读取分区的请求作出响应，返回已经提交到磁盘上的消息。根据特定的硬件及其性能特征，单个broker可以轻松处理数千个分区以及每秒百万级的消息量。
broker是集群的组成部分。每个集群都有一个broker同时充当了集群控制器的角色（自动从集群的活跃成员中选举出来）。控制器负责管理工作，包括将分区分配给broker和监控broker。在集群中，一个分区从属于一个broker，该broker被称为分区的首领。一个分区可以分配多个broker，这个时候会发生分区复制。这种复制机制为分区提供了消息冗余，如果一个broker失效，其他broker可以接管领导权。不过，相关的消费者和生产者都要重新连接到新的首领。

4. Consumer与topic关系

kafka只支持Topic
•每个group中可以有多个consumer，每个consumer属于一个consumer group；通常情况下，一个group中会包含多个consumer，这样不仅可以提高topic中消息的并发消费能力，而且还能提高”故障容错”性，如果group中的某个consumer失效那么其消费的partitions将会由其它consumer自动接管。
•对于Topic中的一条特定的消息，只会被订阅此Topic的每个group中的其中一个consumer消费，此消息不会发送给一个group的多个consumer；那么一个group中所有的consumer将会交错的消费整个Topic，每个group中consumer消息消费互相独立，我们可以认为一个group是一个”订阅”者。
•在kafka中,一个partition中的消息只会被group中的一个consumer消费(同一时刻)；
一个Topic中的每个partions，只会被一个”订阅者”中的一个consumer消费，不过一个consumer可以同时消费多个partitions中的消息。
•kafka的设计原理决定,对于一个topic，同一个group中不能有多于partitions个数的consumer同时消费，否则将意味着某些consumer将无法得到消息，而处于空闲状态。
kafka只能保证一个partition中的消息被某个consumer消费时是顺序的；事实上，从Topic角度来说,当有多个partitions时,消息仍不是全局有序的。

5. Kafka消息的分发

•Producer客户端负责消息的分发
•kafka集群中的任何一个broker都可以向producer提供metadata信息,这些metadata中包含”集群中存活的servers列表”、“partitions leader列表”等信息；
•当producer获取到metadata信息之后, producer将会和Topic下所有partition leader保持socket连接；
•消息由producer直接通过socket发送到broker，中间不会经过任何”路由层”。事实上，消息被路由到哪个partition上由producer客户端决定，比如可以采用”random””key-hash””轮询”等。
•如果一个topic中有多个partitions,那么在producer端实现”消息均衡分发”是必要的。
•在producer端的配置文件中,开发者可以指定partition路由的方式。
•Producer消息发送的应答机制
设置发送数据是否需要服务端的反馈,有三个值0,1,-1
–0: producer不会等待broker发送ack
–1: 当leader接收到消息之后发送ack
–-1: 当所有的follower都同步消息成功后发送ack
request.required.acks=0

6. Consumer的负载均衡

当一个group中,有consumer加入或者离开时,会触发partitions均衡.均衡的最终目的,是提升topic的并发消费能力，步骤如下：

1.假如topic1,具有如下partitions: P0,P1,P2,P3
2.加入group A 中,有如下consumer: C0,C1
3.首先根据partition索引号对partitions排序: P0,P1,P2,P3
4.根据consumer.id排序: C0,C1
5.计算倍数: M = [P0,P1,P2,P3].size / [C0,C1].size,本例值M=2(向上取整)
6.然后依次分配partitions: C0 = [P0,P1],C1=[P2,P3],即Ci = [P(i * M),P((i + 1) * M -1)]

要从事大数据技术开发工作请问要怎么做，学习路线是什么？从哪里开始学？学哪些？对于想学大数据的人群有诸多的疑问，大数据本质上是海量数据。以往的数据开发，需要一定的Java基础和工作经验，门槛高入门难。如果零基础入门数据开发行业的小伙伴可以从Python语言入手。

Python语言简单易懂，适合零基础入门，在编程语言排名上升最快，能完成数据挖掘、机器学习、实时计算在内的各种大数据集成任务。

第一阶段：大数据开发入门

1、MySQL数据库及SQL语法

MySQL可以处理拥有上千万条记录的大型数据库，使用标准的SQL数据语言形式，MySQL可以安装在不同的操作系统，并且提供多种编程语言的操作接口，这些编程语言包括C、C++、Python、Java、Ruby等等。支持多种存储引擎。
SQL就是客户端和MySQL服务器端进行通信和沟通的语言。

2、Kettle与BI工具

Kettle作为一个端对端的数据集成平台，其部分特色功能包括：无代码拖拽式构建数据管道、多数据源对接、数据管道可视化、模板化开发数据管道、可视化计划任务、深度Hadoop支持、数据任务下压Spark集群、数据挖掘与机器学习支持。

3、Python与数据库交互

实际的生产任务中，数据几乎全部存在与数据库中，因此，与数据库的交互成为一件难以避免的事情。想要在Python代码中和mysql数据库进行交互，需要借助一个第三方的模块“pymysql”

第二阶段：大数据核心基础

1、Linux

Linux 作为操作系统，本身是为了管理内存，调度进程，处理网络协议栈等等。而大数据的发展是基于开源软件的平台，大数据的分布式集群( Hadoop，Spark )都是搭建在多台 Linux 系统上，对集群的执行命令都是在 Linux 终端窗口输入的。据Linux基金会的研究，86%的企业已经使用Linux操作系统进行大数据平台的构建。Linux占据优势。

2、Hadoop基础

2022最新大数据Hadoop入门教程，最适合零基础自学的大数据

Hadoop是一个能够对大量数据进行分布式处理的软件框架。 Hadoop 以一种可靠、高效、可伸缩的方式进行数据处理。它很擅长存储大量的半结构化的数据集。也非常擅长分布式计算——快速地跨多台机器处理大型数据集合。Hadoop的框架最核心的设计就是：HDFS和MapReduce.HDFS为海量的数据提供了存储，则MapReduce为海量的数据提供了计算。

MapReduce和Hadoop是相互独立的，实际上又能相互配合工作得很好。MapReduce是处理大量半结构化数据集合的编程模型。

3、大数据开发Hive基础

hive是基于Hadoop的一个数据仓库工具，用来进行数据提取、转化、加载，这是一种可以存储、查询和分析存储在Hadoop中的大规模数据的机制。

hive数据仓库工具能将结构化的数据文件映射为一张数据库表，并提供SQL查询功能，能将SQL语句转变成MapReduce任务来执行。Hive的优点是学习成本低，可以通过类似SQL语句实现快速MapReduce统计，使MapReduce变得更加简单，而不必开发专门的MapReduce应用程序。Hive十分适合对数据仓库进行统计分析。

第三阶段：千亿级数仓技术

企业级在线教育项目实战（Hive数仓项目完整流程）

大数据项目实战教程_大数据企业级离线数据仓库，在线教育项目实战（Hive数仓项目完整流程）

以真实项目为驱动，学习离线数仓技术。建立集团数据仓库，统一集团数据中心，把分散的业务数据集中存储和处理；从需求调研、设计、版本控制、研发、测试到落地上线，涵盖了项目的完整工序；挖掘分析海量用户行为数据，定制多维数据集合，形成数据集市，供各个场景主题使用。

第四阶段：PB内存计算

1、Python编程基础+进阶

全套Python教程_Python基础入门视频教程，零基础小白自学Python必备教程

Python高级语法进阶教程_python多任务及网络编程，从零搭建网站全套教程

Python是基于ABC语言的发展来的，Python语法和动态类型，以及解释型语言的本质，使它成为多数平台上写脚本和快速开发应用的编程语言，随着版本的不断更新和语言新功能的添加，逐渐被用于独立的、大型项目的开发。

Python 语言的语法非常简洁明了，即便是非软件专业的初学者，也很容易上手，和其它编程语言相比，实现同一个功能，Python 语言的实现代码往往是最短的。

2、Spark技术栈

Spark全套视频教程，大数据spark3.2从基础到精通，全网首套基于Python语言的spark教程

Spark是大数据体系的明星产品，是一款高性能的分布式内存迭代计算框架，可以处理海量规模的数据。本课程基于Python语言学习Spark3.2开发，课程的讲解注重理论联系实际，高效快捷，深入浅出，让初学者也能快速掌握。让有经验的工程师也能有所收获。

3、大数据Flink技术栈

Flink核心是一个流式的数据流执行引擎，其针对数据流的分布式计算提供了数据分布、数据通信以及容错机制等功能。基于流执行引擎，Flink提供了诸多更高抽象层的API以便用户编写分布式任务。Flink也可以方便地和Hadoop生态圈中其他项目集成，例如Flink可以读取存储在HDFS或HBase中的静态数据，以Kafka作为流式的数据源，直接重用MapReduce或Storm代码，或是通过YARN申请集群资源等。

4.Spark离线数仓工业项目实战

全网首次披露大数据Spark离线数仓工业项目实战，Hive+Spark构建企业级大数据平台

通过大数据技术架构，解决工业物联网制造行业的数据存储和分析、可视化、个性化推荐问题。一站制造项目主要基于Hive数仓分层来存储各个业务指标数据，基于sparkSQL做数据分析。核心业务涉及运营商、呼叫中心、工单、油站、仓储物料。

我想去吃ya

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
带你深度剖析Kafka架构知识点

带你深度剖析Kafka架构知识点，学习了解Kafka数据处理、Kafka 核心组件、broker和集群、Consumer与topic关系、Kafka消息的分发、Consumer的负载均衡开发技术。1. Kafka数据处理步骤1.1 Producer产生消息发送到Broker中；1.2 Leader状态的Broker接收消息，写入到相应topic中；1.3 Leader状态的Broker接收完毕以后，传给Follow状态的Broker作为副本备份；1.4 Consumer消费Broker中的消息。
复制链接

扫一扫