【Kafka】（二十四）轻量级流计算 Kafka Streams 实践总结_轻量级流式计算处理(1)

2401_84164721

于 2024-05-10 23:00:23 发布

阅读量499

点赞数 18

分类专栏：程序员文章标签：大数据面试学习

本文链接：https://blog.csdn.net/2401_84164721/article/details/138685339

版权

程序员专栏收录该内容

184 篇文章 0 订阅

订阅专栏

既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，涵盖了95%以上大数据知识点，真正体系化！

由于文件比较多，这里只是将部分目录截图出来，全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频，并且后续会持续更新

需要这份系统化资料的朋友，可以戳这里获取

第一，Spark 和 Storm 都是流式处理框架，而 Kafka Streams 提供的是一个基于 Kafka 的流式处理类库。框架要求开发者按照特定的方式去开发逻辑部分，供框架调用。开发者很难了解框架的具体运行方式，从而使得调试成本高，并且使用受限。而 Kafka Streams 作为流式处理类库，直接提供具体的类给开发者调用，整个应用的运行方式主要由开发者控制，方便使用和调试。

第二，虽然 Cloudera 与 Hortonworks 方便了 Storm 和 Spark 的部署，但是这些框架的部署仍然相对复杂。而 Kafka Streams 作为类库，可以非常方便的嵌入应用程序中，它对应用的打包和部署基本没有任何要求。

第三，就流式处理系统而言，基本都支持 Kafka 作为数据源。例如 Storm 具有专门的 kafka-spout，而 Spark 也提供专门的 spark-streaming-kafka 模块。事实上，Kafka 基本上是主流的流式处理系统的标准数据源。换言之，大部分流式系统中都已部署了 Kafka，此时使用 Kafka Streams 的成本非常低。

第四，使用 Storm 或 Spark Streaming 时，需要为框架本身的进程预留资源，如 Storm 的 supervisor 和 Spark on YARN 的 node manager。即使对于应用实例而言，框架本身也会占用部分资源，如 Spark Streaming 需要为 shuffle 和 storage 预留内存。但是 Kafka 作为类库不占用系统资源。

第五，由于 Kafka 本身提供数据持久化，因此 Kafka Streams 提供滚动部署和滚动升级以及重新计算的能力。

第六，由于 Kafka Consumer Rebalance 机制，Kafka Stream 可以在线动态调整并行度。

二、Kafka Streams 数据清洗案例

0）需求

实时处理单词带有”>>>”前缀的内容。例如输入”aaa>>>bbb”，最终处理成 “bbb”

1）需求分析

在这里插入图片描述

2）案例实操

创建一个工程，并添加 jar 包
创建主类

package com.atguigu.kafka.stream; 
import java.util.Properties; 
import org.apache.kafka.streams.KafkaStreams; 
import org.apache.kafka.streams.StreamsConfig; 
import org.apache.kafka.streams.processor.Processor; 
import org.apache.kafka.streams.processor.ProcessorSupplier; 
import org.apache.kafka.streams.processor.TopologyBuilder; 

public class Application { 

	public static void main(String[] args) { 

	// 定义输入的 
	topic String from = "first"; 
	// 定义输出的 
	topic String to = "second"; 
	// 设置参数 
	Properties settings = new Properties();
	settings.put(StreamsConfig.APPLICATION_ID_CONFIG, "logFilter");
	settings.put(StreamsConfig.BOOTSTRAP_SERVERS_CONFIG, "hadoop102:9092");
	StreamsConfig config = new StreamsConfig(settings); 

	// 构建拓扑 
	TopologyBuilder builder = new TopologyBuilder(); 

	builder.addSource("SOURCE", from) 
	.addProcessor("PROCESS", new ProcessorSupplier<byte[], byte[]>() { 
			@Override 
			public Processor<byte[], byte[]> get() { 
		// 具体分析处理
			return new LogProcessor();
			 } 
		 }, "SOURCE")
	.addSink("SINK", to, "PROCESS"); 
	// 创建 kafka streams 
	KafkaStreams streams = new KafkaStreams(builder, config); 
	streams.start(); 
	} 
}

具体业务处理

package com.atguigu.kafka.stream;
import org.apache.kafka.streams.processor.Processor; 
import org.apache.kafka.streams.processor.ProcessorContext; 

public class LogProcessor implements Processor<byte[], byte[]> { 

	private ProcessorContext context; 
	@Override 
	public void init(ProcessorContext context) { 
		this.context = context; 
	}

	@Override 
	public void process(byte[] key, byte[] value) { 
		String input = new String(value); 

	// 如果包含“>>>”则只保留该标记后面的内容 
	if (input.contains(">>>")) { 
		input = input.split(">>>")[1].trim(); 
		// 输出到下一个topic 
			context.forward("logProcessor".getBytes(), input.getBytes());
		}else{
			context.forward("logProcessor".getBytes(), input.getBytes()); 
			} 
		}
		@Override 
		public void punctuate(long timestamp) { 
		}

		@Override 
		public void close() { 
	} 
}

（4）运行程序

（5）在 hadoop104 上启动生产者

[root@hadoop104 kafka]$ bin/kafka-console-producer.sh \ 
--broker-list hadoop102:9092 --topic first 

>hello>>>world 
>>aaa>>>bbb
>>hahaha

（6）在 hadoop103 上启动消费者



![img](https://img-blog.csdnimg.cn/img_convert/a4afa01563fa3e58e6f84f2de4265628.png)
![img](https://img-blog.csdnimg.cn/img_convert/98556c6a4adea4a2fe89a9502c2c5c69.png)
![img](https://img-blog.csdnimg.cn/img_convert/f5bf2994922f35376ef3b207fffc2718.png)

**既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，涵盖了95%以上大数据知识点，真正体系化！**

**由于文件比较多，这里只是将部分目录截图出来，全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频，并且后续会持续更新**

**[需要这份系统化资料的朋友，可以戳这里获取](https://bbs.csdn.net/forums/4f45ff00ff254613a03fab5e56a57acb)**

正体系化！**

**由于文件比较多，这里只是将部分目录截图出来，全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频，并且后续会持续更新**

**[需要这份系统化资料的朋友，可以戳这里获取](https://bbs.csdn.net/forums/4f45ff00ff254613a03fab5e56a57acb)**

2401_84164721

关注

18
点赞
踩
5

收藏

觉得还不错? 一键收藏
0
评论
【Kafka】（二十四）轻量级流计算 Kafka Streams 实践总结_轻量级流式计算处理(1)

第一，Spark 和 Storm 都是流式处理框架，而 Kafka Streams 提供的是一个基于 Kafka 的流式处理类库。框架要求开发者按照特定的方式去开发逻辑部分，供框架调用。开发者很难了解框架的具体运行方式，从而使得调试成本高，并且使用受限。而 Kafka Streams 作为流式处理类库，直接提供具体的类给开发者调用，整个应用的运行方式主要由开发者控制，方便使用和调试。
复制链接

扫一扫