spark连接kafka的两种方式

最新推荐文章于 2024-05-29 09:38:05 发布

情深不仅李义山

最新推荐文章于 2024-05-29 09:38:05 发布

阅读量2.8k

点赞数

分类专栏： Kafka 文章标签： kafka 大数据 spark

本文链接：https://blog.csdn.net/weixin_43854618/article/details/107703387

版权

Reciver方式
spark streaming通过Reciver方式获取kafka的数据实质是：在spark程序的Executor中开Reciver来接收来自kafka的数据，然后spark streaming会启动job去处理这些数据。
因为这些数据是存在内存中的，所以这种方式会容易丢失数据，如果要启用高可靠机制，让数据零丢失，就必须启用Spark Streaming的预写日志机制（Write Ahead Log，WAL）。该机制会同步地将接收到的Kafka数据写入分布式文件系统（比如HDFS）上的预写日志中。所以，即使底层节点出现了失败，也可以使用预写日志中的数据进行恢复，但是效率会下降。
Direct
使用Direct这种方式的话，spark会主动地拉取kafka的数据，它会周期性地查询kafka中每个partition中最新的offset。
使用这种方式的优点：
1.简化并行读取
如果要读取多个partition，不需要创建多个输入DStream然后对它们进行union操作。
Spark会创建跟Kafka partition一样多的RDD partition，并且会并行从Kafka中读取数据。
所以在Kafka partition和RDD partition之间，有一个一对一的映射关系。
2.高性能
如果要保证零数据丢失，在基于receiver的方式中，需要开启WAL机制。
这种方式其实效率低下，因为数据实际上被复制了两份ÿ

关注