基于kafka和sparkstreaming的实时数据处理系统

目前处理的数据主要是文本数据,挖掘处理也是nlp和一些统计分析的处理,但是采用的流处理的系统框架应该是通用的。体统分为实时部分和H/T+1部分,数据流架构图如下:

这里写图片描述

实时部分开发时考虑的几个主要问题

  1. spark streaming和spark structured streaming的选择
  2. 手动实现spark streaming和zk之间的offset同步和交互,保证exactly-once process和流处理的容错性保证
  3. spark streaming 流处理的参数配置,如消费速率,间隔,backpressure策略等,保证流处理高效性和稳定性
  4. spark streaming 在不重启的情况下进行定时全局变量的更新机制,如依赖词库的更新
  5. 流处理结果持久化方式的选择

具体的解决方法先留个坑,后续再补上。另外,基于流处理效率和具体的业务需求,开发过程中主要将非统计向的,低计算复杂度的放入实时的部分,统计向的,计算需拉取较长时间历史数据的,高计算负责的任务放入非实时的部分。

  • 1
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值