spark
文章平均质量分 93
bigdata-rookie
随便写点
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
Spark shuffle 和 MapReduce shuffle 的区别
shuffle 的字面意思是洗牌、混洗的意思,就是把一组有规律的数据尽量打乱成无规律的数据。但在 MapReduce 中 Shuffle 更像是洗牌的逆过程,其将 Map 端输出的混乱数据按指定规则划分成有一定规律的数据,以方便 Reduce 端接收处理。MapReduce 的工作阶段主要可有分为 Map 端和 Reduce 端两个部分。原创 2026-02-01 17:30:42 · 1002 阅读 · 0 评论 -
Spark 运行架构及相关概念
Spark 框架的核心是一个计算引擎,整体来说,它采用了标准的 master-slave 结构。上图中的 Driver 表示 master ,负责管理整个集群中的作业任务调度;Executor 则是 slave,负责实际执行任务;原创 2025-12-11 16:40:41 · 1031 阅读 · 0 评论 -
Spark 数据倾斜解决方案
Spark 中的数据倾斜问题主要指 shuffle 过程中出现的数据倾斜问题,是由于不同的 key 对应的数据量不同导致的不同 task 所处理的数据量不同的问题。原创 2025-11-24 11:32:59 · 316 阅读 · 0 评论 -
Flink Checkpoint 和 Spark Checkpoint 的区别
更像一个“它主要目的是,避免因链路过长导致的性能问题或 StackOverflowError。它是一个** coarse-grained(粗粒度)** 的、的、的容错机制。:是一个“它是 Flink,用于在发生故障时,将整个分布式数据流状态恢复到一致性的检查点,实现或 At-Least-Once 语义。它是一个的、的、的容错机制。简单来说,Spark Checkpoint 是为了解决 RDD 带来的内部问题,而 Flink Checkpoint 是对外提供容错保证的核心特性。原创 2025-11-23 22:46:25 · 1089 阅读 · 0 评论 -
Spark Streaming 简介
特性DStream (微批次)编程模型基于 RDD 的低级 API基于 DataFrame/Dataset 的高级声明式 APIAPI 级别较低级,需手动处理状态、窗口较高级,内置对事件时间、窗口、水位线的支持性能优化无自动优化利用 Spark SQL 的 Catalyst 优化器和 Tungsten 执行引擎延迟秒级(微批次)可达毫秒级(微批次),还有更低延迟的连续处理模式语义保证At-least-once 或 exactly-once(需精心设计)端到端的语义学习曲线。原创 2025-11-23 22:20:47 · 929 阅读 · 0 评论 -
Spark SQL 简介
Spark SQL 是 Spark 用于结构化数据处理的模块,对于开发人员来讲,Spark SQL 可以简化 RDD 的开发,提高开发效率,且执行效率非常快,所以实际工作中,基本上采用的就是 Spark SQL。Spark SQL 为了简化 RDD 的开发,提高开发效率,提供了两个编程抽象,类似 Spark Core 中的 RDD。即 DataFrame 和 DataSet。原创 2025-11-23 21:51:25 · 831 阅读 · 0 评论 -
使用机器学习检测 DGA 域名 — SVM
DGA 是 Domain Generation Algorithm(域名生成算法)的简称,是指使用主控端和被控端协商好的一种基于随机算法的域名生成协议,简单来说就是生成一个随机字符串来作为域名并进行注册,将其作为 C&C 服务器的域名并不定时经常性更换。由于具备强随机性,短时效性,通过 DGA 生成的域名往往在查杀上更具被难度。原创 2025-11-23 15:51:39 · 516 阅读 · 0 评论 -
Spark 部署模式
所谓 Local 模式,就是不需要其他任何节点资源就可以在本地执行 Spark 代码的环境,一般用于教学、调试、演示等。原创 2025-11-20 23:16:29 · 1215 阅读 · 0 评论 -
Spark RDD 介绍
弹性分布式数据集,是 Spark 中最基本的数据处理模型。代码中是一个抽象类,它代表一个弹性的、不可变、可分区、里面的元素可并行计算的集合;原创 2024-07-26 16:19:05 · 675 阅读 · 0 评论
分享