Spark
文章平均质量分 60
yield-bytes
Java高级后端、大数据开发、Python高级开发、数据分析与挖掘
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
spark的缓存提升本质以及分区数量和task执行时间的先后
本文通过Spark缓存机制的性能分析实验,展示了RDD持久化对计算效率的提升效果。实验使用145MB的搜狗日志数据,对比了缓存前后的执行差异:首次执行count操作耗时14秒(5个分区),数据被缓存后再次执行仅需7秒(10个分区)。分析发现:(1)缓存避免了重复的Map阶段计算;(2)CPU核数(4核)决定task并行度,任务按核数分批执行;(3)增加分区数量能提升效率(10分区比5分区快1倍)。通过Web UI的Stage和Task监控界面,直观验证了"缓存复用"和"分区并行"对Spark性能优化的关键作原创 2025-05-20 17:40:49 · 1086 阅读 · 0 评论 -
分析Kafka offset管理与Spark Streaming背压速率(待更)
1、背压问题涉及到自动调整ss消费消息的速率,以便让计算处理能力跟接收消息的能力匹配 2、手动管理offset的文章 为何要管理offset 三种场合都需要保证重启ss进程后,能够接着上次消费的位置进行消费 ...原创 2020-03-19 22:21:45 · 704 阅读 · 0 评论 -
基于PySpark整合Spark Streaming与Kafka
本文介绍了基于PySpark整合Spark Streaming和Kafka实现实时消息处理的方案。首先搭建了单机Kafka环境(版本2.11-2.4.0),配置了Zookeeper和Kafka服务,并测试了消息生产消费功能。然后详细说明了Spark Streaming连接Kafka所需的两个关键JAR包,给出了PySpark程序示例,演示了如何通过KafkaUtils.createDirectStream接口实时消费Kafka消息并进行单词计数。程序采用Direct API模式,每5秒统计一次单词频率并输出原创 2020-03-06 23:43:11 · 9255 阅读 · 9 评论 -
Spark DataFrame、Spark SQL、Spark Streaming入门教程
文章目录前言1、RDD、Spark DataFrame、Spark SQL、Spark Streaming2、Spark DataFrame2.1 创建基本的Spark DataFrame2.2 从各类数据源创建Spark DataFrame2.3 Spark DataFrame持久化数据2.4 Dataframe常见的API3、Spark SQL4、Spark Streaming实时计算TCP...原创 2020-01-14 21:50:59 · 2332 阅读 · 0 评论 -
基于PySpark和ALS算法实现基本的电影推荐流程
本文介绍了PySpark的基本原理和常用算子。第一部分通过Py4J库实现Python与Java交互,解释了PySpark的工作原理。第二部分详细列举了PySpark的核心算子,包括数据读取、转换(map、filter、flatMap等)和行动操作(collect等),并附有代码示例。此外,还介绍了键值对RDD的处理方法(如mapValues、subtractByKey等)。这些内容为大数据实时分析项目提供了基础入门知识。原创 2020-01-11 10:23:19 · 5203 阅读 · 0 评论 -
深入理解RDD弹性分布式数据集
文章目录前言1、RDD简介2、创建RDD3、宽依赖和窄依赖4、通过RDD的依赖关系构建DAG计算图5、RDD 持久化6、RDD的checkpointing机制7、Spark分区与RDD分区(待更新) 前言 在前面的博客《深入理解Spark》 深入探讨了Spark架构原理内容,该文提到Stage的划分,为什么要做Stage划分?是为了得到更小的Task计算单元,分发给Executor的线程运行,...原创 2019-12-26 19:37:19 · 1339 阅读 · 0 评论 -
深入理解Spark
本文介绍了Spark实时计算框架的核心概念和架构原理。首先阐述了Spark作为分布式并行计算框架的特点,包括基于内存的迭代式计算、丰富的算子库以及函数式编程风格。接着详细分析了Spark的运行模式(Local、Standalone、YARN、Mesos)及其适用场景,特别适合机器学习等需要多次迭代的计算任务。文章深入解析了Spark的关键术语和运行机制,包括RDD、DAG、Driver、Executor等组件,以及Job、Stage、Task等执行单元之间的关系。最后讨论了Spark在准实时计算场景中的应用原创 2019-12-22 16:31:16 · 1256 阅读 · 0 评论 -
基于YARN HA集群的Spark HA集群
文章目录前言1、yarn HA模式的配置1.1 完整 yarn-site.xml配置1.2 mapred-site.xml的配置文件说明1.3 yarn HA的启动2、spark HA 集群及其基本测试2.1 修改spark配置2.2 启动spark集群3、spark on yarn3.1 spark集群跑在yarn上的两种方式3.2 测试spark on yarn 前言 在前面的《基于h...原创 2019-12-08 18:06:08 · 1372 阅读 · 0 评论 -
基于hadoop3.1.2分布式平台上部署spark HA集群
基于hadoop3.1.2分布式平台上部署spark集群 在此文章《基于Centos7.5完整部署分布式Hadoop3.1.2》里,已经给出详细的hadoop和yarn的部署过程,既然已经解决了大数据开发中“hdfs”的数据存储部署,那么就要考虑如何基于底层分布式文件基础上运行计算框架,以便进行更高层次的应用开发。在本篇文章中,将给出完整部署spark计算框架集群。 1、spark版本(仅列出sp...原创 2019-10-13 22:36:48 · 1755 阅读 · 0 评论
分享