【关注小阿giao,带你学Spark】

最新推荐文章于 2025-05-27 21:33:52 发布

fx5566321

最新推荐文章于 2025-05-27 21:33:52 发布

阅读量265

点赞数 4

文章标签： spark 大数据分布式

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/2301_81620548/article/details/136451866

版权

Spark概述

Spark是一个用于大规模数据处理的统一计算引擎。

spark的特点

1快速

2 易用性 ØSpark支持使用Scala、Python、Java及R语言快速编写应用。同时Spark提供超过80个高阶算子，使得编写并行应用程序变得容易，并且可以在Scala、Python或R的交互模式下使用Spark。

3 通用性 ØSpark可以与SQL、Streaming及复杂的分析良好结合。Spark还有一系列的高级工具，包括Spark SQL、MLlib（机器学习库）、GraphX（图计算）和Spark Streaming（流计算），并且支持在一个应用中同时使用这些组件。

4 随处运行 Ø用户可以使用Spark的独立集群模式运行Spark，也可以在EC2（亚马逊弹性计算云）、Hadoop YARN或者Apache Mesos上运行Spark。并且可以从HDFS、Cassandra、HBase、Hive、Tachyon和任何分布式文件系统读取数据。

5 代码简洁

Spark的生态圈

Ø Spark Core

Spark的核心，提供底层框架及核心支持。

Ø BlinkDB

一个用于在海量数据上进行交互式SQL查询的大规模并行查询引擎，允许用户通过权衡数据精度缩短查询响应时间，数据的精度将被控制在允许的误差范围内。

Ø Spark SQL

可以执行SQL查询，支持基本的SQL语法和HiveQL语法，可读取的数据源包括Hive、HDFS、关系数据库（如MySQL）等

了解Spark架构

基本组件：

Ø Cluster Manager

资源管理器，即在集群上获取资源的外部服务，目前主要有Standalone（Spark原生的资源管理器）和YARN（Hadoop集群的资源管理器）。

Ø SparkWorker

集群中任何可以运行应用程序的节点，运行一个或多个Executor进程。

Ø Cluster Manager

资源管理器，即在集群上获取资源的外部服务，目前主要有Standalone（Spark原生的资源管理器）和YARN（Hadoop集群的资源管理器）。

Ø SparkWorker

集群中任何可以运行应用程序的节点，运行一个或多个Executor进程。

了解Spark核心数据集RDD

Ø Spark RDD 转换和操作示例

了解Spark核心原理

宽依赖与窄依赖

Ø 窄依赖：表现为一个父 RDD 的分区对应于一个子 RDD 的分区或者多个父 RDD 的分区对应于一个子 RDD 的分区。

Ø 宽依赖：表现为存在一个父 RDD 的一个分区对应一个子 RDD 的多个分区。

•

博客等级

码龄1年

2
原创

21
点赞

19
收藏

18
粉丝

关注

私信

热门文章

下一篇：: spark的方法

最新评论

spark的方法
普通网友: 优质好文，博主的文章细节很到位，兼顾实用性和可操作性，感谢博主的分享，文章思路清晰【我也写了一些相关领域的文章，希望能够得到博主的指导，共同进步！】
spark的方法
CSDN-Ada助手: 非常棒的博文！你对Spark的方法有着深入的了解，而且写得非常清晰易懂。继续保持创作吧！另外，除了文章提到的consolidate机制和execution内存外，你还可以了解一下Spark中的容错机制，了解如何处理任务失败、数据丢失等情况，进一步提升你的Spark应用的稳定性和可靠性。希望你在学习和实践中不断进步！如何写出更高质量的博客，请看该博主的分享：https://blog.csdn.net/lmy_520/article/details/128686434?utm_source=csdn_ai_ada_blog_reply2

最新文章

spark的方法

目录

展开全部

收起

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。