【大数据技术Hadoop+Spark】Spark架构、原理、优势、生态系统等讲解（图文解释）

最新推荐文章于 2025-03-28 14:42:18 发布

showswoller

最新推荐文章于 2025-03-28 14:42:18 发布

阅读量8.2k

点赞数 14

分类专栏：大数据技术Hadoop+Spark 文章标签：大数据 spark hadoop 分布式架构

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/jiebaoshayebuhui/article/details/128356487

版权

一、Spark概述

Spark最初由美国加州伯克利大学（UCBerkeley）的AMP（Algorithms， Machines and People）实验室于2009年开发，是基于内存计算的大数据并行计算框架，可用于构建大型的、低延迟的数据分析应用程序。Spark在诞生之初属于研究性项目，其诸多核心理念均源自学术研究论文。2013年，Spark加入Apache孵化器项目后，开始获得迅猛的发展，如今已成为Apache软件基金会最重要的三大分布式计算系统开源项目之一（即Hadoop、Spark、Storm）

二、Spark的特点

Spark计算框架在处理数据时，所有的中间数据都保存在内存中，从而减少磁盘读写操作，提高框架计算效率。同时Spark还兼容HDFS、Hive，可以很好地与Hadoop系统融合，从而弥补MapReduce高延迟的性能缺点。所以说，Spark是一个更加快速、高效的大数据计算平台。

特点可以概括为以下四点

1：运行速度快

2：容易使用

3：通用性

4：运行模式多样

Spark支持使用Scala Java Python和R语言编程，由于Spark采用Scala语言进行开发，因此建议采用Scala语言进行Spark应用程序的编写，采用Scala语言编写Spark应用程序，可以获得最好的性能，和其他语言相比，Scala主要有以下三个方面的优势

1：Java代码比较繁琐

2：Python语言并发性能不好

3：Scal

最低0.47元/天解锁文章

评论 5

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

showswoller 你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。