2021-02-28

最新推荐文章于 2022-11-23 17:14:58 发布

qq_46066529

最新推荐文章于 2022-11-23 17:14:58 发布

阅读量187

点赞数

本文链接：https://blog.csdn.net/qq_46066529/article/details/114214785

版权

                       ***Spark***

简介
Spark最初由美国加州大学伯克利分校（UC Berkeley）的AMP实验室于2009年开发，是基于内存计算的大数据并行计算框架，可用于构建大型的、低延迟的数据分析应用程序。
2013年Spark加入Apache孵化器项目后发展迅猛，如今已成为Apache软件基金会最重要的三大分布式计算系统开源项目之一。
特点
①运行速度快：使用DAG执行引擎以支持循环数据流与内存计算。
②容易使用：支持使用Scala、Java、Python和R语言进行编程，可以通过Spark Shell进行交互式编程。
③通用性：Spark提供了完整而大的技术栈，包括SQL查询、流式计算、机器学习和图算法组件。
④运行模式多样：可运行于独立的集群模式中，可运行于Hadoop中，也可运行于Amazon EC2等云环境中，并且可以访问HDFS、Cassandra、HBase、Hive等多种数据源。
Hadoop与Spark的对比
1.Hadoop存在如下一些缺点：
表达能力有限
磁盘IO开销大
延迟高
任务之间的衔接涉及IO开销
在前一个任务执行完成之前，其他任务就无法开始，难以胜任复杂、多阶段的计算任务
Spark在借鉴Hadoop MapReduce优点的同时，很好地解决了MapReduce所面临的问题
2.Spark主要具有如下优点：
Spark的计算模式也属于MapReduce，但不局限于Map和Reduce操作，还提供了多种数据集操作类型，编程模型比Hadoop MapReduce更灵活
Spark提供了内存计算，可将中间结果放到内存中，对于迭代运算效率更高
Spark基于DAG的任务调度执行机制，要优于Hadoop MapReduce的迭代执行机制
Spark运行基本流程
（1）首先为应用构建起基本的运行环境，即由Driver创建一个SparkContext，进行资源的申请、任务的分配和监控
（2）资源管理器为Executor分配资源，并启动Executor进程
（3）SparkContext根据RDD的依赖关系构建DAG图，DAG图提交给DAGScheduler解析成Stage，然后把一个个TaskSet提交给底层调度器TaskScheduler处理；Executor向SparkContext申请Task，Task Scheduler将Task发放给Executor运行，并提供应用程序代码
（4）Task在Executor上运行，把执行结果反馈给TaskScheduler，然后反馈给DAGScheduler，运行完毕后写入数据并释放所有资源

虽然Spark很快，但现在在生产环境中仍然不尽人意，无论扩展性、稳定性、管理性等方面都需要进一步增强

qq_46066529

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
2021-02-28

***Spark***简介Spark最初由美国加州大学伯克利分校（UC Berkeley）的AMP实验室于2009年开发，是基于内存计算的大数据并行计算框架，可用于构建大型的、低延迟的数据分析应用程序。2013年Spark加入Apache孵化器项目后发展迅猛，如今已成为Apache软件基金会最重要的三大分布式计算系统开源项目之一。特点①运行速度快：使用DAG执行引擎以支持循环数据流与内存计算。②容易使用：支持使用Scala、Java、Python和...
复制链接

扫一扫