Spark工作原理及基础概念（超详细！）

最新推荐文章于 2024-06-05 19:37:53 发布

bhegi_seg

最新推荐文章于 2024-06-05 19:37:53 发布

阅读量3.5k

点赞数 3

分类专栏：面试学习路线阿里巴巴文章标签： spark big data scala c++ java

本文链接：https://blog.csdn.net/bhegi_seg/article/details/125242943

版权

本文详细介绍了Apache Spark的概述、基本原理、运行模式和集群角色，以及与MapReduce、Storm、Hive的对比。Spark作为一种通用的大数据快速处理引擎，以其内存计算和一站式解决方案著称，提供Spark Core、Spark SQL、Spark Streaming等功能。文章还探讨了Spark的计算速度、容错性、迭代式处理等特性，并阐述了Spark在Hadoop生态中的地位。同时，解释了Spark的运行模式如local、standalone、Yarn和Mesos，以及Spark程序在Yarn上的执行流程。此外，文章通过WordCount程序展示了如何使用Java和Scala进行Spark开发。

摘要由CSDN通过智能技术生成

一、Spark概述

（1）概述

Spark，是一种"One Stack to rule them all"的大数据计算框架，期望使用一个技术堆栈就完美地解决大数据领域的各种计算任务。Apache官方，对Spark的定义就是：通用的大数据快速处理引擎。
Spark使用Spark RDD、Spark SQL、 Spark Streaming，MLlib，GraphX成功解决了大数据领城中，离线批处理、交互式查询、实时流计算、机器学习与图计算等最重要的任务和问题。
Spark除了一站式的特点之外，另外一个最重要的特点，就是基于内存进行计算，从而让它的速度可以达到MapReduce、Hive的数倍甚至数十倍！
现在已经有很多大公司正在生产环境下深度地使用Spark作为大数据的计算框架，包括eBay.Yahool、 BAT、网易、京东、华为、大众点评、优酷土豆、搜狗等等。
Spark同时也获得了多个世界顶级IT厂商的支持，包括IBM、 Intel等。

Spark，是一种通用的大数据计算框架，I正如传统大数据技术Hadoop的MapReduce、Hive引擎，以及Storm流式实时计算引擎等，
Spark包含了大数据领城常见的各种计算框架：比如Spark Core用于离线计算，Spark SQL用于交互式查询，Spark Streaming用于实时流式计算，Spark MILlib用于机器学习，Spark GraphX用于图计算。
Spark主要用于大数据的计算，而Hadoop以后主要用于大数据的存储（比如HDFS、Hive，HBase等），以及资源调度（Yarn）。
Spark+Hadoop的组合，是未来大数据领域最热门的组合，也是最有前景的组合！

（2）Spark整体架构

在这里插入图片描述

（3）Spark特性

在这里插入图片描述

（1）spark 计算速度快

spark将每个任务构建成DAG进行计算，内部的计算过程通过弹性式分布式数据集RDD在内存在进行计算，相比于hadoop的mapreduce效率提升了100倍。

（2）易于使用

spark 提供了大量的算子，开发只需调用相关api进行实现无法关注底层的实现原理。

通用的大数据解决方案

相较于以前离线任务采用mapreduce实现，实时任务采用storm实现，目前这些都可以通过spark来实现，降低来开发的成本。同时spark 通过spark SQL降低了用户的学习使用门槛，还提供了机器学习，图计算引擎等。

（3）支持多种的资源管理模式

学习使用中可以采用local 模型进行任务的调试，在正式环境中又提供了standalone，yarn等模式，方便用户选择合适的资源管理模式进行适配。

最低0.47元/天解锁文章

bhegi_seg

关注

3
点赞
踩
26

收藏

觉得还不错? 一键收藏
0
评论
Spark工作原理及基础概念（超详细！）

Spark，是一种"One Stack to rule them all"的大数据计算框架，期望使用一个技术堆栈就完美地解决大数据领域的各种计算任务。Apache官方，对Spark的定义就是：通用的大数据快速处理引擎。Spark使用Spark RDD、Spark SQL、 Spark Streaming，MLlib，GraphX成功解决了大数据领城中，离线批处理、交互式查询、实时流计算、机器学习与图计算等最重要的任务和问题。Spark除了一站式的特点之外，另外一个最重要的特点，就是基于内存进行计算，从而
复制链接

扫一扫