新学期新气象

txy276362

于 2021-02-28 14:59:52 发布

阅读量96

点赞数

分类专栏：笔记

本文链接：https://blog.csdn.net/txy276362/article/details/114223924

版权

笔记专栏收录该内容

6 篇文章 0 订阅

订阅专栏

Spark生态组件介绍
Spark Core：提供了多种资源调度管理，通过内存计算、有向无环图(DAG)等机制保证分布式计算的快速，并引入了RDD的抽象保证数据的高容错性。尤其是定义RDD的API、操作以及这两者上的动作。其他Spark的库都是构建在RDD和Spark Core之上的
Spark SQL：提供通过Apache Hive的SQL变体Hive查询语言（HiveQL）与Spark进行交互的API。每个数据库表被当做一个RDD，Spark SQL查询被转换为Spark操作。引入了新的SchemaRDD，同时内嵌了Catalyst查询优化框架
BlinkDB: 是一个用于在海量数据上运行交互式SQL查询的大规模并行查询引擎，用户使用时要在查询精度和查询时间上做权衡；
Spark Streaming：通过将流数据离散化处理对数据流进行实时处理和控制。Spark Streaming允许程序能够像普通RDD一样处理实时数据
MLBase是Spark生态系统中专注于机器学习的组件，分为4个部署：MLRuntime, MLlib, MLI和ML Optimizer。MLlib：一个常用机器学习算法库，算法被实现为对RDD的Spark操作。这个库包含可扩展的学习算法，比如分类、回归等需要对大量数据集进行迭代的操作。
GraphX：控制图、并行图操作和计算的一组算法和工具的集合。GraphX扩展了RDD API，包含控制图、创建子图、访问路径上所有顶点的操作

Spark具有如下几个主要特点：
•运行速度快：使用DAG执行引擎以支持循环数据流与内存计算
•容易使用：支持使用Scala、Java、Python和R语言进行编程，可以通过Spark Shell进行交互式编程
•通用性：Spark提供了完整而强大的技术栈，包括SQL查询、流式计算、机器学习和图算法组件
•运行模式多样：可运行于独立的集群模式中，可运行于Hadoop中，也可运行于Amazon EC2等云环境中，并且可以访问HDFS、Cassandra、HBase、Hive等多种数据源