Spark 简介


转载于 www.zicesun.com
之前看了一些Spark的相关内容,我觉得很有必要进行总结一下,不然都搭不起自己的知识框架。

Apache Spark

Apache Spark™是用于大规模数据处理的统一分析引擎,是一个实现快速通用的集群计算平台。它是由加州大学伯克利分校AMP实验室 开发的通用内存并行计算框架,用来构建大型的、低延迟的数据分析应用程序。它扩展了广泛使用的MapReduce计算模型。高效的支撑更多计算模式,包括交互式查询和流处理。spark的一个主要特点是能够在内存中进行计算,及时依赖磁盘进行复杂的运算,Spark依然比MapReduce更加高效。
官网地址:http://spark.apache.org/

Spark的主要特点

  1. 提供Cache机制来支撑需要反复迭代计算或者多次数据共享,减少数据的I/O开销;
  2. 提供支持DAG图的分布式并行计算变成框架,减少多次计算之间中间结果写到HDFS的开销;
  3. 使用多线程池模型来减少Task启动开销,Shuffle操作中避免不必要的sort操作,并减少磁盘操作。

Spark与Hadoop的比较

Hadoop的局限Spark的改进
抽象层次低, 代码编写难易上手通过使用RDD的统一抽象,实现数据处理逻辑的代码非常简洁。
只提供map和reduce两个操作,表达能力有限通过RDD提供了很多transformation和action操作,实现了很多基本的操作,比如Sort,Join等。
一个job只有Map和Reduce两个阶段,复杂的程序需要大量的Job来完成,比起给Job之间的以来关系需要应用户自行管理一个Job可以包含多个RDD转换操作,只需要在调度时生成多个Stage。一个Stage中可以包含多个Map操作,只需要Map操作使用的RDD分区保持不变。
处理逻辑隐藏在代码细节中,缺少整体逻辑视图RDD的转换支持流式API,提供处理逻辑的整体视图
对迭代式的数据处理性能比较差,Reduce与下一步Map之间的中间结果只能保存在HDFS文件系统中通过内存缓存数据,可大大提高迭代式计算的性能,内存不足是可以溢出到磁盘上。
ReduceTask需等待所有MapTask都完成后才开始执行分区相同的转换操作可以在一个Task中以流水线的形式执行,只有分区不同的转换需要Shuffle操作。
时延高,只适用于批数据处理,对交互式数据处理和实时数据处理的支持不够将流拆成小的Batch,提供Discretized Stream处理流数据

Spark主要组件

spark组件

名称功能
SparkCore将分布式数据抽象为弹性分布式数据集(RDD),实现了应用任务调度、RPC、序列化和压缩,并为运行在其上的上层组件提供API。
SparkSQLSpark Sql 是Spark来操作结构化数据的程序包,可以让我使用SQL语句的方式来查询数据,Spark支持 多种数据源,包含Hive表,parquest以及JSON等内容。
SparkStreaming是Spark提供的实时数据进行流式计算的组件。
MLlib提供常用机器学习算法的实现库。
GraphX提供一个分布式图计算框架,能高效进行图计算。
BlinkDB用于在海量数据上进行交互式SQL的近似查询引擎。
Tachyon以内存为中心高容错的的分布式文件系统。

Spark Cluster Managers

cluster manager值集群上获取资源的外部服务器

  1. Standalone: Spark原生的资源管理器,有manager负责资源的分配
  2. Apache Messo: 与Hadoop MR兼容性良好的资源调度框架
  3. Hadoop Yarn: 指yarn中的resourceManager
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
智慧农业是一种结合了现代信息技术,包括物联网、大数据、云计算等,对农业生产过程进行智能化管理和监控的新模式。它通过各种传感器和设备采集农业生产中的关键数据,如大气、土壤和水质参数,以及生物生长状态等,实现远程诊断和精准调控。智慧农业的核心价值在于提高农业生产效率,保障食品安全,实现资源的可持续利用,并为农业产业的转型升级提供支持。 智慧农业的实现依赖于多个子系统,包括但不限于设施蔬菜精细化种植管理系统、农业技术资料库、数据采集系统、防伪防串货系统、食品安全与质量追溯系统、应急追溯系统、灾情疫情防控系统、农业工作管理系统、远程诊断系统、监控中心、环境监测系统、智能环境控制系统等。这些系统共同构成了一个综合的信息管理和服务平台,使得农业生产者能够基于数据做出更加科学的决策。 数据采集是智慧农业的基础。通过手工录入、传感器自动采集、移动端录入、条码/RFID扫描录入、拍照录入以及GPS和遥感技术等多种方式,智慧农业系统能够全面收集农业生产过程中的各种数据。这些数据不仅包括环境参数,还涵盖了生长状态、加工保存、检验检疫等环节,为农业生产提供了全面的数据支持。 智慧农业的应用前景广阔,它不仅能够提升农业生产的管理水平,还能够通过各种应用系统,如库房管理、无公害监控、物资管理、成本控制等,为农业生产者提供全面的服务。此外,智慧农业还能够支持政府监管,通过发病报告、投入品报告、死亡报告等,加强农业产品的安全管理和质量控制。 面对智慧农业的建设和发展,存在一些挑战,如投资成本高、生产过程标准化难度大、数据采集和监测的技术难题等。为了克服这些挑战,需要政府、企业和相关机构的共同努力,通过政策支持、技术创新和教育培训等手段,推动智慧农业的健康发展。智慧农业的建设需要明确建设目的,选择合适的系统模块,并制定合理的设备布署方案,以实现农业生产的智能化、精准化和高效化。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值