2021-1-8 大数据期末复习

大数据期末复习

第1章 大数据概述
1、应用:金融、汽车、零售、餐饮、电信、能源、政务、医疗、体育、娱乐、思维方式、社会发展、就业市场、人才培养。
2、4v特征:volume大量化、velocity快速化、variety多样化、value价值化。
3、大数据的两大核心技术:分布式存储:GFS/HDFS、BigTable/HBase、NoSQL;分布式处理:MapReduce。
4、批处理计算:针对大规模数据的批量处理。MapReduce、Spark。
流计算:针对流数据的实时计算。Storm、S4、Flume、Streams、Puma、DStream、SuperMario、银河流数据处理平台。
图计算:针对大规模图结构数据的处理。Pregel、GraphX、Giraph、PowerGraph、Hama、GoldenOrb。
查询分析计算:大规模数据的存储管理和查询分析。Dremel、Hive、Cassandra、Impala。
5、云计算、大数据和物联网代表了IT领域最新的技术发展趋势,三者相辅相成,既有联系又有区别。
云计算为大数据提供了技术基础;大数据为云计算提供用武之地。云计算为物联网提供海量数据存储能力;物联网为云计算技术提供了广阔的应用空间。物联网是大数据的重要来源;大数据技术为物联网数据分析提供支撑。

第2章 大数据处理架构Hadoop
1、发展历史:Apache软件基金会旗下的开源分布式平台,基于Java语言开发,具有很好的跨平台性,核心是分布式文件系统HDFS和MapReduce。Hadoop源自始于Apache Nutch项目。
2、特性:高可靠性、高效性、高可扩展性、高容错性、成本低、运行在Linux平台、支持多种编程语言。
3、Hadoop1.0与Hadoop2.0的区别:Hadoop2.0增加了HDFS HA和YARN两个系统。
4、Hadoop2.0生态系统:HDFS:分布式文件系统;MapReduce:分布式并行编程模型;YARN:资源管理和调度器;Tez:运行在YARN之上的下一代Hadoop查询处理框架;Hive Hadoop上的数据仓库;HBase Hadoop上的非关系型的分布式数据库;Pig 一个基于Hadoop的大规模数据分析平台,提供类似SQL的查询语言Pig Latin Sqoop 用于在Hadoop与传统数据库之间进行数据传递;Oozie Hadoop上的工作流管理系统;Zookeeper 提供分布式协调一致性服务;Storm 流计算框架;Flume 一个高可用的,高可靠的,分布式的海量日志采集、聚合和传输的系统;Ambari Hadoop快速部署工具,支持Apache Hadoop集群的供应、管理和监控;Kafka 一种高吞吐量的分布式发布订阅消息系统,可以

  • 0
    点赞
  • 8
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值