如果把大数据比拟成一个城市？可以全面瓦解大数据系统的理解难度

最新推荐文章于 2024-10-05 11:27:00 发布

小迪和夫人

最新推荐文章于 2024-10-05 11:27:00 发布

阅读量276

点赞数

文章标签：大数据大数据学习机器学习

我暂且就按照一个由远及近的顺序，按照时间的早晚从大数据出现之前的时代讲到现在。暂时按一个城市来比喻吧，反正Landscape的意思也大概是”风景“的意思。

早在大数据概念出现以前就存在了各种各样的关于数学、统计学、算法、编程语言的研究、讨论和实践。这个时代，算法以及各种数学知识作为建筑的原料(比如钢筋、砖块)，编程语言作为粘合剂(比如水泥)构成了一座座小房子(比如一个应用程序)，形成了一小片一小片的村庄(比如一台服务器)。这个时代村与村之间还没有高速公路(GFS, HDFS, Flume, Kafka等)，只有一条泥泞不好走的土路(比如RPC)，经济模式也是小作坊式的经济。

一开始互联网并不发达，网速也不快，这种老土的方式完全应付得来，可是随着社交网络和智能手机的兴起，改变了这一切。网站流量成百上千倍的提高，数据变得更加多样化，计算机硬件性能无法按照摩尔定律稳定的提升，小村庄，小作坊生产的模式注定受到限制。人们需要更强大的模式...

起开始，人们以为只要有一个强大的中央数据库，也就是在所有的村庄之间建一座吞吐量巨大，并且兼容并蓄(非关系型，NoSQL)的仓库，用来中转每个村庄生产的大量异质货物就能够拉动经济的增长。可是没过多久，人们就意识到这是一个too young to simple的想法，因为这个仓库的大小也总是有上限的。

之后MapReduce的概念最早由google提出，用来解决大规模集群协同运算的问题，既然一台计算机性能有限，何不将他们联合起来？其野心勃勃，希望为每个村庄都建立一条”村村通“公路，也就是GFS了，就是Google分布式文件系统的意思，将不同服务器的硬盘连接起来，在外面看起来就好像一块巨大的硬盘。然后构建与其上的MapReduce就是一座工厂调度每个村庄的劳动力和物资，让这些村庄作为一个经济体运转起来。居民变得富裕起来了。

不过，富裕起来的只有”谷歌镇“，世界的其他村镇仍然过着原始的生活。这个时候雅虎和Apache的一帮人本着独乐乐不如众乐乐的精神，仿造google的思想，创建了HDFS(Hadoop 分布式文件系统，对应GFS)、Hadoop(对应google的MapReduce)，并公开了全部的蓝图，供全世界免费使用。这样整个世界到处都建立起来了工厂，人们变得富裕起来了。这个时代，Hadoop叫做大数据基础设施。

俗话说：饱暖思淫欲，工厂的领导不满足于村镇工厂的粗放型生产，也不再想雇用那么多的劳动力，所以Mahout、HBase、Hive、Pig应运而生，他们都是数控机床，加工中心，只需要几名操作手就能够让整个工厂运转起来，自此人们安居乐业，丰衣足食。

当然，少数更有野心的资本家，不满足于现在的生产力，为了追求更高的利润（这是资本主义的本质），开发了效率更高的系统Spark，可以10倍于Hadoop的速度生产产品，新的时代才刚刚拉开序幕...

这一块关注过很久了，目前很多很成熟的组件。这是一张生态图，我大多数都在本文中介绍过了，主要的组件都是为了方便大家从底层的MapReduce模型中脱离出来，用高层语言来做分布式计算。

如果把大数据比拟成一个城市？可以全面瓦解大数据系统的理解难度

HBase：

是一个高可靠性、高性能、面向列、可伸缩的分布式存储系统，利用HBase技术可在廉价PC Server上搭建起大规模结构化数据集群。像Facebook，都拿它做大型实时应用 Facebook's New Realtime Analytics System: HBase to Process 20 Billion Events Per Day

Pig：

Yahoo开发的，并行地执行数据流处理的引擎，它包含了一种脚本语言，称为Pig Latin，用来描述这些数据流。Pig Latin本身提供了许多传统的数据操作，同时允许用户自己开发一些自定义函数用来读取、处理和写数据。在LinkedIn也是大量使用。

Hive：

Facebook领导的一个数据仓库工具，可以将结构化的数据文件映射为一张数据库表，并提供完整的sql查询功能，可以将sql语句转换为MapReduce任务进行运行。其优点是学习成本低，可以通过类SQL语句快速实现简单的MapReduce统计。像一些data scientist 就可以直接查询，不需要学习其他编程接口。

Cascading/Scalding：

Cascading是Twitter收购的一个公司技术，主要是提供数据管道的一些抽象接口，然后又推出了基于Cascading的Scala版本就叫Scalding。Coursera是用Scalding作为MapReduce的编程接口放在Amazon的EMR运行。

Zookeeper：

一个分布式的，开放源码的分布式应用程序协调服务，是Google的Chubby一个开源的实现。

Oozie：

一个基于工作流引擎的开源框架。由Cloudera公司贡献给Apache的，它能够提供对Hadoop MapReduce和Pig Jobs的任务调度与协调。

Azkaban:

跟上面很像，Linkedin开源的面向Hadoop的开源工作流系统，提供了类似于cron 的管理任务。

Tez：

Hortonworks主推的优化MapReduce执行引擎，与MapReduce相比较，Tez在性能方面更加出色。

很多初学者，对大数据的概念都是模糊不清的，大数据是什么，能做什么，学的时候，该按照什么线路去学习，学完往哪方面发展，想深入了解，想学习的同学欢迎加入大数据学习企鹅群：四五八三四五七八二，有大量干货（零基础以及进阶的经典实战）分享给大家，并且有清华大学毕业的资深大数据讲师给大家免费授课，给大家分享目前国内最完整的大数据高端实战实用学习流程体系

至于Spark~下回讲解~

如果把大数据比拟成一个城市？可以全面瓦解大数据系统的理解难度