大数据
大数据指的是那些数据量特别大,数据类型特别复杂的数据集。这些数据集无法使用传统的数据库进行存储、管理和处理。大数据的主要特点为:数据量大(Volume),数据类型特别复杂(Variety),数据处理速度快(Velocity)和数据真实性高(Veracity)。
学习路线
1. 数据采集,主要包括flume等;
2. 数据存储,海量数据怎样有效的存储,主要包括hdfs、Kafka;
3. 数据计算,海量数据怎样快速计算,主要包括MapReduce、Spark、storm等;
4. 数据查询,海量数据怎样快速查询,主要为Nosql和Olap,Nosql主要包括Hbase、 Cassandra 等,其中olap包括kylin、impla等,其中Nosql主要解决随机查询,Olap技术主要解决关联查询;
5. 数据挖掘,海量数据怎样挖掘出隐藏的知识,也就是当前火热的机器学习和深度学习等技术,包括TensorFlow、mahout、spark等。
Hadoop发行版
Apache Ambari是Hortonworks开源的Hadoop平台的管理软件,基于Web界面友好,提供Web UI进行可视化的集群管理、运维等基本功能,支持Apache Hadoop集群的供应、管理和监控。Ambari已支持大多数Hadoop组件,包括HDFS、MapReduce、Hive、Pig、 Hbase、Zookeeper、Sqoop等,简化了大数据平台的安装、使用难度。
Hadoop生态圈
Hadoop 是 Apache 旗下的一套开源软件平台,Hadoop 可以利用计算机集群,根据用户自定义的业务逻辑对海量数据进行分布式处理,通常我们说的 Hadoop 是指一个更广泛的概念--Hadoop 生态圈。
Hadoop 生态圈是指以 Hadoop 为基础发展出来的一系列技术。这些技术都是为了解决大数据处理过程中不断出现的新问题而产生的。
图中包含目前最流行的两个大数据处理框架 Hadoop 和 Spark。蓝色部分是 Hadoop 的生态圈组件,黄色部分是 Spark 生态圈组建。这两个框架之间的关系并不是互斥的,它们之间既有合作,补充又有竞争。比如 Spark 提供的实时内存计算是比 Hadoop 中 MapReduce 快的多的技术,但是 Spark 又依赖于 Hadoop 中的 HDFS 来存储数据。