小白如何入门大数据，资深技术大牛带你回顾学习路线！

最新推荐文章于 2019-11-05 10:52:01 发布

cky8792

最新推荐文章于 2019-11-05 10:52:01 发布

阅读量125

点赞数

文章标签： java 数据库 python

什么是大数据？

其实大数据并不是一种概念，而是一种方法论。简单来说，就是通过分析和挖掘全量的非抽样的数据辅助决策。大数据可以实现的应用可以概括为两个方向，一个是精准化定制，第二个是预测。比如像通过搜索引擎搜索同样的内容，每个人的结果却是大不相同的。再比如精准营销、百度的推广、淘宝的喜欢推荐，或者你到了一个地方，自动给你推荐周边的消费设施等等。

目前市场对大数据相关人才的需求与日俱增，岗位的增多，也导致了大数据相关人才出现了供不应求的状况，从而引发了一波大数据学习的浪潮。

大数据解决什么问题？

大数据解决对海量数据的存储、查询、分析计算等操作，主要应用在利用庞大的数据归类分析用户的偏好，利用用户的历史信息得出相应的统计账单等，将同行业的大公司的数据进行计算分析，可以挖掘出一些隐含价值。

学大数据的基础

1）java SE，EE(SSM)

因为90%的大数据框架都是java写的

2）SQL

特别是sql语句中的查询语句，因为对数据库的操作最多的是查询

使用Hadoop作为大数据的分布式存储、计算和分析 sql的操作会重要

3）Linux

大数据的框架安装在Linux操作系统上

总的来说，大数据处理技术怎么学习呢?在做大数据开发之前，因为Hadoop是高层次的语言开发，需要懂得Java或者Python，很快的就能上手。所有的大数据生态架构都是基于linux系统的基础上的，所以你要有Linux系统的基本知识。如果你不懂Java或者Python还有Linux系统，那么这都是你必学的知识（Java或者Python可二选其一）。

大数据技术的学习顺序？

大数据处理技术怎么学习呢?首先我们要学习Java语言和Linux操作系统，这两个是学大数据的基础，学习的顺序不分前后。

Java：大家都知道Java的方向有JavaSE、JavaEE、JavaME，学大数据要学习那个方向呢?

只需要学习Java的标准版JavaSE就可以了，像Servlet、JSP、Tomcat、Struct、Spring、Hibernate，Mybites都是JavaEE方向的技术在大数据技术里用到的并不多，只需要了解就可以了，当然Java怎么连接数据库还是要知道的，像JDBC一定要掌握一下，有同学说Hibernate或Mybites也能连接数据库啊，为什么不学习一下，我这里不是说学这些不好，而是说学这些可能会用你很多时间，到最后工作中也不常用，我还没看到谁做大数据处理用到这两个东西的，当然你的精力很充足的话，可以学学Hibernate或Mybites的原理，不要只学API，这样可以增加你对Java操作数据库的理解，因为这两个技术的核心就是Java的反射加上JDBC的各种使用。

Linux：因为大数据相关软件都是在Linux上运行的，所以Linux要学习的扎实一些，学好Linux对你快速掌握大数据相关技术会有很大的帮助，能让你更好的理解hadoop、hive、hbase、spark等大数据软件的运行环境和网络环境配置，能少踩很多坑，学会shell就能看懂脚本这样能更容易理解和配置大数据集群。还能让你对以后新出的大数据技术学习起来更快。

好说完基础了，再说说还需要学习哪些大数据技术，可以按我写的顺序学下去。

Hadoop：几乎已经成为大数据的代名词，所以这个是必学的。 Hadoop里面包括几个重要组件HDFS、MapReduce和YARN。

Hadoop的核心就是HDFS和MapReduce，而两者只是理论基础，不是具体可使用的高级应用，通俗说MapReduce是一套从海量源数据提取分析元素最后返回结果集的编程模型，将文件分布式存储到硬盘是第一步，而从海量数据中提取分析我们需要的内容就是MapReduce做的事了。当然怎么分块分析，怎么做Reduce操作非常复杂，Hadoop已经提供了数据分析的实现，我们只需要编写简单的需求命令即可达成我们想要的数据。

记住学到这里可以作为你学大数据的一个节点。

Zookeeper：这是个万金油，安装Hadoop的HA的时候就会用到它，以后的Hbase也会用到它。它一般用来存放一些相互协作的信息，这些信息比较小一般不会超过1M，都是使用它的软件对它有依赖，对于我们个人来讲只需要把它安装正确，让它正常的run起来就可以了。

Mysql：大数据的处理学完了，那么接下来要学习小数据的处理工具Mysql数据库，因为装hive的时候要用到，Mysql需要掌握到什么层度呢?你能在Linux上把它安装好，运行起来，会配置简单的权限，修改root的密码，创建数据库就可以了。这里主要的是学习SQL的语法，因为hive的语法和这个非常相似。

Sqoop：这个是用于把Mysql里的数据导入到Hadoop里的。当然你也可以不用这个，直接把Mysql数据表导出成文件再放到HDFS上也是一样的，当然生产环境中使用要注意Mysql的压力。

Hive：这个东西对于会SQL语法的来说就是神器，它能让你处理大数据变的很简单，不会再费劲的编写MapReduce程序。有的人说Pig那?它和Pig差不多掌握一个就可以了。

Oozie：既然学会Hive了，我相信你一定需要这个东西，它可以帮你管理你的Hive或者MapReduce、Spark脚本，还能检查你的程序是否执行正确，出错了给你发报警并能帮你重试程序，最重要的是还能帮你配置任务的依赖关系。我相信你一定会喜欢上它的，不然你看着那一大堆脚本，和密密麻麻的crond是不是有种“即将崩溃”的感觉。

Hbase：这是Hadoop生态体系中的NOSQL数据库，他的数据是按照key和value的形式存储的并且key是唯一的，所以它能用来做数据的排重，它与MYSQL相比能存储的数据量大很多。所以他常被用于大数据处理完成之后的存储目的地。

Kafka：这是个比较好用的队列工具，队列是干什么的?排队买票你知道不?数据多了同样也需要排队处理，我们可以利用这个工具来做线上实时数据的入库或入HDFS，这时你可以与一个叫Flume的工具配合使用，它是专门用来提供对数据进行简单处理，并写到各种数据接受方的。

Spark：它是用来弥补基于MapReduce处理数据速度上的缺点，它的特点是把数据装载到内存中计算而不是去读慢的要死进化还特别慢的硬盘。特别适合做迭代运算，所以算法流们特别稀饭它。它是用scala编写的。Java语言或者Scala都可以操作它，因为它们都是用JVM的。

总结：

当然除了上述的这些必备技能，后续还有很多地方是需要提高的，比如学习下Python，可以用它来编写网络爬虫，就可以自己造数据了。

最快的学习方法，就是师从行业专家，学习老师多年积累的经验，自己少走弯路达到事半功倍的效果。自古以来，名师出高徒。

来自 “ ITPUB博客 ” ，链接：http://blog.itpub.net/31407649/viewspace-2647342/，如需转载，请注明出处，否则将追究法律责任。

转载于:http://blog.itpub.net/31407649/viewspace-2647342/