献给初学者:谈谈如何系统学习大数据?

本文针对大数据初学者,介绍了如何系统地学习大数据。首先,强调了需要掌握编程、数学和统计学基础知识。然后,列出了大数据的三大发展方向:平台搭建/运维、大数据开发/设计/架构和数据分析/挖掘。文章提到了大数据的典型特征,并概述了常见大数据框架,如Hadoop、Hive、MapReduce等。此外,还提供了详细的学习路线,包括Hadoop的安装配置、SQL学习、数据采集工具(如Sqoop、Flume)的使用,以及实时计算框架(如SparkSQL、Storm)。最后,讨论了任务调度系统Oozie、实时处理(如Kafka)和机器学习的入门学习。
摘要由CSDN通过智能技术生成

很多初学者在萌生向大数据方向发展的想法之后,不免产生一些疑问,应该怎样入门?应该学习哪些技术?学习路线又是什么?

所有萌生入行的想法与想要学习Java的同学的初衷是一样的。岗位非常火,就业薪资比较高,,前景非常可观。基本都是这个原因而向往大数据,但是对大数据却不甚了解。

如果你想学习,那么首先你需要学会编程,其次你需要掌握数学,统计学的知识,最后融合应用,就可以想在数据方向发展,笼统来说,就是这样的。但是仅仅这样并没有什么帮助。

 

现在你需要问自己几个问题:

对于计算机/软件,你的兴趣是什么?

是计算机专业,对操作系统、硬件、网络、服务器感兴趣?

是软件专业,对软件开发、编程、写代码感兴趣?

还是数学、统计学专业,对数据和数字特别感兴趣。

你自己的专业又是什么?

如果你是金融专业,你可以学习,因为这结合起来你自己的专业,将让你在只有你专业知识的竞争者之中脱颖而出,毕竟现在AI+已经涉及到金融行业了。

说了这么多,无非就是想告诉你,大数据的三个大的发展方向:

平台搭建/优化/运维/监控;

大数据开发/ 设计/ 架构;

数据分析/挖掘。

请不要问我哪个容易,只能说能挣钱的都不简单。

说一下大数据的四个典型的特征:

数据量大;

数据类型繁多,(结构化、非结构化文本、日志、视频、图片、地理位置等);

商业价值高,但需要在海量数据之上,通过数据分析与机器学习快速的挖掘出来;

处理时效性高,海量数据的处理需求不再局限在离线计算当中。

现如今,为了应对大数据的这几个特点,开源的大数据框架越来越多,越来越强,先列举一些常见的:

文件存储: N、Mesos

日志收集:Flume、Scribe、Logstash、Kibana

消息系统:Kafka、StormMQ、ZeroMQ、RabbitMQ

查询分析:Hive、Impala、Pig、Presto、Phoenix、SparkSQL、Drill、Flink、Kylin、Druid

分布式协调服务:Zookeeper

集群管理与监控:Ambari、Ganglia、Nagios、Cloudera Manager

数据挖掘、机器学习:Mahout、Spark MLLib

数据同步:Sqoop

任务调度:Oozie

是不是眼花缭乱了,上面的这些内容,别谈精通了,就算全部都会使用的,应该也没几个。咱们接下来就大数据开发/ 设计/ 架构方向来了解一下学习路线。

在接下的学习中,不论遇到什么问题,先试试搜索并自己解决。Google首选,其次百度。

于入门者而言,官方文档永远是首选文档。

 

互联网科技发展蓬勃兴起,人工智能时代来临,抓住下一个风口。为帮助那些往想互联网方向转行想学习,却因为时间不够,资源不足而放弃的人。我自己整理的一份最新的大数据进阶资料和高级开发教程,大数据学习群:199加上【427】最后加上210就可以找到组织学习  欢迎进阶中和进想深入大数据的小伙伴加入。

第一章:Hadoop

在大数据存储和计算中Hadoop可以算是开山鼻祖,现在大多开源的大数据框架都依赖Hadoop或者与它能很好的兼容。

关于Hadoop,你至少需要搞清楚这些是什么:

Hadoop 1.0、Hadoop 2.0

MapReduce、HDFS

NameNode、Dat

评论 2
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值