大数据工程师学习计划

wwdede

于 2019-08-10 21:34:09 发布

阅读量1.7k

点赞数 3

文章标签：大数据大数据工程师大数据开发大数据学习

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/wwdede/article/details/99114922

版权

申明：本文旨在为普通程序员（Java程序员最佳）提供一个入门级别的大数据技术学习路径，不适用于大数据工程师的进阶学习，也不适用于零编程基础的同学。

前言

一、背景介绍

本人目前是一名大数据工程师，项目数据50T，日均数据增长20G左右，个人是从Java后端开发，经过3个月的业余自学成功转型大数据工程师。

二、大数据介绍

大数据本质也是数据，但是又有了新的特征，包括数据来源广、数据格式多样化（结构化数据、非结构化数据、Excel文件、文本文件等）、数据量大（最少也是TB级别的、甚至可能是PB级别）、数据增长速度快等。

如果你对大数据开发感兴趣，想系统学习大数据的话，可以加入大数据技术学习交流扣群：数字4583+数字45782，私信管理员即可免费领取开发工具以及入门学习资料

针对以上主要的4个特征我们需要考虑以下问题：

数据来源广，该如何采集汇总？对应出现了Sqoop，Cammel，Datax等工具。

数据采集之后，该如何存储？对应出现了GFS，HDFS，TFS等分布式文件存储系统。

由于数据增长速度快，数据存储就必须可以水平扩展。

数据存储之后，该如何通过运算快速转化成一致的格式，该如何快速运算出自己想要的结果？

对应的MapReduce这样的分布式运算框架解决了这个问题；但是写MapReduce需要Java代码量很大，所以出现了Hive，Pig等将SQL转化成MapReduce的解析

最低0.47元/天解锁文章

关注

3
点赞
踩
24

收藏

觉得还不错? 一键收藏
2
评论
大数据工程师学习计划

申明：本文旨在为普通程序员（Java程序员最佳）提供一个入门级别的大数据技术学习路径，不适用于大数据工程师的进阶学习，也不适用于零编程基础的同学。前言一、背景介绍本人目前是一名大数据工程师，项目数据50T，日均数据增长20G左右，个人是从Java后端开发，经过3个月的业余自学成功转型大数据工程师。二、大数据介绍大数据本质也是数据，但是又有了新的特征，包括数据来源广、数据格式多样...
复制链接

扫一扫

评论 2

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。