大规模数据处理入门与实战——10册

最新推荐文章于 2024-01-11 01:11:50 发布

rh@x

最新推荐文章于 2024-01-11 01:11:50 发布

阅读量167

点赞数

分类专栏：图灵程序设计丛书读书笔记文章标签： big data

本文链接：https://blog.csdn.net/xueuihui/article/details/126535019

版权

图灵程序设计丛书读书笔记专栏收录该内容

4 篇文章 0 订阅

订阅专栏

全套书籍包括《Kafka权威指南》、《Flink基础教程》、《数据科学实战》、《SQL反模式》、《SQL必知必会》、《Spark快速大数据分析》、《数据科学入门》、《python数据挖掘入门与实践》、《Hadoop安全：大数据平台隐私保护》和《Hadoop数据分析》。

一、关于Kafka

kafka是一个管理和处理流式数据的流平台数据架构，是成长最快的开源项目之一。在这个平台上可以发布和订阅数据流，并把他们存储起来并进行处理。随着系统的发展与完善，广泛应用于社交网络、大型零售商基础业务流程和银行基础流程中流数据处理。kafka经常被拿来与企业级消息系统、大数据系统（Hadoop）和数据继承或ETL工具进行比较。

kafka一方面像一个消息系统，允许发布和订阅信息流。但是与传统ActiveMQ、Rabbit MQ的差异巨大。首先，Kafka是一个分布式的系统，它不是一个独立运行的broker，而是一个可以灵活伸缩的中心平台，能够处理整个公司多有数据流。其次，Kafka作为数据连接层，提供了数据传递的保障，可复制、持久化和保留时间自主化。最后，Kafka提升了数据处理的高度，消息系统只能够传递信息，而Kafka能够动态地处理派生流和数据集。

另外一方面，Kafka也可以视为实时版的Hadoop。Hadoop可以存储和定期处理大量的数据文件，而Kafka可以存储和持续处理大型的数据流。它们之间的最大不同在于低延时处理和批处理。Hadoop和大数据主要应用与数据分析上，而Kafka因低延迟的特点，更适合用在核心业务应用上。基于Kafka构建的服务直接为业务运营提供支撑，提升用户体验。

Kafka和ETL工具或其他数据集成工具都擅长移动数据，不同之处在于对传统思维的颠覆。Kafka并不是把数据从一个系统拆解出来再塞进另一个系统。而是将现有的应用程序和数据系统连接起来，还能用于加强这些触发相同数据流的应用。

结合上述三个领域的特点，将所有流数据整合在一起，流数据平台变得极具吸引力，因为Kafka这种以流数据为中心点的架构，抓住了流数据是现在数字科技公司核心的这一事实。

二、关于Flink基础教程

Apache Flink作为一种高度创新的开源流处理器，能够在以流为基础的各种计算中获益。Flink不仅可以真正实现事实的容错性分析，还可以分析历史数据，并极大地简化数据处理流程。另外，Flink用同一种底层基础来实现流处理和批处理。因为拥有完备的语义和强大的性能，使得开发简单，容易维护。

三、关于数据科学实战

这并非一本关于机器学习的教科书，而是一本多视角全方位介绍数据科学的图书。它试图对数据科学勾勒出一幅全景图，而在这个过程中更加注重广度而非深度。图书的结构包括统计模型和机器学习算法的概览，深入学习一些模型和算法，提取有效信息并在模型中创建统计变量，数据可视化和社交网络，预测模型和因果分析，数据预处理方法和工程方法。

四、关于SQL反模式

SQL反模式能够帮助SQL程序员更加有效的地面SQL编程中易出错的地方。本书包括逻辑数据库设计反模式、物理数据库设计反模式、查询反模式和应用程序开发反模式。

五、关于SQL必知必会

SQL是广泛使用的数据库语言，很多相关图书讲授的内容太多，很多都不是SQL本身，而是从数据库设计，规范化、关系数据库理论和管理问题等等。本书只是将单纯的SQL只是汇编成书。内容包括简单那的数据检索、较为复杂的联结、子查询、存储过程、游标、触发器以及表约束等。

六、关于Spark快速大数据分析

Spark是一个大数据处理和计算框架，不同于传统的数据处理框架，Spark基于内存的基本类型为一些应用带来了100倍的性能提升。Spark允许用户程序将数据加载到集群内存中用于反复查询，非常适合用于大数据和机器学习，日渐成为了大数据模块之一。

Spark正在初始Hadoop和大数据生态系统发生演变，以更好的支持端到端的大数据分析需求。Spark发展到了Spark streaming、SQL、MLlib、GraphX、SparkR等模块。本书没有深入实现细节，更多关注上层用户的具体用法。但Spark的核心概念以及基本原理也有全面的介绍。Spark只是一个通用计算框架，利用Spark实现的应用才是更有价值所在。

七、关于数据科学入门

该图书致力于帮助读者掌握从事数据科学工作所必须的黑客技能，帮助读者熟悉数学和统计学，即掌握数据科学的核心。

八、关于Python数据挖掘入门与实践

本书讲解了如何利用Python进行数据挖掘。首先Python是一种通用型编程语言，有丰富的第三方库。其次，IPython Notebook开发环境功能富集性强，囊括了代码执行、富文本、公式编辑、绘图、多媒体于一身。再次，书中涉及了大量的经典数据集，涵盖了广泛的数据领域。最后，该书在算法方面介绍了常见的决策树、朴素贝叶斯、支持向量机等，另有深度学习、大数据等。

九、关于Hadoop安全：大数据平台隐私保护

本书的目标人群是管理大数据平台安管的Hadoop管理员，以及需要在大型企业架构中涉及集成Hadoop安全规划的安全架构师。本书介绍了Hadoop的安全概念，包括验证、授权、审计、加密和系统架构。

十、Hadoop数据分析

通过分布是数据存储和并行计算框架、Hadoop已经从集群计算的抽象演变为大数据操作系统。Spark正是基于这一理念构建的，它使得数据科学家能够更加轻松地使用集群计算。该书并没有详细讲解Hadoop（推荐tom white的《Hadoop权威指南》），也不是Spark入门资料（推荐Holden karau的《Spark 快速大数据分析》），也不是讲解分布式存储、并行计算的。

该书将纵览Hadoop生态系统和分布计算，旨在武装数据科学家、统计学家、程序员和对Hadoop感兴趣的人。这可能是Spark、Hive、机器学习、ETL（抽取、转换和加载）操作，关系数据库或者众多与集群计算相关的主题之一。