大数据学习笔记

最新推荐文章于 2024-03-19 11:56:58 发布

smilinggg

最新推荐文章于 2024-03-19 11:56:58 发布

阅读量802

点赞数 1

文章标签：大数据 flink spark hadoop

本文链接：https://blog.csdn.net/smilinggg/article/details/113935173

版权

本文介绍了大数据的四个特征：Volume、Velocity、Variety、Veracity，探讨了传统数据处理架构中的事务处理和分析处理，重点讲述了批处理与流处理的区别，以及大数据软件生态中的Hadoop、Spark和Flink。批处理适用于处理历史数据，而流处理则适合实时分析。大数据生态中，Hadoop提供分布式文件系统HDFS、资源管理器YARN和MapReduce，Spark强调内存计算加速，Flink专注于流处理并理解事件时间。

摘要由CSDN通过智能技术生成

一.概念

大数据（Big Data）指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合，是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。

四个主要特征：

Volume（数据量）

数据量大是大数据的比较明显的特征，一般是TB级的数据量，并且每天数据的增长量比较大。

在这里插入图片描述

Velocity（速度）

要求数据的处理速度比较快，从数据采集、加工处理、分析到产生价值的速度，能够及时快速的响应，并不能因为数据量大，响应速度就慢下来。

在这里插入图片描述

Variety（多样性）

数据的来源不同，数据类型不同（结构化、非结构化）、比如可能来自网站的日志文件、数据库中库表等。

Veracity（准确性）

因为采集到的数据会掺杂太多的无用信息，需要确保收集到的数据非常准确、准确，否则对虚假的数据做处理也不会产生任何有用价值。如何对有价值数据的“提纯”是目前的待解决的问题

1.传统数据处理架构

数十年来，数据和数据处理在企业中无处不在。多年来，数据的收集和使用一直在增长，公司已经设计并构建了基础架构来管理数据。大多数企业实施的传统架构区分了两种类型的数据处理：事务处理（OLTP）和分析处理（OLAP）。

1.1 事务处理

公司将各种应用程序用于日常业务活动，例如企业资源规划（ERP）系统，客户关系管理（CRM）软件和基于Web的应用程序。这些系统通常设计有单独的层，用于数据处理（应用程序本身）和数据存储（事务数据库系统）

在这里插入图片描述

1.2 分析处理

大量数据存储在公司的各种事务数据库系统中，它们可以为公司业务运营提供宝贵的参考意见。例如，分析订单处理系统的数据，可以获得销量随时间的增长曲线；可以识别延迟发货的原因；还可以预测未来的销量以便提前调整库存。但是，事务数据通常分布在多个数据库中，它们往往汇总起来联合分析时更有价值。而且，数据通常需要转换为通用格式。

所以我们一般不会直接在事务数据库上运行分析查询，而是复制数据到数据仓库。数据仓库是对工作负载进行分析和查询的专用数据存储。为了填充数据仓库，需要将事务数据库系统管理的数据复制过来。将数据复制到数据仓库的过程称为extract-transform-load（ETL）。 ETL过程从事务数据库中提取数据，将其转换为某种通用的结构表示，可能包括验证，值的规范化，编码，重复数据删除（去重）和模式转换，最后将其加载到分析数据库中。 ETL过程可能非常复杂，并且通常需要技术复杂的解决方案来满足性能要求。 ETL过程需要定期运行以保持数据仓库中的数据同步。

将数据导入数据仓库后，可以查询和分析数据。通常，在数据仓库上执行两类查询。第一种类型是定期报告查询，用于计算与业务相关的统计信息，比如收入、用户增长或者输出的产量。这些指标汇总到报告中，帮助管理层评估业务的整体健康状况。第二种类型是即席查询，旨在提供特定问题的答案并支持关键业务决策，例如收集统计在投放商业广告上的花费，和获取的相应收入，以评估营销活动的有效性
在这里插入图片描述
如今，Apache Hadoop生态系统的组件，已经是许多企业IT基础架构中不可或缺的组成部分。现在的做法不是直接将所有数据都插入关系数据库系统，而是将大量数据（如日志文件，社交媒体或Web点击日志）写入Hadoop的分布式文件系统（HDFS）、S3或其他批量数据

最低0.47元/天解锁文章

smilinggg

关注

1
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
大数据学习笔记

大数据学习笔记一.概念二 .批处理与流处理1.批处理2.流处理三.批处理软件1.Hadoop一.概念大数据（Big Data）指无法在一定时间范围内用常规软件工具进行捕捉、管理和处理的数据集合，是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、高增长率和多样化的信息资产。四个主要特征：Volume（数据量）数据量大是大数据的比较明显的特征，一般是TB级的数据量，并且每天数据的增长量比较大。![在这里插入图片描述](https://img-blog.csdnimg.cn/202
复制链接

扫一扫