最全数据仓库(基础篇）——基于维度建模思想_数据仓库维度穷举举例

2401_84170414

于 2024-05-04 17:19:52 发布

阅读量604

点赞数 16

分类专栏：程序员文章标签：数据仓库大数据 spark

本文链接：https://blog.csdn.net/2401_84170414/article/details/138445741

版权

主要作用：

为了解耦合、分布执行、降低出问题的风险。
用空间换时间用多步换取最终使用的数据的高效性。
指标或者报表出问题了，可以快速的进行溯源。

分层更多的是一个逻辑上的概念。

分域：分为主题域和数据域。主题域与数据域严格意义上并没有标准划分。主题域一般是面向分析用的，主题域通常是联系较为紧密的数据主题的集合，比如财务主题域、人力主题域、供应链主题域等。数据域一般指的是一组/ 一串/ 一类业务活动单元的集合，如日志、交易等。

分类：严格意义上来说其不属于数据仓库常见的一个概念，其更多的是对应用系统的数据进行一个分类。我们知道数据仓库的上游基本上都来自于业务数据库、日志的信息、爬虫或者其他的第三方的数据。针对这些数据我们需要进行分类。只有分类才能更好的管理与使用，所以我们一般为了更好的管理数据，会把数据划分为主数据、交易数据、参考数据、元数据等。业务系统数据的一个划分。

维度：由独立不重叠的数据元素组成的数据集，所构成的可进行统计的对象。常见的如人、产品、地点。维度通俗来说就是我们观察某一事物的一个角度。

事实：描述业务过程的度量(最小单体)。

粒度：事实表中一条记录所表达的业务细节程度。

维度与事务的区分，比如说在sql中，如果能够使用where条件判断的话，那么其就是一个维度。

2. 拓展

业务过程：业务过程代表一个被管理实体或系统的事实，是对业务活动单元/ 事件的定义。常见的如下单、支付。基本上把它划分为最小的一个单元体。

原子指标：原子指标一般情况下划分为基础指标(原子指标)、复合指标、派生(衍生)指标等等，不同公司会稍有不同。原子指标是对业务事实中度量的统计定义，与SQL中select内容等价。常见的如支付金额、买家数。

业务限定 ：业务限定是对业务中圈选的统计范围的定义，与SQL中where条件等价。常见的如商品品类、已支付。

派生指标：派生指标即常规的统计指标，通过原子指标与各种业务限定的组合而生成。如最近一天或者最近一个月买家支付金额。

汇总逻辑表：描述维度统计信息（即派生指标）及维度属性信息的数据集合集，所构成的数据仓库模型。

三、数据仓库建设步骤

1.建设步骤

需求调研
数据仓库与业务关系是较为紧密的。一个数仓项目的成败，很大程度上取决于你对整个公司的了解程度。比如说刚刚对各个主题域的划分。如果说你对你们公司的整体的业务都不熟悉，怎么进行划分。如果对业务不熟，你是构建不出来的。
数据调研
首先我们需要对整个的业务流程有所了解，业务流程是通过怎样的系统承接下来的。在承接的过程中，我们的数据他是什么样的结构，数据量是多少，数据质量如何等等，这些都是我们需要去了解的。
构建总线矩阵
总线矩阵个人认为更多的是为了帮助我们更好的统一规划数据仓库，也是为了更加的标准化。关于总线矩阵是怎么划分的？下面简单的说下，通常为一行代表业务过程。每一列是一个维度。在数仓建设的过程中，对一次性维度、一次性事实是有要求的。前面说过，在整个数仓的过程中，我们需要统一整个公司的数据的指标的口径，包括数据的一些认知等等，所以需要构建数据的总线矩阵。
构建CRUD矩阵
我们需要对每一个实体的创建、更新、删除等。比如说在整数仓中，我们选择一个维度，一般面临两个步骤：选择主维表和进

最低0.47元/天解锁文章

2401_84170414

关注

16
点赞
踩
14

收藏

觉得还不错? 一键收藏
0
评论
最全数据仓库(基础篇）——基于维度建模思想_数据仓库维度穷举举例

分层更多的是一个逻辑上的概念。：分为主题域和数据域。主题域与数据域严格意义上并没有标准划分。主题域一般是面向分析用的，主题域通常是联系较为紧密的数据主题的集合，比如财务主题域、人力主题域、供应链主题域等。数据域一般指的是一组/ 一串/ 一类业务活动单元的集合，如日志、交易等。：严格意义上来说其不属于数据仓库常见的一个概念，其更多的是对应用系统的数据进行一个分类。我们知道数据仓库的上游基本上都来自于业务数据库、日志的信息、爬虫或者其他的第三方的数据。针对这些数据我们需要进行分类。
复制链接

扫一扫