主要作用:
- 为了解耦合、分布执行、降低出问题的风险。
- 用空间换时间用多步换取最终使用的数据的高效性。
- 指标或者报表出问题了,可以快速的进行溯源。
分层更多的是一个逻辑上的概念。
分域: 分为主题域和数据域。主题域与数据域严格意义上并没有标准划分。主题域一般是面向分析用的,主题域通常是联 系较为紧密的数据主题的集合, 比如财务主题域、人力主题域、供应链 主题域等。数据域一般指的是一组/ 一串/ 一类业务活动单元的集合, 如日志、交易等。
分类: 严格意义上来说其不属于数据仓库常见的一个概念,其更多的是对应用系统的数据进行一个分类。我们知道数据仓库的上游基本上都来自于业务数据库、日志的信息、爬虫或者其他的第三方的数据。针对这些数据我们需要进行分类。只有分类才能更好的管理与使用,所以我们一般为了更好的管理数据, 会把数据划分为主数据、交易数据、参考数据、元数据等。业务系统数据的一个划分。
维度: 由独立不重叠的数据元素组成的数据集, 所构成的可进行统计的对象。常见的如人、产品、地点。维度通俗来说就是我们观察某一事物的一个角度。
事实: 描述业务过程的度量(最小单体)。
粒度: 事实表中一条记录所表达的业务细节程度。
维度与事务的区分,比如说在sql中,如果能够使用where条件判断的话,那么其就是一个维度。
2. 拓展
业务过程: 业务过程代表一个被管理实体或系统的事实, 是对业务活动 单元/ 事件的定义。常见的如下单、支付。基本上把它划分为最小的一个单元体。
原子指标: 原子指标一般情况下划分为基础指标(原子指标)、复合指标、派生(衍生)指标等等,不同公司会稍有不同。原子指标是对业务事实中度量的统计定义, 与SQL中select内容等价。常见的如支付金额、买家数。
业务限定 : 业务限定是对业务中圈选的统计范围的定义, 与SQL中where条件等价。常见的如商品品类、已支付。
派生指标: 派生指标即常规的统计指标, 通过原子指标与各种业务限定的组合而生成。如最近一天或者最近一个月买家支付金额。
汇总逻辑表: 描述维度统计信息( 即派生指标) 及维度属性信息的数据 集合集, 所构成的数据仓库模型。
三、数据仓库建设步骤
1.建设步骤
- 需求调研
数据仓库与业务关系是较为紧密的。一个数仓项目的成败,很大程度上取决于你对整个公司的了解程度。比如说刚刚对各个主题域的划分。如果说你对你们公司的整体的业务都不熟悉,怎么进行划分。如果对业务不熟,你是构建不出来的。 - 数据调研
首先我们需要对整个的业务流程有所了解,业务流程是通过怎样的系统承接下来的。在承接的过程中,我们的数据他是什么样的结构,数据量是多少,数据质量如何等等,这些都是我们需要去了解的。 - 构建总线矩阵
总线矩阵个人认为更多的是为了帮助我们更好的统一规划数据仓库,也是为了更加的标准化。关于总线矩阵是怎么划分的?下面简单的说下,通常为一行代表业务过程。每一列是一个维度。在数仓建设的过程中,对一次性维度、一次性事实是有要求的。前面说过,在整个数仓的过程中,我们需要统一整个公司的数据的指标的口径,包括数据的一些认知等等,所以需要构建数据的总线矩阵。 - 构建CRUD矩阵
我们需要对每一个实体的创建、更新、删除等。比如说在整数仓中,我们选择一个维度,一般面临两个步骤:选择主维表和进