一文解析维度建模

数据分层

“为什么要设计数据分层?”

	这应该是数据仓库同学在设计数据分层时首先要被挑战的问题,类似的问题可能会有很多,
	比如说“为什么要做数据仓库?”、“为什么要做元数据管理?”、“为什么要做数据质量管
	理?”。当然,这里我们只聊一下为什么要做设计数据分层。

	作为一名数据的规划者,我们肯定希望自己的数据能够有秩序地流转,数据的整个生命周期
	能够清晰明确被设计者和使用者感知到。直观来讲就是如下的左图这般层次清晰、依赖关系
	直观。

	但是,大多数情况下,我们完成的数据体系却是依赖复杂、层级混乱的。如下的右图,在不
	知不觉的情况下,我们可能会做出一套表依赖结构混乱,甚至出现循环依赖的数据体系。

在这里插入图片描述

数据分层的好处

	因此,我们需要一套行之有效的数据组织和管理方法来让我们的数据体系更有序,这就是谈
	到的数据分层。数据分层并不能解决所有的数据问题,但是,数据分层却可以给我们带来如
	下的好处:
  1. 清晰数据结构:

     每一个数据分层都有它的作用域和职责,在使用表的时候能更方便地定位和
     理解减少重复开发:规范数据分层,开发一些通用的中间层数据,能够减少
     极大的重复计算
    
  2. 统一数据口径:

     通过数据分层,提供统一的数据出口,统一对外输出的数据口径复杂问题简
     单化:将一个复杂的任务分解成多个步骤来完成,每一层解决特定的问题
    

维度建模

	为了满足前面提到数据分层带来的好处,我们将数据模型分为三层:数据运营层( ODS 
	)、数据仓库层(DW)和数据应用层(APP)。如下图所示。简单来讲,我们可以理解
	为:**ODS层存放的是接入的原始数据,DW层是存放我们要重点设计的数据仓库中间层数
	据,APP是面向业务定制的应用数据。**下面详细介绍这三层的设计。

在这里插入图片描述

  1. 数据运营层:ODS(Operational Data Store)

     “面向主题的”,数据运营层,也叫ODS层,是最接近数据源中数据的一层,
     数据源中的数据,经过抽取、洗净、传输,也就说传说中的 ETL 之后,装入
     本层。本层的数据,总体上大多是按照源头业务系统的分类方式而分类的。
    
     一般来讲,为了考虑后续可能需要追溯数据问题,因此对于这一层就不建议
     做过多的数据清洗工作,原封不动地接入原始数据即可,至于数据的去噪、
     去重、异常值处理等过程可以放在后面的DWD层来做。
    
  2. 数据仓库层:DW(Data Warehouse)

     数据仓库层是我们在做数据仓库时要核心设计的一层,在这里,从 ODS 层
     中获得的数据按照主题建立各种数据模型。DW层又细分为 DWD(Data 
     Warehouse Detail)层、DWM(Data WareHouse Middle)层和DWS(Data 
     WareHouse Servce)层。
    
    2.1.  数据明细层:DWD(Data Warehouse Detail)
    
     该层一般保持和ODS层一样的数据粒度,并且提供一定的数据质量保证。同
     时,为了提高数据明细层的易用性,该层会采用一些维度退化手法,将维度
     退化至事实表中,减少事实表和维表的关联。
    
     另外,在该层也会做一部分的数据聚合,将相同主题的数据汇集到一张表
     中,提高数据的可用性,后文会举例说明。
    
    2.2.  数据中间层:DWM(Data WareHouse Middle)
    
     该层会在DWD层的数据基础上,对数据做轻度的聚合操作,生成一系列的中
     间表,提升公共指标的复用性,减少重复加工。
    
     直观来讲,就是对通用的核心维度进行聚合操作,算出相应的统计指标。
    
    2.3.  数据服务层:DWS(Data WareHouse Servce)
    
     又称数据集市或宽表。按照业务划分,如流量、订单、用户等,生成字段比
     较多的宽表,用于提供后续的业务查询,OLAP分析,数据分发等。
    
     一般来讲,该层的数据表会相对比较少,一张表会涵盖比较多的业务内容,
     由于其字段较多,因此一般也会称该层的表为宽表。
    
     在实际计算中,如果直接从DWD或者ODS计算出宽表的统计指标,会存在计
     算量太大并且维度太少的问题,因此一般的做法是,在DWM层先计算出多个
     小的中间表,然后再拼接成一张DWS的宽表。由于宽和窄的界限不易界定,
     也可以去掉DWM这一层,只留DWS层,将所有的数据在放在DWS亦可。
    
  3. 数据应用层:APP/ADS(Application Data Source)

    在这里,主要是提供给数据产品和数据分析使用的数据,一般会存放在 ES、
    PostgreSql、Redis等系统中供线上系统使用,也可能会存在 Hive 或者 Druid 
    中供数据分析和数据挖掘使用。比如我们经常说的报表数据,一般就放在这
    里。
    
  4. 维表层:DIM(Dimension )

     最后补充一个维表层,维表层主要包含两部分数据:
    
     高基数维度数据:一般是用户资料表、商品资料表类似的资料表。数据量可
     能是千万级或者上亿级别。低基数维度数据:一般是配置表,比如枚举值对
     应的中文含义,或者日期维表。数据量可能是个位数或者几千几万。至此,
     我们讲完了数据分层设计中每一层的含义,这里做一个总结便于理解,如下
     图。
    

在这里插入图片描述

技术实践

	既然谈到了数据分层,那不同的层次中会用到什么计算引擎和存储系统呢,本节来简单分享一下。
  1. 数据层的存储如下:

     Data Source:数据源一般是业务库和埋点,当然也会有第三方购买数据等多种数据来源方式。业务库的存储一般是Mysql 和 PostgreSql。
    
     ODS 层:ODS 的数据量一般非常大,所以大多数公司会选择存在HDFS上,即Hive或者Hbase,Hive居多。
    
     DW 层:一般和 ODS 的存储一致,但是为了满足更多的需求,也会有存放在 PG 和 ES 中的情况。
     
     APP 层:应用层的数据,一般都要求比较快的响应速度,因此一般是放在 Mysql、PG、Redis中。
    

在这里插入图片描述

  • 1
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值