从0到1搭建数仓,可以概括为6个步骤:业务探查、技术选型、规范制定、主题域划分、数仓分层、模型建设。
一、业务探查
梳理公司业务系统,业务关心的指标,开发过的需求。一般业务关心的数据集中在两三类数据上
二、技术选型
根据已有的数据,选择技术平台,及开发语言。Deloitte已经选好用CDH,这步可以不考虑
三、规范制定
在数仓建设阶段,我们只需要制定数仓相关的规范。
如:分层设计规范、表命名规范、字段命名规范、层次调度规范、脚本开发规范
。网上都有这些规范的相关文章,需要结合公司情况改一下。
这些规范最好在开发前,整理成一个简单的文档,这样方便我们数仓的维护。
备注:数仓建设完成后,可能会设计元数据管理、数据质量、和指标管理。这些模块在开展之前也需要制定相关的规范。但是我们在数仓搭建的时候不用考虑这些问题。
3.1、数仓开发规范参考
提供部分数仓开发规范参考
0) 分层设计规范
一般包括ods\dwd\dim\dws\ads.每一层都有各自的功能
1)表命名规范
包括ods、非ods层命名规范、手工维护表、层次调度规范
- ods命名规范:ods+源系统库+数据库类型+源表名+加载方式+是否分区
- 非ods命名规范:分层前缀+业务域+业务过程+更新方式+时间粒度+是否分区