数仓进行分层的一个主要原因就是希望在管理数据的时候,能对数据有一个更加清晰的掌握。主要有以下优点:
- 划清层次结构:每一个数据分层都有它的作用域,这样我们在使用表的时候能更方便地定位和理解;
- 数据血缘追踪:简单来讲可以这样理解,我们最终给下游是直接使用的业务表,但是它的来源有很多,如果有一张来源表出问题,我们希望能够快速准确地定位到位置,并清楚它的危害范围;
- 减少重复开发:规范数据分层,开发一些通用的中间层数据,能够减少极大的重复计算;
- 把复杂问题简单化:将一个复杂的任务分解成多个步骤来完成,每一层只处理单一的步骤,比较简单和容易理解。而且便于维护数据的准备性,当数据出现问题之后,可以不用修复所有的数据,只需要从有问题的步骤开始修复;
- 屏蔽原始数据的异常:屏蔽业务的影响,不必改一次业务就需要重新接入数据。