数据治理,贯穿了前端业务系统,后端数据库系统以及业务终端的数据分析,从源头到终端然后再返回源头,形成的一个闭环负反馈系统。
数据治理主要包括数据规划、数据采集、数据储存管理、数据应用四个方面,需要一套标准化的规范来指导。根据每一个方面的特点,我们可以将数据治理总结为四个字,即“理”、“采”、“存”、“用”。
01理:梳理业务流程,规划数据资源
对于企业来说,每天的实时数据都会超过数据存储字节,哪些用户数据需要采集,这么多的数据放在哪里,如何放,以什么样的方式放?这些问题都是需要事先进行规划的,需要有一套从无序变为有序的流程,这个过程需要跨部门的协作,包括了前端、后端、数据工程师、数据分析师、项目经理等角色的参与。
02采:ETL采集、去重、脱敏、转换、关联、去除异常值
前后端将采集到的数据给到数据部门