介绍一个数据血缘的项目 OpenLineage

“大数据”这个概念逐渐深入人心,很多公司都面临的着:工具和平台的数量爆炸式增长越来越多的人开始使用数据、应用数据对于一个大企业而言,每个子公司/部门可能都有着属于自己的数据团队...
摘要由CSDN通过智能技术生成

背景

“大数据”这个概念逐渐深入人心,很多公司都面临的着:

  • 工具和平台的数量爆炸式增长

  • 越来越多的人开始使用数据、应用数据

  • 对于一个大企业而言,每个子公司/部门可能都有着属于自己的数据团队

总的来说,就是“大数据”中的“大”不仅仅是数据量大,也指的是数据种类多、数据来源复杂,不同的数据被各式各样的人使用。如何发现数据,确定数据的来龙去脉就成了一个急迫的问题。

OpenLineage 应运而生。

介绍 OpenLineage

OpenLineage 可以翻译成开源血缘。按照这个项目的发起者 Julien Le Dem 的说法,“数据血缘需要遵循开源社区贡献者商定的标准,以保证其各自解决方案生成的元数据的兼容性和一致性。”

Data lineage needs to follow a standard agreed upon by contributors to the open source community to guarantee the compatibility and consistency of the metadata produced by their respective solutions.

它回答的问题是:“谁生产数据?它是如何转变的?谁在使用它?数据血缘是 DataOps 的支柱,它提供了对组织内数据旅程中系统和数据集交互的可见性。”

Data lineage is the backbone of DataOps, providing visibility into the interaction of systems and datasets across the journey of data within an organization.

也给出了一个可用

  • 0
    点赞
  • 7
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
datahub是一款开源的数据血缘管理工具。数据血缘是指数据在整个生命周期中的源头、传递和转化关系。它记录了数据的来源、处理方式以及数据被使用的方式,为数据管理和数据引用提供了关键的支持与便利。 datahub提供了一系列功能来实现对数据血缘的管理。首先,它可以跟踪数据的源头,记录数据的产生、获取和生成过程。这样可以帮助用户追溯数据的来源,了解数据的可信程度。此外,datahub还可以记录数据处理的每一步骤,包括数据的清洗、转换、计算等。这有助于用户了解数据的修改历史和数据的一致性。 其次,datahub提供了数据血缘的可视化展示功能。用户可以通过图形界面直观地了解数据的流动和关系,以及每个数据节点的属性和状态。这方便用户在数据管理和数据分析过程中做出决策。同时,datahub还支持数据血缘的查询和搜索,用户可以根据关键词来查找特定数据血缘关系,提高数据的查找效率。 另外,datahub还提供了数据血缘的版本管理功能。用户可以保存数据血缘的不同版本,方便管理和比较不同版本之间的差异。这为数据的更新和迭代提供了便利。 总而言之,datahub是一个功能强大的数据血缘管理工具,可以帮助用户追溯数据的流动和转换关系,提高数据管理和分析的效率与准确性。它的开源特性使得用户可以根据自己的需求来自定义功能和扩展,进一步发挥其潜力。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值