- 博客(75)
- 资源 (56)
- 收藏
- 关注
原创 数据治理组织的日常运转:从项目制到常态化运营的转型
很多企业可以完成数据治理从 0 到 1 的项目建设:制度写完、平台上线、完成项目验收。但项目组解散之后,治理快速失活,脏数据反弹、标准无人维护、资产目录逐渐僵尸化。项目制解决的是 “把治理建起来”,常态化运营解决的是 “让治理活下去”。本文围绕治理组织岗位职责、KPI 指标体系、例会与工单闭环机制、以及和 DCMM / 联邦治理的联动关系,给出一套可落地的常态化运营实施方案,回答架构师共同的痛点:项目做完之后,治理怎么活下去。
2026-09-30 15:45:33
167
原创 企业数据治理高频踩坑总结:架构、治理、AI 落地 20 个典型误区与解决方案
很多企业学习 TOGAF 与华为 4A 架构、DCMM、数据网格、AI 就绪等理论,但项目依然失败。失败往往不在于方法论本身,而在于落地执行的认知偏差与操作误区。本文结合多项目实战,整理 20 个高频踩坑,分为组织业务、企业架构、主数据元数据、新型数据架构、成熟度评估、AI 就绪六大类别,拆解现象、根源、可落地解决方案,为数据治理项目提供避坑参考。
2026-09-29 14:22:13
303
原创 华为 PDM 产品四结构:破解多视图产品数据不一致的顶层框架
产品四结构源自公开出版物《华为产品数据是怎样炼成的》,包含商务、逻辑、实现、服务四大产品视图,解决销售、研发、制造、售后各环节产品数据不一致的行业痛点。四结构同源但视角独立,互相支持映射双向追溯,是 X‑BOM 多 BOM 视图的顶层模型。本文拆解四结构定位、业务对象、使用场景,梳理常见认知误区,给出 BOM 对应关系,为高科技制造企业 PDM 建设、产品数据治理提供参考。
2026-09-28 15:21:15
302
原创 从口径混乱到数据驱动:企业指标体系从 0 到 1 建设实战
企业数字化转型常因指标体系混乱而受阻,核心痛点包括口径不一、权责模糊、报表堆砌与缺乏治理。构建高效指标体系需打通价值域、主题域、数据域三层架构,通过“业务分析—框架搭建—指标梳理—标准建设—应用运营”五步法,实现一套口径、多层复用、全域可追溯。关键在于业务主导、数据支撑、流程闭环,建立指标卡片、争议裁决与僵尸指标下线机制,推动数据从“打架”走向“协同”,真正赋能决策。
2026-09-24 14:10:19
338
原创 数据治理落地全流程复盘:从架构设计到 AI 就绪底座搭建的企业完整落地案例
不少企业掌握 TOGAF、DCMM、数据网格等理论,但落地仍存在建设顺序混乱、业务技术割裂等难题。本文基于脱敏综合项目,复盘一家拥有十年信息化积淀的中型集团 18 个月数据治理全过程。遵循业务架构牵引,依次完成架构融合、DCMM 评估整改、数据质量左移、联邦治理底座与主动元数据建设,实现 AI 就绪底座能力储备,明确传统企业 AI 就绪重在底座建设而非直接上线 AI 业务。文章包含阶段交付物、量化成效与避坑反思,为多业务线传统企业提供可复用的端到端实施参考。
2026-09-23 16:22:12
175
原创 AI就绪数据:打造企业智能核心引擎
文章摘要: 随着大模型技术普及,企业AI竞争核心转向数据质量而非算力规模。针对数据"多而乱"的痛点,本文提出"数据就绪"框架:1)通过业务可读性、质量稳定性、获取时效性三项指标评估数据状态;2)优先治理高价值场景数据,签订业务与技术"数据消费契约";3)聚焦质量监控、主数据统一、特征管理三大攻坚战;4)用语义标签和知识图谱增强数据可理解性;5)构建可追溯、可脱敏、可遗忘的合规体系。
2026-06-19 09:11:17
382
原创 大语言模型时代的语义元数据:从静态资产目录到智能治理
摘要: 大语言模型(LLM)正推动元数据管理向智能化升级,通过自动生成描述、推断血缘关系、打标分类等能力,解决传统人工管理效率低下的问题。企业实践显示,LLM可增强数据目录检索、RAG系统知识库及数据质量监控,但面临幻觉、成本、安全等挑战。行业案例(如百分点、Informatica)表明,垂直领域模型与多智能体协作是未来趋势。尽管LLM显著提升效率,其落地需结合规则引擎、人工审核与反馈机制,最终目标是构建动态、对话式的主动元数据体系,而非完全替代人工。技术需与治理框架结合,方能实现可信数据管理。
2026-06-11 16:34:41
449
原创 元数据管理与数据网格的天然结合:支撑联邦治理的数据产品可发现性设计
数据网格如何通过“数据域所有权”和“数据即产品”的理念,将数据管理的责任从中央数据团队分散到业务域,从而打破集中式数据湖/仓库的瓶颈。这听起来很理想:每个域团队都像SaaS厂商一样,对外提供高质、自助的数据产品。
2026-06-03 19:48:48
350
原创 元数据管理演进:从“被动记录”到“主动智能”,企业架构视角的变革历程
摘要:元数据正从静态数据字典向动态"数据大脑"转变,成为企业数据治理的核心。演进分为三个阶段:被动记录(2000-2015)、自动化治理(2015-2022)和主动智能(2022至今)。在AI、数据湖仓一体化等新技术推动下,主动元数据通过实时感知、智能推理和驱动行动,解决了数据网格、DataFabric等新型架构中的数据可发现性和治理难题。华为DataArts的实践表明,元数据已成为连接业务与技术的桥梁。
2026-05-28 09:04:06
426
原创 Data Fabric 企业落地策略:从数据虚拟化、主动元数据到 AI 就绪
数据编织(DataFabric)正成为企业应对数据孤岛问题的关键技术策略。随着企业数据环境日益复杂,传统ETL模式已无法满足AI时代的实时数据需求。DataFabric通过数据虚拟化、主动元数据和AI就绪三大核心策略,构建智能数据总线:数据虚拟化实现"逻辑集中、物理分散",避免数据冗余;主动元数据推动治理自动化,提升数据可信度;AI就绪能力则为智能应用提供实时语义底座。建议企业分四阶段落地:先以虚拟化解决跨域访问痛点,再构建元数据治理体系,逐步实现AI就绪能力,最终形成联邦化集成架构。
2026-05-27 14:58:14
556
原创 企业架构 vs 数据治理:剪不断理还乱?一张图说清两者的关系
企业架构(EA)与数据治理(DG)是数字化转型中相互依存的两个关键要素。EA提供业务与IT对齐的蓝图,定义数据架构和标准;DG则确保数据质量、安全和合规性。两者关系如同骨架与血液:EA构建企业结构框架,DG让数据在其中有效流动。当前趋势是从集中管控转向联邦治理模式,未来AI驱动将促使两者深度融合。实践表明,只有将EA设计与DG执行形成闭环,才能实现数据价值最大化。企业需打破两者割裂的认知,建立协同机制,使架构设计与治理运营相互促进,共同支撑业务战略目标。
2026-05-26 09:55:44
445
原创 联邦治理,不止是原则:数据网格落地的架构设计与组织博弈
数据网格落地面临的核心挑战在于如何实现联邦治理,平衡集中控制与领域自治。华为的实践提供了可借鉴的"强联邦式治理"模式:设立实体化的领域数据管理部,制定最少必要标准(如核心ID格式、安全标签等),通过跨领域工作组解决争议。关键成功要素包括:实体化组织架构、精简的顶层政策、自服务平台支撑、以及从管控到赋能的转型。随着AI时代到来,联邦治理更成为技术刚需,需支持实时数据访问和自动化治理。这不仅是架构变革,更是一场责任体系的重构,需要组织文化、协作机制和平台能力的全面升级。
2026-05-25 17:13:50
388
原创 技术架构新范式:数据网格如何重构数据管理责任
数据网格(DataMesh)正重塑企业数据架构,从集中式转向领域自治模式。传统数据平台面临规模膨胀、业务敏捷性不足等挑战,数据网格提出四大原则:领域数据所有权、数据即产品、自服务基础设施和联邦治理。它将数据责任从中央团队下放至业务领域,要求各领域提供标准化、可发现的数据产品。数据网格并非推翻传统架构,而是对技术架构的演进,需与业务架构、信息架构等协同。企业应根据组织规模、治理成熟度选择渐进式路径,数据网格的核心价值在于重构数据责任体系,实现全局标准与领域自治的平衡。
2026-05-22 14:02:23
482
原创 架构视角下的数据质量源头治理:从应用架构到数据治理
数据质量问题的根源往往在于应用架构设计缺陷,而非数据平台本身。本文提出从架构层面解决数据质量的三个关键点:1)通过服务化与单一数据源确保核心数据写操作唯一入口;2)建立从前端到数据库的分层校验机制;3)将数据质量监控作为独立服务嵌入技术架构。文章以客户主数据创建为例,展示了业务架构、信息架构、应用架构和技术架构协同治理的闭环方法,强调"好数据是设计出来的"理念,主张将质量要求"左移"到应用架构设计阶段,实现数据质量的源头治理。
2026-05-19 16:28:21
413
原创 业务架构:数据治理的起点
数据治理应以业务架构为起点而非终点。提出BA(业务架构)-IA(信息架构)-DA(数据架构)的递进关系:BA定义价值流和业务能力,IA明确业务对象与规则,DA实现技术方案。强调业务部门应转型为业务架构Owner,通过五步推导法将战略分解为可落地的信息架构。指出跳过BA将导致标准混乱、模型割裂等四大反模式,建议将BA作为持续治理基线,建立架构变更回溯等机制。最终结论:没有业务架构的数据治理如同无基高楼,真正的起跑线在业务图纸中。
2026-05-18 14:03:16
454
原创 以DCMM为标尺,衡量企业数据架构的成熟度
DCMM是我国数据管理领域的国家标准,为企业数据架构提供了评估标尺和改进路径。其核心框架包含8大能力域(2025版扩展为9个)和5个成熟度等级(L1-L5),覆盖数据战略、治理、架构等关键领域。DCMM与4A企业架构形成互补:前者提供评估标准,后者提供设计方法。通过"评估-诊断-改进-再评估"闭环,企业可系统提升数据管理能力。
2026-04-29 10:42:41
600
原创 华为4A架构中的信息架构设计方法:从数据资源到战略资产的治理之道
在数字化转型的浪潮中,企业对“数据是核心资产”的认知已形成共识,但如何将数据从“原材料”加工为“可消费的资产”,仍是许多企业面临的难题。华为的答案是:以4A架构为方法论,将信息架构(Information Architecture,IA)作为连接业务与技术的桥梁。华为公司质量与流程IT部相关负责人曾指出:“数据从业务中产生,在IT系统中落地,决定了数据治理工作必须充分融入业务运作与IT系统建设中。” 这一理念揭示了信息架构在4A架构中的特殊地位——它既是业务架构在数据层面的映射,又是应用架构和技术架构设
2026-04-28 14:36:18
807
原创 企业架构方法论对决:TOGAF ADM与华为4A架构的融合实践
企业架构领域存在TOGAF与4A架构的融合难题:TOGAF提供架构开发流程(ADM),而华为4A架构(BA/AA/IA/TA)定义架构内容标准。二者本质互补——TOGAF解决"怎么做",4A明确"做什么"。本文提出融合框架:以ADM阶段管理开发流程,在每阶段按4A四域产出标准化交付物,并通过架构治理确保实施合规。该框架实现了方法论的流程规范性与内容完整性的统一,推动企业架构从"绘图"到"建模"的升级,为数字化转型提供可落地的架构治理基础。
2026-04-27 09:50:28
1341
原创 企业架构中的核心轴:数据架构全景视图与TOGAF内容元模型映射
在TOGAF的四大架构域(业务架构、数据架构、应用架构、技术架构)中,数据架构占据着独特而关键的位置。业务架构定义了“我们需要做什么”,应用架构回答“用什么系统来做”,技术架构解决“需要哪些基础设施支撑”,而数据架构则贯穿始终——它既是业务架构的信息投射,又是应用架构的设计约束,更是技术架构的选型依据。
2026-04-24 09:34:48
384
原创 数据管理体系建设实践:以DCMM为框架的企业数据治理之路
随着数字化转型的深入,企业数据量呈指数级增长。然而,数据分散在ERP、CRM、MES、SCM等几十个系统中,“数据孤岛”、“口径不一”、“质量参差”、“安全失控”等问题日益突出。据行业统计,企业数据工程师有60%-80%的时间花费在数据清洗和准备上,而非真正的数据分析。如何系统化地建设数据管理体系,成为企业数字化成功转型的关键。
2026-04-23 10:36:32
518
原创 企业架构师必读:TOGAF核心框架与ADM全生命周期深度解析(附电商实战案例)
在TOGAF中,架构不是一张技术拓扑图,而是一套帮助不同利益相关方达成共识的系统性方法。一句话理解:架构 = 利益相关方的关注点 + 最优解决方案ADM(Architecture Development Method,架构开发方法)是TOGAF的核心流程。一句话理解:ADM就是一套“如何从0到1做架构”的标准操作手册。ADM共9个阶段,加上贯穿全流程的需求管理,形成完整的生命周期。角色职责关键KPI所属部门分拣员按订单拣货、打包、贴标拣货准确率、拣货时效仓储部骑手取货、配送、签收确认。
2026-04-10 14:57:25
513
原创 从“数据孤岛”到“统一视图”:一套可落地的主数据管理规划方法论
很多企业在数据治理上栽过这样的跟头:业务系统各自为政,同一个客户在不同系统里名称不同、编码不同、甚至地址都不一样;想做集团层面的分析,光对账就要花掉一半时间;上了一个又一个系统,数据却越管越乱。这些问题看似复杂,但根源往往指向同一个方向——主数据管理(MDM)缺失。结合一份完整的MDM规划设计方案,我把其中经过验证的方法论提炼出来,形成一套可复制、可落地的规划框架,希望对正在或将要开展主数据治理的团队有所帮助。
2026-04-07 09:07:25
384
原创 从混乱到清晰:如何从零搭建一套实用的数据管理体系
在企业成长过程中,数据越积越多,但真正要用的时候,常常找不到、看不懂、不敢用。这并非个例,而是缺乏体系化数据管理的典型表现。
2026-04-03 13:51:40
203
翻译 世界模型【论文】
Agent可以在自己的梦境中学习吗?概述我们探索建立支撑流行强化学习环境的生成型神经网络模型,我们的世界模型可以以无监督的方式快速训练,以学习针对环境的压缩时空表示。通过使用从世界模型中提取的特征作为agent的输入,我们可以训练一个非常紧凑和简单的策略,可以解决所要求的任务,甚至可以完全在其世界模型生成的梦境中训练agent,并将此策略迁移到实际环境。介绍世界模特,来自斯科特麦...
2019-04-07 21:35:48
7271
翻译 剖析强化学习 - 第八部分
作者:Massimiliano Patacchiola在上一篇文章中,我介绍了函数逼近作为在强化学习设置中表示效用函数的方法。我们使用的简单逼近器基于特征的线性组合,并且它非常有限,因为它无法模拟复杂的状态空间(如XOR网格世界)。在这篇文章中,我将介绍人工神经网络作为非线性函数逼近器,向您展示如何使用神经网络来模拟效用函数。我将从名为Perceptron 的基本架构开始,然后转向称为多层感知...
2019-02-01 20:13:10
1510
1
原创 Neural Networks for Machine Learning Lecture 6 Quiz
Neural Networks for Machine Learning Lecture 6 Quiz每个人的题目可能有略微不同。
2018-10-28 19:31:18
619
翻译 分布式TensorFlow
通过使用多个GPU服务器,减少神经网络的实验时间和训练时间。作者:Jim Dowling说明:可以在这里找到示例的完整源代码。2017年6月8日,分布式深度学习的时代开始了。在那一天,Facebook发表了一篇paper,展示了他们将卷积神经网络(ImageNet上的RESNET-50)的训练时间从两周减少到一小时的方法,该方法使用32个服务器的256个GPU。在软件中,他们引入了一种具有非常大的...
2018-06-18 10:27:01
3049
1
翻译 解决几乎任何机器学习问题的方法
作者:Abhishek Thakur 一位数据科学家平均每天处理大量数据,有人说,超过60-70%的时间花在了数据采集、数据清理、数据整理上,使得机器学习模型可以应用于这些数据。本文重点介绍第二部分,即应用机器学习模型,包括预处理步骤。这篇文章中讨论的流水线是我参与过的一百多次机器学习竞赛的结果。必须指出,这里的讨论虽然普通,但非常有用,也存在非常复杂的方法,可供专业人员练习。我们将在这里使用py...
2018-06-03 19:10:04
3863
翻译 剖析强化学习 - 第七部分
作者:Massimiliano Patacchiola到目前为止,我们已经通过查找表(或者矩阵)表示效用函数。这种方法有一个问题,当潜在的马尔可夫决策过程很大时,有太多的状态和动作存储在内存中。此外,在这种情况下,访问所有可能的状态是非常困难的,这意味着我们无法估计这些状态的效用值。关键问题是泛化:如何产生一个只有很小子集的大状态空间的良好近似。在这篇文章中,我将向您展示如何使用特性的线性组合...
2018-05-09 22:08:30
1929
翻译 剖析强化学习 - 第六部分
作者:Massimiliano Patacchiola你好!欢迎来到“解剖强化学习”系列的第六部分。到现在我们已经了解了强化学习如何工作。然而,我们将大部分技术应用于机器人清洁示例,我决定采用这种方法的原因,是因为我认为应用于不同技术的同一个例子,可以帮助读者更好地理解从一种场景到另一种场景的变化。现在是将这些知识应用于其他问题的时候了。在下面的每一节中,我将介绍一个强化学习问题,并且将向您展...
2018-05-03 22:08:32
3600
翻译 剖析强化学习 - 第五部分
作者:Massimiliano Patacchiola正如我在上一篇中承诺的那样,我将在第五部分介绍进化算法,特别是遗传算法(GA)。如果你阅读完第四篇文章,你应该知道GA可以被认为是Actor-only的算法,这意味着他们直接在策略空间中搜索而不需要效用函数。GAs通常被认为是与强化学习分开的,实际上,GA不关注潜在的马尔可夫决策过程以及Agent在其生命周期中选择的动作。使用这些信息可以实...
2018-04-27 22:06:01
1466
翻译 剖析强化学习 - 第四部分
作者:Massimiliano Patacchiola这是“解剖强化学习”系列的第四篇。在这篇文章中,我将介绍另一组广泛用于强化学习的技术:Actor-Critic(AC)方法。我经常将AC定义为一种元技术,它使用以前的帖子中介绍的方法来学习。基于AC的算法是强化学习中最流行的方法之一。例如,Google DeepMind的一些研究人员最近推出的Deep Determinist Policy ...
2018-04-22 19:08:31
2060
翻译 剖析强化学习 - 第三部分
作者:Massimiliano Patacchiola欢迎来到“剖析强化学习”系列的第三部分。在第一篇和第二篇文章中,我们分析了动态规划和蒙特卡罗(MC)方法。第三部分要讲的强化学习技术称为时间差分(TD)方法。TD学习解决了MC学习中出现的一些问题,在第二部分的结论中我描述了这个问题之一,使用MC方法,需要等到episode结束才更新效用函数,这是一个严重的问题,因为一些应用程序可能会有很长...
2018-04-16 20:40:58
3250
3
翻译 剖析强化学习 - 第二部分
作者:Massimiliano Patacchiola欢迎来到剖析强化学习系列的第二部分。如果您顺利完成了第一部分,那么恭喜!您学会了强化学习的基础,即动态编程方法。正如我在第一部分中所承诺的那样,第二部分将深入进行无模型强化学习(用于预测和控制),对Monte Carlo(MC)方法进行概述。这篇文章与第一部分(弱)相关,我将使用相同的术语,例子和数学符号。在这篇文章中,我将结合Russel...
2018-04-07 22:18:20
1772
1
翻译 剖析强化学习 - 第一部分
作者:Massimiliano Patacchiola前言 [本文是对强化学习的介绍,适合已经有一些机器学习背景,并且懂一些数学和Python的读者。当我研究一种新算法时,我总是希望了解底层机制,从这个意义上讲,使用一种编程语言从头开始实现算法对理解算法是有帮助的。我在这篇文章中采用了这种方法,虽然需要花更长时间阅读但值得这样。我不是以英语为母语的人,所以如果你发现一些难以理解的错误句子,请在...
2018-04-05 11:36:49
2451
1
翻译 数据库优化-基准测试(五)
基准测试工具:DBT2DBT2是一个OLTP事务性能测试工具。它模拟一个批发供应商,多个职员访问数据库,更新客户信息和检查库存。 DBT2是一个TPC’s TPC-C基准测试规范的不错的实现,它是MySQL的最流行的基准测试工具之一,但它的文档很缺乏。DBT2:安装Perl模块DBT2需要的Perl模块:Statistics::DescriptiveTest::ParserTest::Repo
2015-08-01 19:10:44
1069
翻译 数据库优化-基准测试(四)
基准测试工具:sysbench简述sysbench多线程基准测试工具,可以测试:文件I/O性能Scheduler性能内存分配和转换速度POSIX线程实现性能数据库服务器性能(OLTP)工具初始开发用于MySQL的性能测试,现在已经扩展到其它数据库。 获取工具的网址: https://code.launchpad.net/~sysbench-developers/sysbench/0.
2015-07-26 16:52:03
1663
翻译 数据库优化-基准测试(三)
基准测试工具基准测试工具:mysqlslap是MySQL官方提供的性能基准测试工具,通过客户端模拟工作负载。 其执行包括三个阶段: 1. 创建表结构和加载数据 2. 运行测试 3. 清理数据#例子1:--only-print 只输出SQL语句并打印 --auto-generate-sql 代表用系统自己生成的SQL脚本来测试$ mysqlslap --only-print --aut
2015-07-10 22:02:53
1158
翻译 数据库优化-基准测试(二)
如何执行基准测试测试条件–如何避免常见的错误?需要在一个真实的环境中运行基准测试。相似或相同的硬件 包括CPU、内存、网络、IO系统相同的软件配置相似的数据集大小相似的数据分布相似的访问模式 –避免查询和数据缓存 –重新构建访问的分布相当的线程数量 –多用户和多服务器记录所有信息宁可记录无用的信息也不错过重要的信息文档化所有的步骤以便于重新执行基准测试配置:硬件、软件版本
2015-07-08 21:47:54
1093
翻译 数据库优化-基准测试(一)
基准测试的目的基准测试是为了找出系统的瓶颈,包括:硬件 磁盘、内存、网络等。 操作系统 文件系统、内存管理、驱动、调度等。RDBMS SQL层、存储引擎层。Schema设计 索引、表结构、数据类型。Query Query写的不好、逻辑错误。应用程序问题系统各部分之间的交互 磁盘IO、RAM、RDBMS等。测量值 如何测量?哪里最花时间?哪个组件最忙?找出造成瓶颈的原因
2015-06-22 18:26:18
2159
The Linux-HA User’s Guide
2014-02-10
真正的大数据云计算平台
2015-09-03
分布式存储的元数据设计
2015-09-12
MYSQL性能调优工具介绍
2015-10-02
Java Application Architecture Modularity Patterns with Examples Using OSGi Part2
2014-01-06
HBase权威指南中文版
2015-11-24
阿里云产品资料
2015-10-04
云计算资源管理平台系统培训手册
2015-09-03
MySQL-Percona-book
2015-11-17
化繁为简-IBM云存储整体解决方案
2015-09-20
探索性数据分析(EDA)PPT
2017-12-02
Introduction to Convolutional Networks
2017-11-14
learning to see
2017-11-16
Learning TensorFlow A Guide to Building Deep Learning Systems
2018-05-10
知识图谱:大数据语义链接的基石
2018-05-16
Deep Learning with Hadoop
2018-05-10
一种准确而高效的领域知识图谱构建方法
2019-02-27
Machine Learning and Data Mining in Pattern Recognition, 9th, MLDM 2013
2016-09-28
Deep Reinforcement Learning through Policy Optimization
2017-11-19
VGG16预训练模型part1
2018-05-19
VGG16预训练模型part2
2018-05-19
Recurrent Neural Networks
2017-11-18
Introduction to Reinforcement Learning
2017-11-15
Webinar的MySQL高性能高可用资源集合
2016-04-02
Reasoning Attention and Memory
2017-11-22
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅