做大数据、数据治理行业多年,相信很多同行都有同一个感受:这个行业似乎永远不缺 “新概念”。从早年的数据仓库、数据集市,到前几年全民追捧的数据中台、数据湖,再到如今大火的 Data Fabric(数据编织)、Data Mesh(数据网格),一波又一波新名词、新架构轮番刷屏行业文章、技术分享和厂商宣讲会。

概念一个比一个新颖,架构描述一个比一个宏大,技术理念听起来也愈发 “高大上”。但落到一线落地场景,很多企业却陷入了相似的困境:动辄投入数百万搭建的数据中台、数据湖,把全公司业务数据物理归集到了一处,可业务人员依旧抱怨 “找不到想要的数据”,数据分析师每天大半时间都在承接各部门的数据申请工单,海量数据静静躺在存储中 “沉睡”,沦为无人管、无人懂、无人用的 “数据坟场”。

如今 Data Fabric 横空出世,主打 “元数据驱动、智能数据互联、让数据主动找到使用者”,被不少人视作解决数据中台痛点的终极方案。但拨开层层技术包装,我们不妨冷静思考:层出不穷的大数据新概念,到底是真正的架构革新,还是换了外壳的传统数据管理?当底层的数据治理、数据质量、业务口径等基础问题没有改变时,再酷炫的架构,也只是空中楼阁。

1、数据中台的理想与现实:只解决了 “汇集”,没解决 “用好”

追溯到几年前,数据中台几乎是所有中大型企业的数字化标配。当时行业的共识是:企业数据分散在各个业务系统、孤立的数据库中,形成大量数据孤岛,想要发挥数据价值,第一步就是 “聚数据”。

于是大批企业投入资金、人力搭建数据中台、数据湖,通过 ETL/ELT 把 CRM、营业厅、装维、手厅等全业务线数据统一抽取、汇总、存储,完成了数据物理层面的归集。从架构层面看,数据孤岛被打通,全量数据集中管理,看似迈出了关键一步。

可落地后的现实却大打折扣: 数据是凑到一起了,但数据和业务的连接、数据之间的逻辑关系、数据背后的业务语义完全缺失。一张数据表摆在面前,业务人员看不懂字段含义,分不清不同表的口径差异;没有完善的数据目录、标签和检索能力,想找一份业务数据只能反复咨询 IT 和数据团队;数据质量问题无人常态化管控,重复数据、错误数据、缺失数据比比皆是;数据权限、数据流转规则混乱,数据安全和合规风险暗藏。

最终就出现了行业里很普遍的怪象:数据湖 / 数据中台建好了,湖底堆满数据,却没人能高效使用。数据团队从 “做数据集成” 变成了 “专职接工单”,疲于应对源源不断的数据提取、核对、答疑需求。

究其根本,数据中台的核心定位本就是解决 “数据汇集” 问题,它擅长搭建统一的数据存储与流转底座,但天生没有承载 “数据管理、数据释义、质量管控、业务适配” 的能力。而这些,恰恰是数据治理深耕十余年一直在解决的基础问题。中台补齐了 “数据在哪里”,却没能解决 “数据是什么、数据准不准、数据怎么用”。

2、Data Fabric、Data Mesh 轮番登场:新概念背后,都是老问题换新衣

当数据中台的短板逐渐暴露,行业又开始寻找新的解决方案,Data Fabric、Data Mesh 顺势成为新的流量密码。各大厂商、技术博主开始解读新理念,描绘 “数据自主流转、全域智能互联、业务自助用数” 的美好蓝图。

我们先拆解两大热门概念的核心能力,再对照传统数据治理体系看一看:

1.)Data Fabric(数据编织):元数据驱动的智能互联

按照官方定义,Data Fabric 是一套元数据驱动的自动化数据集成架构,主打四大核心能力:元数据先行、AI 自动发现数据资产、主动式数据治理、自适应数据管道。

  • 强调先建完整元数据目录,梳理表结构、字段、数据血缘、业务归属、质量规则;
  • 依托 AI 自动识别数据资产、打标签、做分类,替代人工整理;
  • 实时监控数据运行状态,提前预警数据质量、链路异常问题;
  • 动态调整数据流转管道,适配数据源变更。

把这些能力逐一拆解就会发现:没有一项是全新技术。 完整的元数据目录、数据血缘梳理、数据字典,是传统数据治理最基础的工作;数据资产自动分类、智能标签,是多年来数据标签体系、数据门户的常规功能;数据质量实时监控、异常告警,是传统数据质量平台的核心模块;自适应数据管道,本质就是动态 ETL、智能化数据集成。

Data Fabric 只是把这些分散的传统能力,用 “元数据驱动” 的架构理念重新整合、包装,并叠加了当下热门的 AI 能力做效率提升。它解决的依旧是数据可发现、可理解、可管控的老问题,并没有跳出数据治理的范畴。

2) Data Mesh(数据网格):去中心化的数据权责划分

Data Mesh 提出 “去中心化” 思路,主张把数据所有权、治理权下放至各个业务域,业务团队对自身数据全权负责,平台团队仅提供统一标准和基础设施,以此缓解数据团队成为 “瓶颈” 的问题。

这套理念,放在数据治理领域早已不是新鲜事。早在数据中台兴起之前,行业就一直在推行按业务域划分数据权责、建立业务数据 Owner 机制,明确 “谁产生、谁负责、谁治理”。Data Mesh 只是把这套权责管理思路,拔高到了顶层架构层面,换了一套说辞。

不少人将 Data Fabric 与 Data Mesh 视作对立的新技术,实际上二者相辅相成:一个管全域数据的智能互联,一个管业务域的数据自治。但归根结底,两者落地的前提,依然是统一的数据标准、完善的元数据、清晰的权责体系、常态化的质量管控—— 全都是数据治理的基本功。

3、概念越炒越热,老问题为何始终难以根治?

既然新概念本质都是传统数据管理能力的整合升级,为什么绝大多数企业,即便不断跟进新架构、上新平台,还是摆脱不了 “数据难找、数据不准、用数困难” 的困境?结合一线落地经验,核心原因无外乎四点:

1) 重 “架构建设”,轻 “基础治理”

这是最普遍的问题。企业在数字化投入上,普遍偏爱看得见、摸得着的硬件和平台:建中台、搭数据湖、采购新一代 Data Fabric 工具,有明确的项目成果、可视化界面,容易作为业绩展示。

但枯燥、耗时、见效慢的基础数据治理工作,却很少有人愿意投入精力:梳理跨部门业务口径、统一字段定义、补全元数据和数据字典、核对历史数据质量、建立标签体系…… 这些工作没有炫酷的界面,短期内看不到直接收益,常常被一拖再拖。

架构是 “骨架”,数据治理是 “血肉”。骨架搭得再完美,没有血肉填充,终究只是一具空壳。哪怕用上最先进的 Data Fabric 架构,元数据残缺、业务口径混乱、数据错误频发,智能检索、自动互联也无从谈起。

2) 重 “技术噱头”,轻 “业务对齐”

所有大数据新概念,都在极力渲染技术先进性:AI、自动化、智能编排、全域互联…… 但始终回避一个核心痛点:数据与业务的深度对齐

同一个指标,市场部、运营部、财务部统计口径不一样;同一个字段,不同业务人员理解含义不同;报表、数据表只标注技术名称,没有配套的业务解释文档。这种情况下,无论数据检索多么智能、数据集成多么自动化,业务人员拿到数据依旧看不懂、不敢用。

技术可以提升数据流转、检索的效率,但无法替代跨部门的业务沟通、口径统一、语义梳理。一味追逐技术新概念,忽略业务侧的协同治理,问题永远无法解决。

3) 重 “一次性项目”,轻 “长效运营”

数据中台、Data Fabric、数据治理,本质都不是 “一锤子买卖”。业务系统在迭代、业务规则在变化、数据量在持续增长,元数据、标签、质量规则、权限体系都需要常态化更新、维护、迭代

但国内很多企业的模式是:把数据平台建设当成工程项目,项目验收、系统上线,工作就宣告结束。后续没有专职团队持续运营,元数据长期不更新,标签体系无人维护,数据质量规则不随业务调整。再完善的架构,运行一段时间后也会逐步失效,最终重回 “数据混乱” 的老样子。

4)营销驱动大于实际需求,概念沦为 “卖点”

大数据行业不断催生新概念,也离不开商业层面的推动。对于厂商而言,成熟的传统数据治理工具、数据中台产品已经进入红海市场,增长乏力。打造全新的概念、全新的架构,既能制造行业热点,也能推出新一代产品、挖掘新的项目商机。

于是新概念被不断包装、放大,刻意弱化其背后传统数据管理的本质,营造 “旧架构过时、新架构才是未来” 的焦虑感。很多企业跟风入局,采购新工具、上线新架构,却没有结合自身业务现状梳理问题,最终只是重复 “换平台、不换问题” 的循环。

更多推荐