“数据的人工智能适用性 / Data AI Readiness(也叫 AI-ready data / data readiness for AI)”说的不是“有没有数据”,而是数据能不能被 AI 系统可靠地找到、理解、调用、治理和追责。

传统数据管理关心“人能不能查报表”,AI 数据适用性关心“模型/Agent 能不能在正确权限和上下文中做对事”。


一、先分清三个概念

  • Data readiness(数据就绪):数据本身准不准、全不全、能不能取。

  • AI data readiness(面向 AI 的数据就绪):数据除了能用,还要有语义、血缘、权限、向量/特征形态,能被模型消费。

  • AI readiness(企业 AI 就绪):更大概念,还包括战略、人才、模型治理、算力、业务流程、成本与组织能力。

一句话:AI readiness 的底座是 AI data readiness;没有后者,模型再强也是“会说话的瞎子”。


二、AI-ready data 的核心维度

业界框架表述不同,但基本收敛到这几条:

1. Quality — 质量

准确性、完整性、一致性、时效性、唯一性、合法性。

AI 会把错误“放大得很自信”:一条脏数据不是报表错一格,而是模型生成 1000 份错误合同。

2. Availability & Accessibility — 可获取

  • 数据在哪?谁有权取?

  • 有没有 API / 特征服务 / 向量索引?

  • 人和 Agent 能不能在合规前提下低延迟拿到?

“有数据但锁在 Excel / 旧系统 / 没人懂的业务表里”=不适用。

3. Context / Semantics — 语义上下文

这是 AI 时代最关键、也最容易被忽视的一点。

AI 不光要字段,还要知道:

  • “Revenue” 和 “Total Sales” 是不是一回事?

  • 客户、订单、风险、SKU 的实体关系是什么?

  • 这份 PDF 是草稿还是终版?

  • 这条记录适用于哪个业务口径、哪个地区、哪段时间?

没有语义层,RAG 也会把互相矛盾的文件拼成“看起来很对”的废话。

4. Structure for AI — AI 可用形态

传统:表、行、列。

AI:

  • 结构化:表 / 特征

  • 非结构化:合同、邮件、工单、图片、音频

  • 半结构化:日志、JSON

  • 衍生资产:chunk、embedding、knowledge graph、feature store、tool schema

数据要能进 embedding / retrieval / function calling / agent memory。

5. Lineage & Provenance — 血缘与可追溯

AI 答错时,必须能反查:

哪个 chunk → 哪个文档版本 → 哪个抽取逻辑 → 哪个 embedding 模型 → 哪个 prompt → 哪个输出

否则就是“黑箱背锅”。

6. Governance & Compliance — 治理与合规

  • 数据所有者是谁?

  • PII / 商业秘密 / 受监管数据能不能进模型?

  • 权限是否带到向量库和 RAG 里?

  • 是否满足 GDPR / 个人信息保护法 / EU AI Act / 行业监管?

  • 训练、验证、测试集是否有文档化质量证据?

重点:权限不能“建完索引就消失”。

7. Freshness & Operability — 时效与可运营

  • 实时、近实时、批量?

  • 源更新后,embedding / 缓存 / 特征要不要重算?

  • 有没有 drift detection、回滚、人工兜底、成本监控?

AI 系统会“静默退化”:数据分布变了,模型不报错,但业务指标先崩。


三、为什么“数据很多”≠“AI 适用”

企业常见误区:

我们都有数据湖 / 数据仓库 / 大模型了,应该很 AI-ready 吧?

现实往往是:

  • 数据分散在 ERP / CRM / 飞书文档 / 共享盘 / 邮件里

  • 主数据不一致,客户 ID 对不上

  • 文档没版本、没负责人、没权限标签

  • 业务规则在老员工脑子里

  • RAG 能搜到,但搜到的是 2021 年作废制度

  • 模型答得顺,但越权看了薪酬表

所以 AI data readiness 是“按用例评估”的,不是全公司发一张证书:

  • 智能客服摘要:中等要求

  • 合同审查:高要求

  • 自动下单 / 信贷审批 / 医疗建议:极高要求


四、一个好用的评估框架(6C)

Snowflake 等近年常用 6C 来定义 AI-ready data:

  1. Clean​ — 干净

  2. Contextual​ — 有语义

  3. Consumable​ — 机器可取(API / 向量 / 特征)

  4. Current​ — 够新

  5. Correlated​ — 有血缘、可关联

  6. Compliant​ — 合规可控

也可以换成五维:

Quality / Accessibility / Context / Governance / Operability。


五、落地时怎么判断“适不适用”

对一个具体 AI 用例,问 10 个问题:

  1. 这个用例真正依赖哪些数据?

  2. 数据存在哪?有没有权威源?

  3. 质量够不够?标签/历史/负样本够不够?

  4. 非结构化文档能不能解析、分块、打元数据?

  5. 业务实体和关系有没有统一定义?

  6. 权限能不能从源系统带到大模型?

  7. 数据更新后,AI 知识会不会自动更新?

  8. 答错时能追到原文和版本吗?

  9. 有没有人工审核 / 降级 / 审计机制?

  10. 这个用例的容错率是多少?(摘要 ≠ 自动转账)


六、成熟度分层(很实用)

  • L1 Fragmented:系统孤岛、无主数据、无血缘 → 别上生产 AI,先做数据底座

  • L2 Unified but ungoverned:有湖/仓,但没人保证对不对、能不能用 → 能跑 demo,难进生产

  • L3 Governed & contextualized:有目录、血缘、语义层、权限、反馈闭环 → 可规模化和生产化

  • L4 Agent-ready:数据不仅“能被读”,还能被 Agent 安全调用、执行动作、回滚、记账 → 最高阶


七、给组织的结论

Data AI readiness = 数据从“给人看”升级为“给模型推理、给 Agent 行动、给监管审计”的能力。

优先级建议:

  1. 先选 1–2 个高价值、低风险用例

  2. 做数据盘点 + 权威源 + 元数据 + 权限映射

  3. 建语义层 / 业务词汇表 / 实体关系

  4. 把治理从“文件级”做到“chunk / embedding / tool / output 级”

  5. 再谈向量库、Agent、自动化决策

更多推荐