谈谈数据的人工智能适用性(data AI readiness)!
“数据的人工智能适用性 / Data AI Readiness(也叫 AI-ready data / data readiness for AI)”说的不是“有没有数据”,而是数据能不能被 AI 系统可靠地找到、理解、调用、治理和追责。
传统数据管理关心“人能不能查报表”,AI 数据适用性关心“模型/Agent 能不能在正确权限和上下文中做对事”。
一、先分清三个概念
-
Data readiness(数据就绪):数据本身准不准、全不全、能不能取。
-
AI data readiness(面向 AI 的数据就绪):数据除了能用,还要有语义、血缘、权限、向量/特征形态,能被模型消费。
-
AI readiness(企业 AI 就绪):更大概念,还包括战略、人才、模型治理、算力、业务流程、成本与组织能力。
一句话:AI readiness 的底座是 AI data readiness;没有后者,模型再强也是“会说话的瞎子”。
二、AI-ready data 的核心维度
业界框架表述不同,但基本收敛到这几条:
1. Quality — 质量
准确性、完整性、一致性、时效性、唯一性、合法性。
AI 会把错误“放大得很自信”:一条脏数据不是报表错一格,而是模型生成 1000 份错误合同。
2. Availability & Accessibility — 可获取
-
数据在哪?谁有权取?
-
有没有 API / 特征服务 / 向量索引?
-
人和 Agent 能不能在合规前提下低延迟拿到?
“有数据但锁在 Excel / 旧系统 / 没人懂的业务表里”=不适用。
3. Context / Semantics — 语义上下文
这是 AI 时代最关键、也最容易被忽视的一点。
AI 不光要字段,还要知道:
-
“Revenue” 和 “Total Sales” 是不是一回事?
-
客户、订单、风险、SKU 的实体关系是什么?
-
这份 PDF 是草稿还是终版?
-
这条记录适用于哪个业务口径、哪个地区、哪段时间?
没有语义层,RAG 也会把互相矛盾的文件拼成“看起来很对”的废话。
4. Structure for AI — AI 可用形态
传统:表、行、列。
AI:
-
结构化:表 / 特征
-
非结构化:合同、邮件、工单、图片、音频
-
半结构化:日志、JSON
-
衍生资产:chunk、embedding、knowledge graph、feature store、tool schema
数据要能进 embedding / retrieval / function calling / agent memory。
5. Lineage & Provenance — 血缘与可追溯
AI 答错时,必须能反查:
哪个 chunk → 哪个文档版本 → 哪个抽取逻辑 → 哪个 embedding 模型 → 哪个 prompt → 哪个输出
否则就是“黑箱背锅”。
6. Governance & Compliance — 治理与合规
-
数据所有者是谁?
-
PII / 商业秘密 / 受监管数据能不能进模型?
-
权限是否带到向量库和 RAG 里?
-
是否满足 GDPR / 个人信息保护法 / EU AI Act / 行业监管?
-
训练、验证、测试集是否有文档化质量证据?
重点:权限不能“建完索引就消失”。
7. Freshness & Operability — 时效与可运营
-
实时、近实时、批量?
-
源更新后,embedding / 缓存 / 特征要不要重算?
-
有没有 drift detection、回滚、人工兜底、成本监控?
AI 系统会“静默退化”:数据分布变了,模型不报错,但业务指标先崩。
三、为什么“数据很多”≠“AI 适用”
企业常见误区:
我们都有数据湖 / 数据仓库 / 大模型了,应该很 AI-ready 吧?
现实往往是:
-
数据分散在 ERP / CRM / 飞书文档 / 共享盘 / 邮件里
-
主数据不一致,客户 ID 对不上
-
文档没版本、没负责人、没权限标签
-
业务规则在老员工脑子里
-
RAG 能搜到,但搜到的是 2021 年作废制度
-
模型答得顺,但越权看了薪酬表
所以 AI data readiness 是“按用例评估”的,不是全公司发一张证书:
-
智能客服摘要:中等要求
-
合同审查:高要求
-
自动下单 / 信贷审批 / 医疗建议:极高要求
四、一个好用的评估框架(6C)
Snowflake 等近年常用 6C 来定义 AI-ready data:
-
Clean — 干净
-
Contextual — 有语义
-
Consumable — 机器可取(API / 向量 / 特征)
-
Current — 够新
-
Correlated — 有血缘、可关联
-
Compliant — 合规可控
也可以换成五维:
Quality / Accessibility / Context / Governance / Operability。
五、落地时怎么判断“适不适用”
对一个具体 AI 用例,问 10 个问题:
-
这个用例真正依赖哪些数据?
-
数据存在哪?有没有权威源?
-
质量够不够?标签/历史/负样本够不够?
-
非结构化文档能不能解析、分块、打元数据?
-
业务实体和关系有没有统一定义?
-
权限能不能从源系统带到大模型?
-
数据更新后,AI 知识会不会自动更新?
-
答错时能追到原文和版本吗?
-
有没有人工审核 / 降级 / 审计机制?
-
这个用例的容错率是多少?(摘要 ≠ 自动转账)
六、成熟度分层(很实用)
-
L1 Fragmented:系统孤岛、无主数据、无血缘 → 别上生产 AI,先做数据底座
-
L2 Unified but ungoverned:有湖/仓,但没人保证对不对、能不能用 → 能跑 demo,难进生产
-
L3 Governed & contextualized:有目录、血缘、语义层、权限、反馈闭环 → 可规模化和生产化
-
L4 Agent-ready:数据不仅“能被读”,还能被 Agent 安全调用、执行动作、回滚、记账 → 最高阶
七、给组织的结论
Data AI readiness = 数据从“给人看”升级为“给模型推理、给 Agent 行动、给监管审计”的能力。
优先级建议:
-
先选 1–2 个高价值、低风险用例
-
做数据盘点 + 权威源 + 元数据 + 权限映射
-
建语义层 / 业务词汇表 / 实体关系
-
把治理从“文件级”做到“chunk / embedding / tool / output 级”
-
再谈向量库、Agent、自动化决策
更多推荐

所有评论(0)