药企 AI 落地卡的不是模型,是 GxP 验证边界

药企现在不缺 AI 试点,缺的是判断:手上这些场景,哪个今天就能上、哪个要等。多数的卡点也不在模型效果,而在一个问题——AI 的输出进了质量体系以后,谁签字、怎么留痕、模型变了要不要重做验证。这三个问题答不上来,试点就只能停在演示。
监管这两年其实已经把边界画清楚了:AI 可以是执行者,不能是责任主体。抓住这一条,把手上场景按责任轻重排开,能不能上、按什么顺序上,自然就出来了。
本文梳理 2025—2026 年三份关键文件的实际要求,给出四层渗透的顺序,并把 AI 进 GxP 必须落地的控制点、公开能查到的收益数据讲清楚。不写代码,讲判断。
一、2026 年三份文件,把边界画死了
| 时间 | 文件 | 对落地意味着什么 |
|---|---|---|
| 2025-07 | ISPE《GAMP Guide: Artificial Intelligence》(约 290 页) | 定制 AI/ML 系统归到 GAMP 5 Category 5(最高风险);但高风险不等于重文书,允许验证与算法迭代并行;验证重火从"逐行审代码"转到"审训练数据" |
| 2026-01-14 | FDA 与 EMA 联合发布《Good AI Practice in Drug Development》十项原则 | 首个跨大西洋统一口径:人本设计、风险相称、明确的预期用途、数据治理、生命周期管理。目前非强制,但要按它的口径准备 |
| 2026-03-11 | NMPA《关于"人工智能+药品监管"的实施意见》(国药监综〔2026〕6 号) | 2030 初步建成融合创新体系、2035 形成智慧治理格局;审评提速、高风险品种非现场监管、AI 风险画像精准飞检 |
| 2025-02 / 2026-04 | FDA 两封与 AI 相关的警告信 | 监管走完了"教育—立规矩"两步,现在进入执法 |
FDA 那封警告信里有一句判词,整个行业的动作都围着它:AI 可以起草规格、提出程序、翻出先例,但不能放行批次、不能验证工艺、不能承担法规义务。对 AI 的问责无法被委托出去。(原文表述是 human accountability cannot be delegated to it。)
注意最后一句的分量:它没有说"不准在受监管的药品生产里用 AI"。它说的是责任不能交出去。这两句话的差别,就是全部操作空间所在。
二、四层渗透:哪些现在能上,哪些先别碰
按"AI 在决策链里的位置"分四层,越往右越接近替人做决定,验证成本也越陡。
| 层级 | 典型场景 | 验证要求 | 现在的判断 |
|---|---|---|---|
| ① 个人效率 | 翻译、检索、写作、表格处理 | 无 | 现在就能铺开 |
| ② 部门知识 | 私有化检索:查 SOP、历史偏差、法规原文、供应商历史 | 数据不出域是前提 | 现在能做,见效快 |
| ③ 流程增强 | 偏差调查、OOS 调查、CAPA 起草、批记录汇编、申报资料 | 传统 CSV + 人工复核留痕 + 漂移监控 | 挑一到两个场景打透 |
| ④ 决策替代 | 放行判断、偏差分级、工艺参数自动调整 | 目前没有成熟路径 | 先别碰 |
顺序不能反,原因只有一个:跨过 ② 和 ③ 中间那条线,验证成本不是翻倍,是翻好几倍。 因为要加上模型生命周期管理、漂移监控、再验证触发机制这一整套东西,而这些东西在验证边界外做是白做的。
赛诺菲的做法值得直接抄:它没有一上来做平台,而是起于一个很小的切口——把偏差和投诉的趋势分析自动化,并生成根因假设。跑出效果之后才谈推广,支撑它的是内部的负责任 AI 框架。它的公式说起来也简单:小切口起步,先证价值,治理跟上,再谈规模。
另外,① 这一层别当成"没技术含量"跳过。它的真实作用不是省时间,是让人先相信这东西有用。后面要推 ③ 的时候,挡路的人往往是前面没被说服的人。
三、AI 输出就是 GxP 记录:五个必须落地的控制点
先看一件事:传统 CSV 验证的是"容器",不是"模型"。 平台、界面、数据流都能验证过,但装在里面的那个训练好的模型,性质完全不同。
| 验证维度 | 传统 CSV(GAMP 5) | AI/ML 模型 |
|---|---|---|
| 验证对象 | 软件功能对不对得上需求 | 模型预测对不对得上独立测试集上的性能标准 |
| 训练数据 | 不适用 | 必须做资格确认:来源可溯、偏差已评 |
| 失效模式 | 确定性——功能要么对要么错 | 概率性——性能渐进退化,不监控就发现不了 |
| 上线后义务 | 变更控制触发再评估、定期回顾 | 必须持续监控;漂移触发再验证 |
| 人工监督 | 由 SOP 和权限控制间接保证 | 必须显式设计成系统里的人工介入检查点 |
关键差别在第三行:一个模型可以 IQ/OQ/PQ 全部通过,然后在生产里悄悄退化。 这种失效不会出现在任何一条测试脚本里,只能靠运行期监控抓。
基于这一点,五个控制点必须落到文档和系统里:
第一,预期用途(COU)先写死,再谈验证。 写清楚模型用来支持哪个决策、输出是什么、怎么解读、边界在哪、超出验收标准时怎么办。COU 决定验证强度,而且超出 COU 使用本身就是一次验证偏差,不是"灵活应用"。
第二,训练数据按 ALCOA+ 管。 可归属、清晰、同步、原始、准确,加上完整、一致、持久、可用。举个例子:训练视觉模型的"良品图池"和"缺陷图池",它的收集、标注、存储过程本身就是 GMP 记录,要经得起查。
第三,人工介入检查点要设计进系统,不是写在 SOP 里。 凡是有后果的决策,系统层面就得有签字节点。SOP 里写一句"须经人工确认",和系统里真的有这个卡点,在检查现场是两回事。
第四,漂移监控要设阈值,超限要拦。 光源老化、不同批次包材的反光率差异,都会让实验室里跑到 99% 的精度在产线上退化。超阈值要能自动报警、拦住放行,并触发预先定义好的再验证与重新训练协议。
第五,变更控制要覆盖模型和提示词。 模型版本变更、提示词变更,都要走变更控制,并提前定清楚哪些变更触发再验证。这一条最容易被漏:大家习惯了软件升级走变更,但没意识到"提示词改了"也是一种逻辑变更。
补一条容易被忽略的风险:承包商。 委托生产、委托检测方的 AI 治理缺口,等于委托方的合规风险——按 FDA 的口径,产品owner 对药品质量的责任与该协议无关。质量协议里如果没写清 AI 的使用范围、人工监督要求、审计权,现在按实践算不完整。做过委托检测那一侧的人对这条会更有感觉。
四、公开能查到的收益数据
这些数字来自行业会议分享与公开报道,都是在受监管环境里跑出来的,供算账参考:
| 场景 | 变化 |
|---|---|
| OOS 调查:检出→调批记录→关联历史偏差→起草根因分析 | 调查时间缩短 50% 以上 |
| 60 多个关键工艺参数的注射剂批记录汇编 | 4—6 小时 → 1—2 小时 |
| 批放行记录起草 | 4 小时 → 45 分钟 |
| 视觉目检 | 检出率 94% → 99.7%,误报下降 60% |
| 工艺异常检测 | 6 个月内提前捕获 12 个潜在 OOS(9 个确认),避免约 34 万欧元报废 |
要提醒的是,药企算 AI 的账和别的行业不一样。别的行业算"省了几个人力",药企该算的是少了几次偏差、少了几轮返工、批次放行提前了几天。一份 OOS 调查报告从三天压到两小时,省下的不是一个人三天的钱,是调查周期缩短带来的放行提前。
五、三个反常识的判断
第一,2026 年的瓶颈已经不是模型能力,是组织。 行业里说得最直白的一位从业者的判断:技术已经到位,真正的约束变成数据治理、变革管理和员工情绪。三年里大家问的是"AI 能不能做",现在问的是"能不能把 18 个月的试点变成全企业的部署"。
第二,AI 的输出一旦进入质量体系,它就成了记录。 很多人没意识到这一点。一份 AI 起草的偏差报告、一段 AI 生成的风险评估文字,进了记录就是 GxP 记录,受 ALCOA+ 管。所以"AI 出初稿、人签字"这个模式要留痕到能经受审计的程度,包括模型版本和提示词变更的痕迹。
第三,钱投错了地方。 资金大量涌向"上镜"的方向——药物发现、供应链规划,而跨市场、跨法规辖区的合规执行计算这类又硬又值钱的活,几乎没拿到投入。一个车间层面的变更,在有的国家是"次要变更"、在另一个国家可能要事前审批、还有地方有六个月宽限期,这层逻辑至今靠人工加老经验,每个项目重新走一遍。空白就是位置。
六、NMPA 之后,国内药企绕不过的三件事
从《实施意见》倒推,有三件事没法再拖:
批记录电子化从"可选"变成"必选"。 监管端要建高风险品种的非现场监管能力,靠生产监控视频、图像、物联感知数据做实时分析。企业的批记录还停在纸质或半电子化,将来在检查中证明不了数据完整性。
申报资料结构化成为前置条件。 文件明确要"推动申报资料电子提交标准化、结构化"。监管端是 AI 审评,人手动编排 CTD 模块会直接撞上效率墙。
精准飞检。 监管用品种档案和信用档案的大数据给企业画像,按风险等级定检查对象、频次和方案。这条路一开,"飞检前突击准备"就没用了,合规状态得常态化。
总结
三句话收口:
- 边界先认清——AI 可以起草、可以建议、可以找先例,但不能放行、不能验证、不能承担法规义务。所有判断都从这条出发。
- 顺序先排对——个人效率、部门知识、流程增强、决策替代,由外向内。跨过验证边界那条线,投入是数量级的差别。
- 控制点先落地——预期用途、训练数据、人工检查点、漂移阈值、变更控制,这五条补上,才谈得上进质量体系。
顺带说一句:① 和 ② 两层不需要等任何东西,今天就能做。而真正难的 ③,值钱的地方也不是"用了 AI",而是把一份份重复文档从手工整理变成结构化初稿、把散在各处的记录变成能趋势化的数据——这件事本身跟用不用大模型关系不大,它是资料整理和数据对接的活。
关于我
在实验室一线待了 13 年(9 年制药 + 4 年第三方检测),做的一直是实验室信息化。做过 STARLIMS 的甲方 PM——一期、二期两轮上线都由我主导(招标到 3Q 验证到验收全流程);也在系统上自己做过二次开发——把纸质的账号申请流程搬到线上跑;在 STARLIMS 之前还有 6 年多 CS 架构 LIMS 的使用与运维经验(其中一段经 Citrix 远程接入)。现在专做实验室里那些重复劳动:报表自动生成、仪器数据对接、合规文档批量处理。
本科物理化学、硕士计算机化学,既听得懂 QA 说的变更控制,也看得懂仪器导出的原始数据长什么样。SOP、偏差、OOS、样本流转这些词,不用你解释。
现在主要做这几类:
- 检验报告与台账批量生成:模板不动,数据自动填,格式一步不错
- 仪器数据对接:色谱、光谱、酶标仪导出的原始文件,解析、清洗、入库、转成报表
- 合规文档自动化:SOP、验证方案、批记录这类重复文档的批量生成与核对
- 数据完整性核查:按 ALCOA+ 逐条核对原始数据与记录是否对得上
手里有这类活儿卡着,或者只是想问问能不能自动化,都欢迎评论区聊,先把问题说清楚再谈怎么做。
更多推荐



所有评论(0)