AI 辅助药物研发该怎么监管?美国 FDA 的四项做法与启示
一、绕不开的矛盾
药物研发是典型的"三高"行业。一个药物从早期发现到临床上市,需要 10~15 年时间、10~20 亿美元投入,而且约 90% 的临床药物研发以失败告终。更麻烦的是难度还在递增——杰克·斯坎内尔提出的"反摩尔定律"指出,虽然近 60 年技术不断进步,但药物研发反而变得更慢、成本更高。
人工智能看上去是这个困局的解药。在研发早期,它能够将新药开发成本降低约 70%。2016 年至 2023 年,美国 FDA 药品评价与研究中心(CDER)已累计审查逾 500 份含人工智能的药品和生物制品申请,且这一使用量自 2016 年以来呈指数级增长。
但 AI 进入药物研发,同时带来了一个传统药品监管从未面对过的问题:当一个模型的判断连它的开发者都无法解释时,监管该管什么?
模型的黑箱特性、对数据的高度依赖、以及持续迭代的特点,让传统监管政策失灵。本文梳理美国 FDA 的应对思路——它的做法不是立法,而是另一条路径。
二、先看清:AI 已经进到哪一步
在讨论监管之前,先明确 AI 在药物研发链条上的实际介入位置。这不是"未来可能",而是已经发生的分布:

图 1 · AI 在药物研发全链条的介入点
梳理下来有五个环节:
- 药物发现:梳理大量结构化与非结构化数据,预测化合物的生物活性,生成具有目标特性的新分子结构。
- 非临床研究:计算机模拟试验辅助分析基因组结构、预测药物与靶点相互作用,并用于药动学、药效学研究。
- 临床试验:辅助受试者招募、依从性监测与数据管理。
- 上市后阶段:辅助不良事件的监测、分析与报告。
- 先进制药生产:优化工艺设计,实现先进过程控制。
链条越长,监管的难点越突出——因为这意味着 AI 的影响不集中在某一个审批节点上,而是弥散在整个产品生命周期里。
三、四类风险,决定了监管必须站在哪里
FDA 之所以要专门应对,是因为 AI 带来的风险不是传统意义上的"药物安全性问题",而是四类性质完全不同的风险:

图 2 · 四类风险与对应的监管着力点
3.1 数据偏见与代表性不足
这是最直接指向安全的一类。人工智能偏见指 AI 决策中存在的系统性错误模式:模型在某些场景下表现准确,但由于训练数据存在偏见或不完整,在其他场景下会失效。
成因有四种:训练数据代表性不足、数据收集过程嵌入人类主观偏见、数据标准不统一、数据互操作性缺失。
一个常被引用的例子是"WEIRD"问题——很多医疗数据过度集中于西方、受教育程度高、工业化、富裕、民主人群,而少数族裔、女性、老年人或残障人士等弱势群体常被忽视。也有研究以日本国立医药品食品卫生研究所第二届 Ames/QSAR 国际挑战赛的标准化实验结果为基准,分析自制模型表现不佳的原因,结论之一是数据代表性不足导致模型对化合物致突变性的预测不准确。
还有一个容易被低估的机制:数据漂移。现实世界是动态变化的,输入数据的统计特性可能偏离初始训练数据的状态。
为什么这类风险必须前置管控? 因为它的后果链条很硬:训练数据存在质量、完整性或代表性问题时,算法只能学习多数群体的特征,无法准确识别少数群体的疾病模式,进而加剧健康不平等;同时,算法对候选药物有效、无效或存在潜在毒性的判断都可能出现偏差。在算法偏差未被及时检测与纠正的情况下,这些候选药物会错误地进入后续试验阶段——一旦开展人体试验,就可能引发严重安全事件,乃至危及受试者生命。
3.2 知情同意缺失与隐私侵害
AI 对数据的巨大需求,直接挑战了"知情同意与数据保密"这一伦理审查的核心原则。
一方面,训练高效准确的模型依赖大量临床与生物医学数据,这些数据通常包含敏感的个人健康信息。未经患者知情同意径行收集、分析或共享,或为牟利滥用数据,将直接侵犯隐私权。另一方面,数据的广泛整合可能导致个人身份被重新识别,进而削弱匿名化与隐私保护的有效性。
一旦管理不当引发数据泄露,后果不只是侵权——个人健康数据泄露可能引发歧视和污名化,并进一步侵蚀公众对医学研究的信任。
3.3 "黑箱"与透明度缺失
这是 AI 监管中最具特殊性的一类。有别于可解释的、基于传统生物化学原理的研发模式,深度学习驱动的研发基于多层神经网络,天然具有显著的"黑箱"特性。
研究者能清楚认识模型的输入层和输出层,却难以追踪中间数量庞大的隐藏层所执行的具体计算与决策路径。当模型判断某个候选药物有效或存在风险时,人们往往无从得知其推理依据。
后果有两层:一是无法审查——难以验证逻辑合理性、识别潜在偏见,也就无法及时甄别和纠正安全隐患;二是责任归属不清——AI 辅助决策出问题时,可解释性不足会导致临床实践中的责任错位,降低人们对技术的信任。
3.4 性能会随时间漂移
已部署的 AI 模型可能利用运行中收集的数据不断扩展数据集,导致模型性能随时间发生变化,从而带来新的风险。这意味着"一次审批、长期有效"的传统思路在这里行不通。
四类风险叠加在一起,构成了对传统药品监管政策的根本挑战:需要构建适配的新型药品监管制度。
四、FDA 的应对:不是立法,而是指导性文件
这是美国做法中最值得注意的一点。
美国对 AI 辅助药物研发的监管,并非以成文法律的形式展开,而是有赖于 FDA 发布的一系列政策文件加以实现。
梳理时间线:
| 时间 | 文件 | 要点 |
|---|---|---|
| 2023 年 5 月 | 《人工智能与机器学习在药品和生物制品开发中的应用》讨论文件 | 系统梳理 AI/ML 在研发全过程中的应用与前景,探讨优势、风险与挑战,提出与利益相关方合作监管的路径 |
| 2024 年 3 月 | 《人工智能与医疗产品》报告(2025 年 1 月修正) | 阐述 AI 在医疗产品全生命周期中的应用与监管思路:促进多方合作、制定鼓励创新的监管政策、推动建立标准与最佳实践、开展性能评估和监测研究 |
| 2025 年 1 月 | 《使用人工智能支持药品和生物制品监管决策的考虑因素:产业及其他利益相关方》指南草案 | 提出基于风险的可信度评估框架,用于建立和评估 AI 在特定使用环境下的可信度 |
关键判断:这些指导性文件属于非立法性规则,不创设法律上的权利和义务,不具有法律上的拘束力,但可能对行政机关和公众产生事实上的拘束效果。
这个定性非常重要。它意味着 FDA 走的是一条渐进式政策试探的路径:通过通告评论程序征集意见,引入实验主义治理,逐步建立适应新兴技术的监管框架——而不是等技术完全成熟后一次性立法。
参照数据:那份 2025 年 1 月的草案指南整合了专家研讨会与公开研讨会的反馈,参考了逾 800 条外部意见;此前处理 500 余份含 AI 组件的药物申报材料的监管实践经验,也为指南草案的形成提供了关键依据。
五、四个具体着力点
5.1 数据治理:六项数据属性
FDA 计划在数据收集、共享和标准化等环节采取改进的监管措施,并明确了应当确保的数据属性:
完整性(数据完整、一致和准确)、可溯源性(能够追溯数据起源的记录链条,包括其在数据库、文档或资料库中的来源,以及数据如何、为何到达当前位置)、相关性、可重复性(回答同一问题的不同研究,即使各自独立获取数据,也能得到一致结果)、可复现性(相同输入数据、计算步骤、方法与代码及分析条件下可获得一致结果)、代表性(样本与目标群体具有足够相似性的可信度,特别是对可能被忽视的群体)。
同时,FDA 指出应参考美国国家标准与技术研究院出版的 《NIST 特别出版物 1270——人工智能偏见识别与管理标准研究》 来识别模型偏见。
隐私侧的硬要求:个人健康信息的收集、使用、存储和传输须严格遵守 HIPAA 等相关法规;用于训练的数据,研究者须获得知情同意——必须明确说明使用数据的方式,包括是否会用于训练人工智能、数据存储方式、隐私保护措施,以及撤回知情同意的权利。若受试者对数据使用方式、模型潜在偏见缺乏充分了解,就无法做出真正意义上的知情同意。此外应尽可能使用去标识化数据。
5.2 全生命周期监管:不是一次性审查
FDA 对模型的监管思路可以概括为三句话:
其一,审查使用场景。 评估模型性能时,需重点审查模型的开发和使用场景,包括模型开发是否有清晰的预设步骤、评估标准是否有明确书面记录。
其二,以风险定目标。 模型风险是确定可信度目标和开展相关活动的首要考量因素。
其三,定期评估 + 亚组分析。 一方面进行偏差检测,确保模型在不同人群和环境中的适用性;评估时应当覆盖目标使用人群整体以及相关亚组的表现——如果仅对总人群进行评估,某些亚组中较好的表现可能会掩盖其他亚组中较差的表现。另一方面,鉴于模型性能会随时间变化,持续监控与记录模型运行状态才是确保长期可靠性、相关性和一致性的关键措施。
5.3 基于风险的可信度评估框架
2025 年 1 月的指南草案提出的这个框架共分七步,用于评估特定使用场景下 AI 模型决策的可信度。文件强调应在模型全生命周期内确保可信度,避免性能随环境变化而退化,并鼓励研究者在早期与 FDA 沟通。
框架的核心要素可以归纳为六项:

图 3 · 基于风险的可信度评估框架
5.4 由人类主导的治理、透明度与问责制
人类主导的治理机制应贯穿 AI 应用的全周期,涵盖规划、开发、应用、修改及停用等环节。
这里有一个对工程实践很有启发的定义拆分。FDA 在 2024 年 3 月的《机器学习驱动型医疗设备的透明度:指导原则》中指出:
"透明度"指的是向相关受众传达机器学习决策系统预期用途、开发过程、性能表现以及可获取的逻辑机制等相关信息的清晰程度。
并且进一步拆成两个可操作的组成部分:
- “逻辑”——关于输出结果、决策或行动形成过程的依据;
- “可解释性”——该逻辑能否以人类可理解的方式阐释。
实施基于使用场景的风险管理计划,有助于指导书面记录、提高可解释性。 体现"逻辑"的书面记录能为特定使用场景下 AI 的规划、开发、运行及修改提供关键依据,而可解释性则能为输出结果提供证据支撑和逻辑依据。透明度是大规模应用 AI 的核心——因为利益相关者必须能理解进而信任 AI 的输出结果,AI 才能在药品审评和临床应用中真正发挥作用。
还有一个务实的取舍原则值得记住:在平衡性能与可解释性时,需要重点关注模型复杂度。当神经网络这类复杂模型与精简模型性能相近时,选择更传统、更简洁、参数更少的模型,可能带来整体优势。
六、对我国的启示
先看现状。我国目前对 AI 的监管,包括《网络安全法》《数据安全法》《个人信息保护法》中的相关规定,也包括《人工智能生成合成内容标识办法》《生成式人工智能服务管理暂行办法》《互联网信息服务深度合成管理规定》等规章和规范性文件的要求。
针对药品领域,国家药监局于 2024 年 6 月发布《药品监管人工智能典型应用场景清单》;工业和信息化部等七部门于 2025 年 3 月印发《医药工业数智化转型实施方案(2025—2030 年)》,其中包含《医药工业数智化转型典型应用场景》。
作者的核心判断是:我国在 AI 辅助药物研发乃至更广泛的药学领域应用方面,尚未出台具体的、可操作的和具有强制约束力的法律规范,相对更侧重于鼓励相关产业发展。 这在一定程度上反映了新兴技术的普遍特点——技术发展往往先于制度建设,相关政策与监管仍处于探索和观望阶段。
在此基础上,论文提出四条可借鉴的方向:
一、数据治理。 构建统一的数据框架,出台数据标准指南。一方面要求开发者在训练平台时设定专门检查程序,确保数据的相关性、可靠性和代表性,防止出现系统性的歧视;另一方面保护数据隐私,收集前充分告知并取得知情同意,使用时推广"数据最小必要"和"去标识化"原则。
二、模型治理。 建立贯穿模型全生命周期的监管体系。例如建立预先设定的控制变更计划,对模型可能经历的更新、优化和再训练过程进行规范管理,并将其纳入药械审批要求;又如设立周期性评估节点,定期检测模型性能是否出现偏差或新的潜在风险。
三、增加公众参与。 让科技企业与初创团队参与监管政策的形成。企业往往处于研究与应用的最前沿——例如 DeepMind 开发的 AlphaFold 在 2020 年 CASP(结构预测关键评估)赛事中超越了上百个人类科学家团队。可探索建立多元的常设专家委员会、定期举办研讨会与业界沟通。
四、强化"以人为本"原则。 确保关键决策和风险控制环节始终由具备专业判断的人类专家把关。具体做法包括:在模型开发各阶段规定必须有人类复核的环节;强制记录每次"人机协同"决策的审计日志,包括审核人、时间、审核意见及任何对模型结果的人工改动;日志须采用如区块链或数字签名等不可篡改的技术存储;模型的算法结构、参数设置、特征选择方法等关键细节必须披露。
顺带一提,国内已有落地进展:AI 制药企业英矽智能自主研发的特发性肺纤维化治疗药物已完成二期临床试验。
七、写在最后
这篇文章里我觉得最值得带走的,不是某个具体条款,而是三个结构性的判断:
第一,监管的形状由风险的形状决定。 数据偏见指向数据治理,黑箱指向透明度与可解释性,性能漂移指向全生命周期监管——监管的位置不是拍脑袋定的,是被风险倒推出来的。
第二,先用指导性文件跑通,再谈立法,是一种务实选择。 不具法律拘束力的文件,反而让监管方能在技术快速变化时保持调整空间——代价是确定性较低,收益是不容易把产业管死。
第三,AI 的合规成本,最终会落在工程细节上。 数据要可溯源、可复现,模型要记录运行状态、要评估亚组表现,人机协同要留审计日志——这些都不是"写个声明"能解决的,而是要在系统设计阶段就做进去。
对做医疗 AI 产品的团队来说,这三点基本就是一张需求清单。
参考资料
原文献位置:InfoXMed → 知识库 → 文献 中搜:
《The FDA’s regulation and implications for artificial Intelligence-assisted drug development in the United States》
更多细节,可看原文。
查阅指南、准备病例讨论和科室汇报,或是复习医学知识、刷题备考、阅读论文,都可以借助 InfoXMed:用翻译和 AI 解读辅助阅读,用论文问答梳理疑点,用思维导图和文献 PPT 整理学习与汇报材料。搜「InfoXMed」,从你当前的一项工作或学习任务开始体验。
标签 #性能优化 #论文阅读 #全文检索 #健康医疗
更多推荐


所有评论(0)