RadicalRetro: A Deep Learning-Based Retrosynthesis Model for Radical Reactions基于深度学习的自由基反应逆合成模型

大家好,我今天汇报的内容是自由基反应的逆合成预测,核心是论文提出的一个自由基专用单步逆合成模型 RadicalRetro,以及它配套构建的自由基反应数据库 RadicalDB。
我会按这个逻辑来讲:
-
为什么要把“自由基反应”单独拿出来做逆合成;
-
RadicalDB 怎么建、数据长什么样;
-
模型选型与训练策略:为什么最终是 Chemformer 微调成 RadicalRetro;
-
整体性能(Top-K)和不同反应类型上的差异;
-
可解释性:注意力热图为什么能和机理对应;
-
多步路线对比:通用模型 vs 自由基专用模型,差异体现在哪里。

这一页我想先把问题说清楚:传统逆合成和自由基逆合成本质上是两套“化学世界观”。
第一点:传统逆合成的主流范式。
逆合成最经典的框架来自 Corey 的思想:从目标分子出发,做“断键”,把复杂分子拆成更简单的前体。传统上我们更习惯于用两电子过程去理解反应——也就是极性反应、离子反应,比如 Suzuki、Heck、Aldol 这类。它们的机理往往比较“规整”:反应中心明确、官能团迁移路径清晰,所以人类化学家更容易做规则总结,也更容易做模板化。
第二点:为什么自由基(单电子过程)这十年特别重要。
近十年自由基反应发展非常快,背后原因主要是光催化、电催化、氧化还原体系变成熟了,让“产生和控制自由基”这件事更容易、更可控。结果就是:自由基反应越来越多地被用在药物分子构建里,特别适合做一些传统两电子过程不太好做的键构建、环化、官能团耐受更强的转化。
第三点:用一句人话解释自由基是什么。
自由基可以理解成“少了搭子”的孤单电子——它没成对,所以特别活泼,喜欢去找别的地方配对。落到化学反应里,就是带未成对电子的原子或片段,非常容易参与反应,经常会出现“跳跃式”“连锁式”“级联式”的反应过程。
第四点:自由基反应的优势(也是它在药物构建里香的原因)。
-
顺序成键 / 级联环化(cascade cyclization):一次反应能连着做多步成键;
-
区域/立体选择性潜力高:很多体系在适当条件下能走出很漂亮的选择性;
-
官能团耐受性好:对复杂底物更友好。
第五点:但问题也非常现实——自由基让“人脑设计路线”变难。
自由基中间体往往不稳定,机理分叉多,链引发/链转移/终止路径复杂。也就是说:
自由基反应很强,但“可预测性”和“可设计性”对人类更难。
所以这就引出了研究动机:能不能用深度学习把自由基反应的经验学出来,辅助我们做逆合成规划?这也是 RadicalDB 和 RadicalRetro 要解决的核心问题。

这一页讲的是:为什么作者要先花大力气做数据集,以及这个数据集有什么特点。
1)数据从哪里来、规模多大?
作者不是从现成数据库里“直接抓取”,而是做了相对重的工作:
-
手工筛选 2010–2023 年 3245 篇文献来构建 RadicalDB;
-
最终整理得到大约 21.6k 条自由基反应;
-
并且强调这些反应是实验验证的,同时做了质量筛选:比如收率 ≥ 50%、产物表征清晰等。
这一步的意义在于:自由基反应如果数据噪声很大,模型会学到很多“伪规律”,所以作者优先保证数据可靠。
2)反应怎么表示?(为什么用 SMILES)
这里采用的是反应 SMILES:
-
反应物之间用 “.” 分隔;
-
反应物与产物之间用 “>” 分隔;
-
每条记录保留文献来源,保证可追溯。
这样做的好处是:模型最终就是一个“字符串到字符串”的生成任务,输入产物 SMILES,输出反应物 SMILES,训练和推理都比较统一。
3)反应类型组成:多组分 vs 双组分
作者统计发现:
-
多组分自由基反应占 47.3%,双组分反应占其余部分;
-
多组分反应比例高,而且更倾向生成更大的分子。
这点非常关键:因为多组分意味着组合空间更大,对模型的“生成能力”要求更高,也更贴近药物分子的真实构建场景。
4)产物分子量分布与多样性
产物分子量分布接近正态,范围大约在 80–965。这说明数据覆盖从小分子到相对复杂分子,且没有过度集中在某一类“特别简单”的反应上。
同时作者用 T-map 做反应空间可视化,展示数据在空间里分布较广,支持“模型不是只记住少数模板”。
5)覆盖的自由基反应类别
数据集中包含多个经典命名反应:Barton–McCombie、Birch、Giese、Keck、Minisci 等;另外也分析了光/电催化自由基在数据集中的分布。
你可以强调一句:这个数据集是“传统命名反应 + 现代光电体系”的组合,因此适合训练一个更贴近近十年研究趋势的模型。

1)列名解释(为什么每列存在)
-
id:反应唯一编号,方便索引;
-
mapped(Atom-mapped SMILES):带原子映射的 SMILES。它告诉我们反应前后原子怎么对应,对理解机理和反应中心非常有用。作者这里也说明:这个项目主要用下面的 rxn 列做训练,但 mapped 作为机制分析的“黄金信息”被保留;
-
confidence:数据置信度,可以理解成自动提取/整理环节对该反应正确性的评分;
-
rxn(reaction):最关键的一列,标准反应式 SMILES,“反应物 >> 产物”,是模型训练的输入输出直接来源;
-
reference:文献来源,保证可追溯;
-
cls(reaction class):反应类型标签。作者在数据划分时会用它做分层抽样,确保训练集和测试集每种反应类型分布更均匀。
2)为什么要过滤“多产物反应”?
底部的代码逻辑很清晰:如果产物里用 “.” 分开后不止一个产物,直接丢弃。
作者解释也很典型:在单步逆合成任务里,通常把问题简化为“单产物逆推反应物”,多产物会引入额外复杂性(比如副产物、保护基、盐、配体等),会让模型目标不清晰。
你可以补一句总结:这是为了把任务定义得更干净,把模型能力集中在“从目标产物反推关键前体”。

这一页是模型方法论的关键:作者不是“拍脑袋”选一个模型,而是用三个代表性路线做对比适配。
作者拿了三个已有的 SOTA 单步逆合成模型做对比:LocalRetro、Mol-Transformer、Chemformer。最后把“在自由基数据集 RadicalDB 上专门训练后的 Chemformer 版本”命名为 RadicalRetro。
1)LocalRetro:GNN + 模板(template-based)
LocalRetro 把分子当图:原子是点,键是边。
它的核心思路是:先从产物预测反应中心、局部变化,然后去匹配/评分模板,最后生成反应物。
在这篇工作里,作者从 RadicalDB 里提取了很多局部模板(文中提到 2877 个),再让 LocalRetro 在 RadicalDB 上做逆合成。
你可以评价一句:模板法的优势是“可解释、结构约束强”,但短板是对数据覆盖依赖大——自由基反应如果多样性强,模板很容易“不够用”。
2)Mol-Transformer:Transformer 做 SMILES 翻译(template-free)
它把逆合成当成“语言翻译”:输入产物 SMILES,输出反应物 SMILES,不依赖模板。
作者采用 USPTO + RadicalDB 的混合训练(9:1),通过多任务/迁移让模型既学通用反应,也学自由基。
这里可以点出一个隐含信息:如果模型预训练/迁移不够强,可能在自由基域里会出现语法错误(后面会看到 invalid SMILES)。
3)Chemformer:更强的预训练 Transformer(BART 结构)
Chemformer 也是 Transformer,但它的关键优势是:
它不是从零学反应,而是先做大规模“语言预训练”,再学反应翻译。
预训练包括:
-
ZINC-15 分子预训练:mask SMILES 学“化学语法/分子模式”;
-
USPTO 反应预训练:学通用反应规律;
-
RadicalDB 微调:专门学习自由基断键方式(级联、单电子过程)。
因此最终 RadicalRetro 的强点其实是:通用化学知识 + 自由基领域适配结合得更好。

1)选用模型:Chemformer(基于 BART 的 Transformer 文本生成模型)
BART 的核心思想你可以用一句话解释:
把输入故意破坏,然后训练模型把它还原。
破坏方式包括加噪声、遮蔽、打乱顺序等,所以它也叫 去噪自编码器(denoising autoencoder)。
这样做的收益是:模型会学到更鲁棒的表示,适合迁移到各种生成任务——包括反应预测、逆合成、分子编辑等。
2)三阶段训练策略(非常建议你讲得“像流程图”)
-
阶段1:分子预训练(ZINC-15)
规模大概 ~100M 分子,做 Masked Language Modeling(span-masking),让模型学“原子/键的组合模式”。
你可以类比:先学会“拼写与语法”。 -
阶段2:反应预训练(USPTO)
大约 ~1M 反应,让模型学通用有机反应的断键/成键规律。
类比:学会“通用翻译规则”。 -
阶段3:自由基微调(RadicalDB)
在自由基反应上微调,使模型适配自由基特有断键方式与单电子过程偏好。
类比:学会“自由基方言”。
3)最终输出任务:单步逆合成(Backward prediction)
输入:产物 SMILES
输出:能够合成该产物的一组反应物 SMILES(自由基反应起始物/前体)

1)Top-K 的意思(用一句话讲清)
Top-1 就是模型给的第一条答案对不对;Top-3 就是前 3 条里只要有一条对就算对;Top-10 同理。
对于逆合成来说,Top-K 很合理,因为真实化学路线往往不止一种,模型给多个候选更符合“化学家筛选”的工作方式。
2)在 RadicalDB 上的 5-fold 交叉验证平均表现
RadicalRetro(Chemformer 微调)表现是:
-
Top-1:69.31%
-
Top-3:76.11%
-
Top-5:78.24%
-
Top-10:80.07%
解释 5-fold:数据分 5 份,轮流拿 1 份测试、4 份训练,做 5 次取平均,能减少偶然性,更可信。
3)与两个基线的差距
-
LocalRetro:Top-1 46.35%,Top-10 61.42%
-
Mol-Transformer:Top-1 43.91%,Top-10 63.54%
也就是说:RadicalRetro 在自由基数据集上明显领先,说明“自由基领域的专门学习”确实带来了增益。
4)为什么说这是“领域能力”的提升,而不是模型在任何数据集都更强?
作者特别强调:在通用数据集 USPTO-50K 上,Chemformer、LocalRetro、Mol-Transformer 的 Top-1 都在 51–54% 左右,差异不大。
所以 RadicalRetro 的提升主要来自:它在 RadicalDB 的领域内学到了自由基反应的“规律”。
5)invalid SMILES 的信息(这点很像模型质量指标)
从饼图能看到:
Mol-Transformer 的 invalid SMILES 比例更高(比如 4.30%),而 RadicalRetro 的 invalid 很低(比如 0.92%)。
这说明 Chemformer 这种强预训练模型不仅“猜得准”,还更“写得对”,生成结果更符合化学语法,减少了不可用答案。

1)按自由基引发方式拆分:光/电催化 vs 其他
-
光/电催化自由基反应:Top-1 ≈ 71.22%
-
其他自由基反应:Top-1 ≈ 60.96%
作者给的解释是:光/电催化近年来增长快、研究集中,反应模式相对“规整”,所以模型更容易学。
这说明模型对“标准化程度高、模式一致性强”的子领域更友好。
2)按命名反应拆分:哪些最好,哪些最难?
-
Faterno–Biichs、Meerwein arylation:Top-1 分别高到 ~92.31%、84.12%
-
Birch、Giese、Minisci:接近或略高于整体平均
-
Barton–McCombie 去氧反应:Top-1 ≈ 41.13%(最低)
原因:产物里大量 C–H,信息缺失严重——很难从产物唯一确定“哪个 H 原本来自 -OH”。
这句话非常关键:它告诉我们模型的瓶颈不一定是网络结构,而是反应本身的信息不可逆。
3)结论
RadicalRetro 对一些自由基反应学得非常好,但对“信息缺失严重”的反应仍然困难。
这也提示未来方向:要么引入更多信息(条件、试剂、原子映射),要么用多步推理/不确定性建模来处理这种歧义。

1)先讲案例图 a:经典自由基链式环化/加成
这里 1 是目标产物;2+3 是 RadicalRetro 预测的反应物组合。
其中 3 是 Bu₃SnH(三丁基氢化锡),经典自由基体系里常见的供氢剂/链转移试剂。
图里标注 1e⁻ 强调这是单电子过程。红色虚线标的是作者认为的新键形成/关键成键区域。
如果按下面的机理示意(蓝色箭头)理解,大概过程就是:
链引发产生自由基 → 对不饱和键加成 → 发生分子内环化/迁移 → 最后从 Bu₃SnH 抢氢终止 → 得到产物。
你可以点题:模型不仅给出了“能对上答案的反应物”,而且给的试剂组合很像化学家会选的自由基条件。
2)再讲案例图 b:更复杂的自由基成键/环化
6-4 是目标产物(更复杂多环);6-5 是模型预测的前体。
蓝色箭头提示可能是从 6-5 形成自由基(图里有 N· 的标记),然后发生分子内成键得到 6-4。
这一块你不用讲得太“机理细节”,但要强调:模型预测与“自由基环化”的人类直觉一致。
3)attention heatmap(c、d)怎么读?
这句话建议你按“横轴—纵轴—颜色”三句话讲完:
-
横轴:输入端——产物的 SMILES token 序列
-
纵轴:输出端——反应物的 SMILES token 序列
-
颜色越深:表示模型在生成某个输出 token 时,更关注输入里的哪些 token
红框圈出的区域,是作者认为“最有意义的注意力块”,通常会出现在:
-
产物中发生变化的官能团/成键区域(比如环化位置、π键附近、取代基连接点)
-
以及反应物中与之对应的结构片段(模型在做一种“对齐/映射”)
所以 1’–6’ 的含义可以总结为:
当模型决定输出关键反应物片段时,它的注意力确实集中在产物真正的反应中心附近。
这就给了一个“可解释性信号”:模型不是纯粹乱猜字符串,而是在学“哪里变、怎么拆”。


1)先定义 GeneralRetro 是什么
GeneralRetro 是 baseline:
-
用 ZINC-15 做分子预训练;
-
用 USPTO 做反应预训练;
-
但不在 RadicalDB 上微调。
所以它本质是“通用化学模型”,不一定理解自由基特性。
2)图里怎么对比?
-
蓝色框(6 和 11)是目标产物;
-
左半边是 GeneralRetro 的逆合成建议;右半边是 RadicalRetro 的建议;
-
2e⁻ 表示两电子/极性反应路径(比如有机锂、Wittig 等偏传统的极性化学)
-
1e⁻ 表示单电子/自由基思路
-
分子旁边的小黑点 “•” 表示自由基
-
红色虚线表示作者认为关键断键/成键位置
-
反应条件/步数也放在旁边,比如 Butyllithium −78°C 2 steps vs photocatalysis 室温 1 step
3)核心结论(这句要讲得有力)
RadicalRetro(自由基专用)更倾向给出:
-
“单电子自由基型”的断键方式与前体选择;
-
更符合现代自由基方法学(光/电、过渡金属 + 还原剂等);
-
条件更温和、步骤更少。
而 GeneralRetro 更容易给出:
-
传统两电子极性路线(更“教科书式”);
-
可能更苛刻/更多步。
所以这页想传达的是:
自由基专用模型不仅准确率更高,还能在路线风格上更贴近自由基化学的真实工作流,这对药物分子合成规划是有实际意义的。

最后我总结三点:
-
数据层面:RadicalDB 从 2010–2023 的文献中高质量整理了 21.6k 自由基反应,并做了规范化表示与分层标签;
-
模型层面:RadicalRetro = Chemformer(BART 预训练框架)在 RadicalDB 上微调,显著提升自由基逆合成 Top-K 表现,并降低 invalid SMILES;
-
理解层面:注意力热图与机理关键位点存在对应关系,多步案例也显示自由基专用模型更倾向给出更现代、更温和、更短步的自由基路线。
如果要做后续工作,我觉得可以往三个方向走:
-
加入反应条件/催化剂/溶剂等信息,让模型更“可执行”;
-
利用 atom-mapped 信息增强反应中心约束,缓解 Barton–McCombie 这类“信息缺失”问题;
-
从单步扩展到多步规划,把自由基路线与通用路线结合成一个更强的合成规划系统。
更多推荐
所有评论(0)