大家好,我今天汇报的内容是自由基反应的逆合成预测,核心是论文提出的一个自由基专用单步逆合成模型 RadicalRetro,以及它配套构建的自由基反应数据库 RadicalDB
我会按这个逻辑来讲:

  1. 为什么要把“自由基反应”单独拿出来做逆合成;

  2. RadicalDB 怎么建、数据长什么样;

  3. 模型选型与训练策略:为什么最终是 Chemformer 微调成 RadicalRetro;

  4. 整体性能(Top-K)和不同反应类型上的差异;

  5. 可解释性:注意力热图为什么能和机理对应;

  6. 多步路线对比:通用模型 vs 自由基专用模型,差异体现在哪里。

这一页我想先把问题说清楚:传统逆合成自由基逆合成本质上是两套“化学世界观”。

第一点:传统逆合成的主流范式。
逆合成最经典的框架来自 Corey 的思想:从目标分子出发,做“断键”,把复杂分子拆成更简单的前体。传统上我们更习惯于用两电子过程去理解反应——也就是极性反应、离子反应,比如 Suzuki、Heck、Aldol 这类。它们的机理往往比较“规整”:反应中心明确、官能团迁移路径清晰,所以人类化学家更容易做规则总结,也更容易做模板化。

第二点:为什么自由基(单电子过程)这十年特别重要。
近十年自由基反应发展非常快,背后原因主要是光催化、电催化、氧化还原体系变成熟了,让“产生和控制自由基”这件事更容易、更可控。结果就是:自由基反应越来越多地被用在药物分子构建里,特别适合做一些传统两电子过程不太好做的键构建、环化、官能团耐受更强的转化。

第三点:用一句人话解释自由基是什么。
自由基可以理解成“少了搭子”的孤单电子——它没成对,所以特别活泼,喜欢去找别的地方配对。落到化学反应里,就是带未成对电子的原子或片段,非常容易参与反应,经常会出现“跳跃式”“连锁式”“级联式”的反应过程。

第四点:自由基反应的优势(也是它在药物构建里香的原因)。

  • 顺序成键 / 级联环化(cascade cyclization):一次反应能连着做多步成键;

  • 区域/立体选择性潜力高:很多体系在适当条件下能走出很漂亮的选择性;

  • 官能团耐受性好:对复杂底物更友好。

第五点:但问题也非常现实——自由基让“人脑设计路线”变难。
自由基中间体往往不稳定,机理分叉多,链引发/链转移/终止路径复杂。也就是说:

自由基反应很强,但“可预测性”和“可设计性”对人类更难。
所以这就引出了研究动机:能不能用深度学习把自由基反应的经验学出来,辅助我们做逆合成规划?这也是 RadicalDB 和 RadicalRetro 要解决的核心问题。

这一页讲的是:为什么作者要先花大力气做数据集,以及这个数据集有什么特点。

1)数据从哪里来、规模多大?
作者不是从现成数据库里“直接抓取”,而是做了相对重的工作:

  • 手工筛选 2010–2023 年 3245 篇文献来构建 RadicalDB;

  • 最终整理得到大约 21.6k 条自由基反应

  • 并且强调这些反应是实验验证的,同时做了质量筛选:比如收率 ≥ 50%、产物表征清晰等。
    这一步的意义在于:自由基反应如果数据噪声很大,模型会学到很多“伪规律”,所以作者优先保证数据可靠。

2)反应怎么表示?(为什么用 SMILES)
这里采用的是反应 SMILES:

  • 反应物之间用 “.” 分隔;

  • 反应物与产物之间用 “>” 分隔;

  • 每条记录保留文献来源,保证可追溯。
    这样做的好处是:模型最终就是一个“字符串到字符串”的生成任务,输入产物 SMILES,输出反应物 SMILES,训练和推理都比较统一。

3)反应类型组成:多组分 vs 双组分
作者统计发现:

  • 多组分自由基反应占 47.3%,双组分反应占其余部分;

  • 多组分反应比例高,而且更倾向生成更大的分子。
    这点非常关键:因为多组分意味着组合空间更大,对模型的“生成能力”要求更高,也更贴近药物分子的真实构建场景。

4)产物分子量分布与多样性
产物分子量分布接近正态,范围大约在 80–965。这说明数据覆盖从小分子到相对复杂分子,且没有过度集中在某一类“特别简单”的反应上。
同时作者用 T-map 做反应空间可视化,展示数据在空间里分布较广,支持“模型不是只记住少数模板”。

5)覆盖的自由基反应类别
数据集中包含多个经典命名反应:Barton–McCombie、Birch、Giese、Keck、Minisci 等;另外也分析了光/电催化自由基在数据集中的分布。
你可以强调一句:这个数据集是“传统命名反应 + 现代光电体系”的组合,因此适合训练一个更贴近近十年研究趋势的模型。

1)列名解释(为什么每列存在)

  • id:反应唯一编号,方便索引;

  • mapped(Atom-mapped SMILES):带原子映射的 SMILES。它告诉我们反应前后原子怎么对应,对理解机理和反应中心非常有用。作者这里也说明:这个项目主要用下面的 rxn 列做训练,但 mapped 作为机制分析的“黄金信息”被保留;

  • confidence:数据置信度,可以理解成自动提取/整理环节对该反应正确性的评分;

  • rxn(reaction):最关键的一列,标准反应式 SMILES,“反应物 >> 产物”,是模型训练的输入输出直接来源;

  • reference:文献来源,保证可追溯;

  • cls(reaction class):反应类型标签。作者在数据划分时会用它做分层抽样,确保训练集和测试集每种反应类型分布更均匀。

2)为什么要过滤“多产物反应”?
底部的代码逻辑很清晰:如果产物里用 “.” 分开后不止一个产物,直接丢弃。
作者解释也很典型:在单步逆合成任务里,通常把问题简化为“单产物逆推反应物”,多产物会引入额外复杂性(比如副产物、保护基、盐、配体等),会让模型目标不清晰。
你可以补一句总结:这是为了把任务定义得更干净,把模型能力集中在“从目标产物反推关键前体”。

这一页是模型方法论的关键:作者不是“拍脑袋”选一个模型,而是用三个代表性路线做对比适配。

作者拿了三个已有的 SOTA 单步逆合成模型做对比:LocalRetro、Mol-Transformer、Chemformer。最后把“在自由基数据集 RadicalDB 上专门训练后的 Chemformer 版本”命名为 RadicalRetro

1)LocalRetro:GNN + 模板(template-based)

LocalRetro 把分子当图:原子是点,键是边。
它的核心思路是:先从产物预测反应中心、局部变化,然后去匹配/评分模板,最后生成反应物。
在这篇工作里,作者从 RadicalDB 里提取了很多局部模板(文中提到 2877 个),再让 LocalRetro 在 RadicalDB 上做逆合成。
你可以评价一句:模板法的优势是“可解释、结构约束强”,但短板是对数据覆盖依赖大——自由基反应如果多样性强,模板很容易“不够用”。

2)Mol-Transformer:Transformer 做 SMILES 翻译(template-free)

它把逆合成当成“语言翻译”:输入产物 SMILES,输出反应物 SMILES,不依赖模板。
作者采用 USPTO + RadicalDB 的混合训练(9:1),通过多任务/迁移让模型既学通用反应,也学自由基。
这里可以点出一个隐含信息:如果模型预训练/迁移不够强,可能在自由基域里会出现语法错误(后面会看到 invalid SMILES)。

3)Chemformer:更强的预训练 Transformer(BART 结构)

Chemformer 也是 Transformer,但它的关键优势是:
它不是从零学反应,而是先做大规模“语言预训练”,再学反应翻译。
预训练包括:

  • ZINC-15 分子预训练:mask SMILES 学“化学语法/分子模式”;

  • USPTO 反应预训练:学通用反应规律;

  • RadicalDB 微调:专门学习自由基断键方式(级联、单电子过程)。
    因此最终 RadicalRetro 的强点其实是:通用化学知识 + 自由基领域适配结合得更好。

1)选用模型:Chemformer(基于 BART 的 Transformer 文本生成模型)
BART 的核心思想你可以用一句话解释:

把输入故意破坏,然后训练模型把它还原
破坏方式包括加噪声、遮蔽、打乱顺序等,所以它也叫 去噪自编码器(denoising autoencoder)
这样做的收益是:模型会学到更鲁棒的表示,适合迁移到各种生成任务——包括反应预测、逆合成、分子编辑等。

2)三阶段训练策略(非常建议你讲得“像流程图”)

  • 阶段1:分子预训练(ZINC-15)
    规模大概 ~100M 分子,做 Masked Language Modeling(span-masking),让模型学“原子/键的组合模式”。
    你可以类比:先学会“拼写与语法”。

  • 阶段2:反应预训练(USPTO)
    大约 ~1M 反应,让模型学通用有机反应的断键/成键规律。
    类比:学会“通用翻译规则”。

  • 阶段3:自由基微调(RadicalDB)
    在自由基反应上微调,使模型适配自由基特有断键方式与单电子过程偏好。
    类比:学会“自由基方言”。

3)最终输出任务:单步逆合成(Backward prediction)
输入:产物 SMILES
输出:能够合成该产物的一组反应物 SMILES(自由基反应起始物/前体)

1)Top-K 的意思(用一句话讲清)
Top-1 就是模型给的第一条答案对不对;Top-3 就是前 3 条里只要有一条对就算对;Top-10 同理。
对于逆合成来说,Top-K 很合理,因为真实化学路线往往不止一种,模型给多个候选更符合“化学家筛选”的工作方式。

2)在 RadicalDB 上的 5-fold 交叉验证平均表现
RadicalRetro(Chemformer 微调)表现是:

  • Top-1:69.31%

  • Top-3:76.11%

  • Top-5:78.24%

  • Top-10:80.07%
    解释 5-fold:数据分 5 份,轮流拿 1 份测试、4 份训练,做 5 次取平均,能减少偶然性,更可信。

3)与两个基线的差距

  • LocalRetro:Top-1 46.35%,Top-10 61.42%

  • Mol-Transformer:Top-1 43.91%,Top-10 63.54%
    也就是说:RadicalRetro 在自由基数据集上明显领先,说明“自由基领域的专门学习”确实带来了增益。

4)为什么说这是“领域能力”的提升,而不是模型在任何数据集都更强?
作者特别强调:在通用数据集 USPTO-50K 上,Chemformer、LocalRetro、Mol-Transformer 的 Top-1 都在 51–54% 左右,差异不大。
所以 RadicalRetro 的提升主要来自:它在 RadicalDB 的领域内学到了自由基反应的“规律”。

5)invalid SMILES 的信息(这点很像模型质量指标)
从饼图能看到:
Mol-Transformer 的 invalid SMILES 比例更高(比如 4.30%),而 RadicalRetro 的 invalid 很低(比如 0.92%)。
这说明 Chemformer 这种强预训练模型不仅“猜得准”,还更“写得对”,生成结果更符合化学语法,减少了不可用答案。

1)按自由基引发方式拆分:光/电催化 vs 其他

  • 光/电催化自由基反应:Top-1 ≈ 71.22%

  • 其他自由基反应:Top-1 ≈ 60.96%
    作者给的解释是:光/电催化近年来增长快、研究集中,反应模式相对“规整”,所以模型更容易学。
    这说明模型对“标准化程度高、模式一致性强”的子领域更友好。

2)按命名反应拆分:哪些最好,哪些最难?

  • Faterno–Biichs、Meerwein arylation:Top-1 分别高到 ~92.31%84.12%

  • Birch、Giese、Minisci:接近或略高于整体平均

  • Barton–McCombie 去氧反应:Top-1 ≈ 41.13%(最低)
    原因:产物里大量 C–H,信息缺失严重——很难从产物唯一确定“哪个 H 原本来自 -OH”。
    这句话非常关键:它告诉我们模型的瓶颈不一定是网络结构,而是反应本身的信息不可逆

3)结论
RadicalRetro 对一些自由基反应学得非常好,但对“信息缺失严重”的反应仍然困难。
这也提示未来方向:要么引入更多信息(条件、试剂、原子映射),要么用多步推理/不确定性建模来处理这种歧义。

1)先讲案例图 a:经典自由基链式环化/加成
这里 1 是目标产物;2+3 是 RadicalRetro 预测的反应物组合。
其中 3 是 Bu₃SnH(三丁基氢化锡),经典自由基体系里常见的供氢剂/链转移试剂。
图里标注 1e⁻ 强调这是单电子过程。红色虚线标的是作者认为的新键形成/关键成键区域。
如果按下面的机理示意(蓝色箭头)理解,大概过程就是:
链引发产生自由基 → 对不饱和键加成 → 发生分子内环化/迁移 → 最后从 Bu₃SnH 抢氢终止 → 得到产物。
你可以点题:模型不仅给出了“能对上答案的反应物”,而且给的试剂组合很像化学家会选的自由基条件。

2)再讲案例图 b:更复杂的自由基成键/环化
6-4 是目标产物(更复杂多环);6-5 是模型预测的前体。
蓝色箭头提示可能是从 6-5 形成自由基(图里有 N· 的标记),然后发生分子内成键得到 6-4。
这一块你不用讲得太“机理细节”,但要强调:模型预测与“自由基环化”的人类直觉一致。

3)attention heatmap(c、d)怎么读?
这句话建议你按“横轴—纵轴—颜色”三句话讲完:

  • 横轴:输入端——产物的 SMILES token 序列

  • 纵轴:输出端——反应物的 SMILES token 序列

  • 颜色越深:表示模型在生成某个输出 token 时,更关注输入里的哪些 token

红框圈出的区域,是作者认为“最有意义的注意力块”,通常会出现在:

  • 产物中发生变化的官能团/成键区域(比如环化位置、π键附近、取代基连接点)

  • 以及反应物中与之对应的结构片段(模型在做一种“对齐/映射”)

所以 1’–6’ 的含义可以总结为:

当模型决定输出关键反应物片段时,它的注意力确实集中在产物真正的反应中心附近。
这就给了一个“可解释性信号”:模型不是纯粹乱猜字符串,而是在学“哪里变、怎么拆”。

1)先定义 GeneralRetro 是什么
GeneralRetro 是 baseline:

  • 用 ZINC-15 做分子预训练;

  • 用 USPTO 做反应预训练;

  • 但不在 RadicalDB 上微调
    所以它本质是“通用化学模型”,不一定理解自由基特性。

2)图里怎么对比?

  • 蓝色框(6 和 11)是目标产物;

  • 左半边是 GeneralRetro 的逆合成建议;右半边是 RadicalRetro 的建议;

  • 2e⁻ 表示两电子/极性反应路径(比如有机锂、Wittig 等偏传统的极性化学)

  • 1e⁻ 表示单电子/自由基思路

  • 分子旁边的小黑点 “•” 表示自由基

  • 红色虚线表示作者认为关键断键/成键位置

  • 反应条件/步数也放在旁边,比如 Butyllithium −78°C 2 steps vs photocatalysis 室温 1 step

3)核心结论(这句要讲得有力)
RadicalRetro(自由基专用)更倾向给出:

  • “单电子自由基型”的断键方式与前体选择;

  • 更符合现代自由基方法学(光/电、过渡金属 + 还原剂等);

  • 条件更温和、步骤更少。

而 GeneralRetro 更容易给出:

  • 传统两电子极性路线(更“教科书式”);

  • 可能更苛刻/更多步。

所以这页想传达的是:

自由基专用模型不仅准确率更高,还能在路线风格上更贴近自由基化学的真实工作流,这对药物分子合成规划是有实际意义的。

最后我总结三点:

  1. 数据层面:RadicalDB 从 2010–2023 的文献中高质量整理了 21.6k 自由基反应,并做了规范化表示与分层标签;

  2. 模型层面:RadicalRetro = Chemformer(BART 预训练框架)在 RadicalDB 上微调,显著提升自由基逆合成 Top-K 表现,并降低 invalid SMILES;

  3. 理解层面:注意力热图与机理关键位点存在对应关系,多步案例也显示自由基专用模型更倾向给出更现代、更温和、更短步的自由基路线。

如果要做后续工作,我觉得可以往三个方向走:

  • 加入反应条件/催化剂/溶剂等信息,让模型更“可执行”;

  • 利用 atom-mapped 信息增强反应中心约束,缓解 Barton–McCombie 这类“信息缺失”问题;

  • 从单步扩展到多步规划,把自由基路线与通用路线结合成一个更强的合成规划系统。

更多推荐