(来源:DrugAI DrugAI)
本文介绍一篇由中国科学院上海药物研究所杨伟波团队和浙江大学侯廷军团队合作发表于 Chem 的关于从头新反应发现(de novo reaction discovery)的研究论文。在该研究中,作者提出了一种三角关联策略(Triangle Association Strategy, TAS),通过挖掘已知反应之间由共同反应物建立的关联关系,系统性地提出潜在的新反应组合,并进一步构建反应条件关联度(Degree of Reaction-Condition Correlation, DRCC)指标,从已有反应数据中筛选具有较高兼容性的催化剂、配体、碱和溶剂等反应条件。与此同时,研究团队构建了反应性判别神经网络(Reactivity Discrimination Neural Network, RDN),将其作为独立的辅助评价工具,对TAS生成的候选反应空间进行计算验证和优先级排序。基于这一策略,研究团队成功发现了6种此前未见报道的过渡金属催化反应,涵盖两组分反应和多组分级联反应,并进一步实现了中等环硅杂环及大环分子的高效构建。该工作为从已有反应知识中系统性拓展未知反应空间提供了一种新的数据驱动研究框架,有望为药物化学、复杂分子合成及功能分子发现提供新的反应方法学工具。
研究背景
新成键反应的发现是推动有机合成化学持续发展的核心动力之一。过去一个世纪中,新型化学反应不断拓展可合成分子的结构空间,并为药物、材料及其他功能分子的发现提供了重要基础。然而,与已经高度体系化的反应优化和合成路线规划相比,“如何系统性地发现一个此前未知的新反应”仍然是合成化学中的基础性难题。传统的新反应发现通常依赖研究人员的化学直觉、偶然发现(serendipity)或大规模高通量筛选,不仅探索空间巨大,而且往往伴随着较高的时间和实验成本。
近年来,人工智能和数据驱动方法开始广泛应用于有机合成领域,包括反应结果预测、反应条件优化、催化剂设计、合成路线规划以及反应机理分析等任务。例如,机器学习已被用于预测Buchwald–Hartwig胺化中的多维反应参数效应,也可用于控制自动化合成平台和探索化学反应性。然而,现有方法的主要能力仍集中于已知反应类别内部的预测、优化和知识外推,其搜索空间通常受到已有反应模板、文献知识或预定义化学规则的限制,因此对于真正意义上的从头新反应发现仍存在明显局限。
针对这一问题,研究团队尝试从“反应之间是否存在可以系统挖掘的关联关系”这一角度重新思考新反应发现(图1)。作者受到社会网络中节点关联关系的启发,提出三角关联策略TAS:如果反应物 a 可以与反应物 c 发生反应,同时反应物 b 也可以与 c 发生反应,那么 a 与 b 之间存在发生新反应的潜在可能。例如,硼酸与芳基卤化物之间可以进行Suzuki偶联,胺与芳基卤化物之间可以进行Buchwald–Hartwig胺化,而硼酸与胺之间同样可以通过Chan–Lam偶联形成新的成键关系。这意味着,以共同反应物为“桥梁”,已知反应网络可能蕴含尚未被直接探索的反应组合。研究团队据此将传统在巨大化学空间中近似随机寻找新反应的过程比喻为“needle-in-a-haystack”,而TAS则通过反应关联预先缩小候选空间,将其转变为更有针对性的“fishing-in-a-pond”式探索。
图1. 新反应发现策略及TAS总体工作流程示意图。三角关联策略与反应条件关联度
TAS的核心并不是直接通过机器学习模型“生成”一种新反应,而是首先利用化学上具有明确含义的共同反应物建立已知反应之间的关联关系,并由此产生待验证的新反应假设。对于三种反应物 a、b、c,若已知存在 a+c 和 b+c 两类反应,则TAS将尚未知晓的 a+b 组合作为候选反应,并进一步利用已报道反应的条件信息评估这一候选反应的合理性(图2)。
为了对这种关联关系进行定量描述,作者进一步提出了反应条件关联度DRCC。研究中分别将与反应物 a、b、c 有关的全部反应条件定义为集合A、B和C。首先,通过A和B两个条件集合的交并比计算直接条件相关性:
随后考虑共同反应物 c 的作用,计算由 c 介导的条件关联程度:
前者反映反应物a和b在全部已知反应中的条件重合程度,而后者进一步限定在共同反应物c所定义的反应环境中,评价a和b所对应反应条件的一致性。如果TAS假设成立,则通过共同反应物c建立的条件关联应当能够更有效地聚焦潜在兼容条件,即
与
之间应表现出显著相关关系。
研究团队在30组TAS反应组合上进行统计分析后发现,两类DRCC指标之间具有较强的正相关性,Pearson相关系数达到 r = 0.8010,对应 p = 1.0560 × 10⁻⁷,从统计学层面支持了TAS所建立的反应关联关系。同时,在所分析体系中,通常低于相应的
,说明共同反应物c能够进一步收缩和聚焦a与b之间可能兼容的反应条件空间。
基于这一规律,研究团队建立了相应的反应条件筛选方式:首先优先考察A∩B∩C中共同出现的催化剂、配体、碱、溶剂等条件;如果三者交集为空或者所得结果不理想,再进一步从A∩B等条件空间中寻找可能的组合。由此,DRCC不仅用于判断候选反应之间的关联程度,还可以进一步作为新反应实验条件搜索的定量依据,从而减少完全随机的条件筛选。
图2. TAS的建立及DRCC统计学验证。结果与讨论
反应性判别神经网络对TAS候选空间的独立评价
为了进一步检验TAS是否能够富集具有潜在反应性的分子组合,研究团队建立了一个独立训练的反应性判别神经网络RDN(图3)。需要特别指出的是,在该研究中,机器学习并非承担自主发现新反应的角色,而主要作为固定的辅助评价工具,用于比较TAS所定义的候选反应空间与随机选择或直接条件相似性筛选得到的候选空间之间是否存在系统性差异。
图3. 基于RDN的TAS计算基准评价。RDN训练数据来源于Open Reaction Database(ORD)和USPTO反应数据。研究团队利用反应模板和Faiss分子相似性搜索产生候选反应物组合,并通过模板选择网络进一步构建可能发生反应和较难发生反应的样本。在此基础上训练多层感知器模型,根据两个反应物的分子指纹估计二者之间的潜在反应性。最终RDN在独立测试集上的准确率为72.72%,F1分数为73.62%。在TAS的基准评价中,研究团队进一步构建了包含 85,200个已知阳性反应物对 的候选集合,其中31,448对来自RDN测试集,53,752对来自独立的Reaxys反应数据,并排除了与RDN训练集存在反应物对重叠的样本。在统一使用固定RDN进行评价后,252个由TAS筛选得到的已知阳性反应物对获得了 88.10% 的RDN预测阳性率,其bootstrap 95%置信区间为 84.13%–92.06%。相比之下,从全部候选空间随机采样、在具有条件交集的候选空间中随机采样以及依据直接条件相似性进行Top-K选择的预测阳性率分别为 80.23% ± 2.50%、80.37% ± 2.49%和57.02% ± 2.73%。值得注意的是,由于该基准集合本身由已知阳性反应构成,因此这里的88.10%并不是实验“命中率”或普通分类准确率,而是固定RDN对不同候选选择策略产生的已知阳性反应物对所给出的预测阳性率。这一分析主要说明,与随机选择和直接反应条件相似性筛选相比,TAS定义的候选空间在独立反应性模型下表现出更明显的反应性特征富集。
TAS指导两组分新反应发现
在完成统计和计算验证后,研究团队进一步将TAS应用于实际的新反应发现(图4)。首先,作者选择C–H活化体系作为测试对象。以2-乙酰基吡啶、含CF₃的不饱和酮和B₂Pin₂构建三角关联关系:已有研究表明,2-乙酰基吡啶可以与B₂Pin₂发生C–H硼化,而不饱和酮可以与B₂Pin₂发生Michael加成。基于SciFinder收集相关反应条件后,计算得到 ,提示1a和1b之间可能存在新的反应路径。
图4. TAS指导的两组分新反应发现及反应条件优化。依据DRCC所确定的条件空间,初始筛选采用CuI、1,10-菲咯啉、K₂CO₃和叔丁醇等条件,最终发现了一种此前未报道的铜催化 C–H活化/环丙烷化反应。随后在A∩B条件空间内对催化剂、配体、碱和溶剂进行贝叶斯优化,经过4轮优化后,目标产物分离收率提高至 96%。此外,基于TAS的条件筛选还发现了一种新的氧介导C–H活化反应,其详细结果作为该研究的第6种新反应在补充材料中进行了报道。
随后,研究团队将TAS进一步应用于allenone相关反应。对于第二个体系,作者利用已知反应构建三角关联后得到。在Pd(dba)₂、XPhos、Cs₂CO₃和甲苯条件下,首次筛选即获得约13%的目标产物。经过5轮逐因素优化后,产率提高至 80%,并建立了稳定可重复的反应方案。该反应能够有效抑制allenone体系常见的1,2-烷基迁移,并保留相应的立体化学信息。在第三个体系中,研究团队进一步尝试通过allenone与silacyclobutane构建此前较为罕见的 [4+4]环加成反应。TAS分析显示,。初始条件即可获得约10%的八元含硅环产物,随后经过传统逐因素优化,57次实验将产率提高至 96%。为了进一步评价数据驱动条件优化的效率,研究团队又引入带有先验知识的贝叶斯优化,仅通过 4轮、7次实验 即找到最优条件,而随机采样预计需要约29次实验。这一结果进一步展示了TAS确定初始搜索空间后与条件优化算法相结合的潜力。从两组分反应进一步拓展至多组分反应和大环构建
在两组分反应取得成功后,研究团队进一步探索TAS能否用于更加复杂的多组分反应(Multicomponent Reactions, MCRs,图5)。多组分反应能够在单一反应体系中同时构建多个化学键,在提高步骤经济性、降低分离纯化需求以及快速构建复杂分子方面具有重要价值。
为了在不改变TAS基本逻辑的情况下将其扩展至多组分体系,作者设计了由前体 d 和 e 原位生成反应物 a 的策略,并继续利用a、b、c之间的三角关联关系进行反应条件推断。基于这一设计,研究团队发现了两种不同的 Rh(III)催化双C–H活化反应。进一步分析发现,在由DRCC确定的初始条件中,催化剂、氧化剂和碱等多个条件维度均与相关已知反应表现出明显的一致性,进一步支持了利用反应网络关联推断未知反应条件的可行性。在此基础上,研究团队将其中的Rh(III)催化双C–H活化反应进一步应用于大环化。通过在底物之间引入不同类型的连接基团,包括芳基酰胺、醚和酯等结构,可以有效构建 28元大环分子,并获得具有合成实用性的产率。大环化合物在药物发现中具有特殊价值,其较大的分子表面积和三维构象特征使其能够参与传统小分子较难调控的蛋白质相互作用界面,因此这些天然产物样大环骨架也为后续功能分子和药物先导结构探索提供了新的化学空间。
图5. TAS指导的多组分反应发现及大环化应用。结论
本研究提出了一个面向从头新反应发现的数据驱动三角关联策略TAS。与直接在庞大反应空间中随机搜索不同,TAS以共同反应物作为连接已知反应的“桥梁”,通过系统挖掘反应网络中的三角关联关系生成潜在的新反应假设,并进一步利用DRCC对候选反应的条件兼容性进行定量分析,从而同时实现对候选反应空间和实验条件空间的聚焦。独立训练的RDN进一步表明,TAS选择的候选反应物组合相较随机采样和直接条件相似性策略表现出更明显的反应性特征富集。基于TAS和DRCC,研究团队最终发现了 6种此前未报道的过渡金属催化反应,覆盖两组分反应、多组分级联反应、C–H活化、环加成及大环化等不同反应模式,并进一步实现了八元含硅环及28元大环等复杂结构的高效合成。值得注意的是,该工作的核心并非建立一个自主生成新反应的人工智能模型,而是通过化学反应网络关联、反应条件数据和机器学习辅助评价之间的协同,将新反应发现从高度依赖偶然性和经验的探索过程进一步转向可系统提出假设并进行优先级筛选的数据驱动过程。
目前,TAS仍在一定程度上依赖研究人员对候选底物及反应关联的经验性选择。作者指出,未来可进一步引入极性、氧化还原电位和电子效应等机理相关描述符,以减少对经验性底物选择的依赖,并将TAS拓展至更加多样的反应类型。总体而言,该研究为利用已有化学反应知识系统性探索未知反应空间提供了一种新的研究思路,也为数据科学与实验合成化学协同推动新反应、新骨架及潜在药物分子的发现提供了新的方法学基础。
参考资料
Bian Y., Wang X., Ma X., et al. A triangle association strategy for de novo reaction discovery. Chem 13, 103204.
https://doi.org/10.1016/j.chempr.2026.103204.