近乎自主的 AI 化学家改进了药物化学中的一类高难度反应
近乎自主的 AI 化学家改进了药物化学中的一类高难度反应
借助 Molecule.one 的 Maria,GPT-5.4 找到了一种出人意料的添加剂,使 Chan-Lam 偶联在超过 80% 的受测底物上实现了更高产率。
OpenAI 将这项工作视为更大目标的一部分:让先进 AI 成为真正实用的科研伙伴。在这个项目中,GPT-5.4 被接入 Molecule.one 的 Maria。它是一套与高通量实验室集成的 agentic 化学 AI。研究团队给它设定了一个开放式目标:改进一类在药物化学中十分重要的反应。
这套系统会提出研究方案、设计并执行实验、分析结果,并继续提出后续实验建议。整条链路中,人类化学家始终参与其中,包括调整 prompt、决定哪些方案进入实验室、在需要时修正实验细节、支持日常实验室操作,以及独立验证最终结果。
其中最有前景的方案 OAI-M1-03,聚焦于一种既难做但又很有价值的 Chan-Lam 偶联变体,也就是伯磺酰胺的偶联。GPT-5.4 识别出温和氧化剂可能是有帮助的添加剂,其中包括 TEMPO。在 Maria Lab 的两个实验轮次中,这一思路让 88% 的硼酸底物和 83% 的磺酰胺底物获得了更高产率。平均产率从 16.6% 提升到 25.2%,产率高于 30% 的反应占比则从 15.6% 提升到 37.5%。
随后,人类化学家在台式实验规模上重复了具有代表性的反应。验证结果显示,在 14 组底物配对中有 11 组获得了更高产率,其中大多数提升超过两倍。OpenAI 认为这点很关键,因为药物化学家需要的是能在微升尺度筛选流程之外、在实际药物发现实验环境里依然成立的反应。
为什么这个化学问题很重要
有机化学是小分子药物研发的基础,也支撑着农业、电子工业和材料科学中的大量研究。如果一种反应能在许多不同起始原料之间稳定形成同一种化学键,它的价值就会特别高。当产率偏低或者副产物过多时,化学家可能不得不放弃原本很有希望的分子,或者花费大量时间寻找另一条合成路线。
Chan-Lam 偶联之所以重要,是因为它能形成药物中常见的碳氮键。但伯磺酰胺与硼酸之间的偶联长期以来产率偏低,尽管磺酰胺广泛存在于肿瘤学、感染性疾病等领域的药物中。若能改进这类反应,药物化学家就能以更广泛、也更实用的方式去合成和探索有价值的分子。
将 GPT-5.4 接入 Maria AI 和实验室
这套组合系统把几种互补能力整合在一起。与 Maria AI 合作的科学家通过 prompt 以及围绕 GPT-5.4 构建的执行框架,生成并排序了数千个可能的研究方案。随后,人类化学家审阅其中排名最高的一部分,并选出 4 个进入实验室测试。
Maria AI 会把选中的高层方案转成详细的实验指令,执行数千次高通量实验,分析原始数据,再把结构化结果返回给 GPT-5.4。对于 OAI-M1-03,模型提出可以使用 TEMPO 这类温和氧化剂来改善磺酰胺 Chan-Lam 偶联。化学家认为这个建议既出人意料,也很有启发性。
最终方案随后被转成实验矩阵,并经过少量人工修正。其中最大的修正,是避免把二甲基亚砜(DMSO)用作溶剂,因为化学家担心它会与用作对照的较强氧化剂发生反应。
整个过程持续了三个月,从 3 月 4 日第一次输入 prompt,到 6 月 4 日将结果分享给独立专家。OpenAI 将这一流程描述为“近乎自主”,而非“完全自主”,因为人类化学家仍持续提供方向、判断与人工验证。
我们发现了什么
OAI-M1-03 识别出 TEMPO 是此次研究中的伯磺酰胺 Chan-Lam 偶联的一种有效添加剂。在优化后的条件下,这个反应在两个方面得到改善:平均产率提高了,而且有更多底物组合达到了具有实际价值的产率水平。
在两个实验轮次中,Maria 共执行了 10,080 次反应。OpenAI 认为这样的规模很重要,因为化学结果可能在少量案例中看起来不错,但一旦扩展到更广的分子范围就会失效。正是凭借这一实验量,研究团队才能在 10 种受测氧化剂中识别出 TEMPO,观察其在多样化组合中的效果,并理解它的一些局限。
在拿到第一轮数据后,系统又提出了更聚焦的第二轮实验,以验证后续假设。其中一个有价值的跟进结果是:可以用更便宜的类似物 4-hydroxy-TEMPO 替代 TEMPO,而性能几乎不受影响。
台式实验规模的验证支持了微升尺度实验结果。人类化学家手动复现了若干代表性反应,在 14 组底物配对中有 11 组观察到产率提升;其中 8 组的提升幅度超过两倍。OpenAI 还提到,4 位外部化学专家审阅了这篇预印本,并一致认为结果具有新颖性,值得分享;不过他们也强调,独立复现仍然是更有说服力的检验。
在同一个三个月周期内测试的另外三个 GPT-5.4 方案中,OAI-M1-02 和 OAI-M1-04 在 Maria Lab 中得到了实验支持,而 OAI-M1-01 则被证伪。对这些结果的分析仍在继续。
“高通量实验与现代 AI 的结合,代表着科学发现的新前沿。”
- Tim Cernak,密歇根大学药物化学副教授
局限性
OpenAI 表示,这项工作说明模型可以在有机化学中作出有用贡献,而且不只是总结文献或提出一次性的实验建议。在这个案例里,模型提出了一个具体且出人意料的假设,帮助设计实验、解释数据,并提出了后续研究方向。
但与此同时,OpenAI 也明确表示,这并不意味着 AI 已经能够独立完成端到端的化学研究项目。人类判断仍然不可或缺,整个流程依赖专门的高通量基础设施,而且这一结果也不能证明该方法可以推广到其他反应类别、底物家族或生产条件。
文中报告的产率估计来自高通量平台,而台式验证仅覆盖了 14 组代表性底物配对。要真正理解反应机理、梳理底物适用范围、测试不同条件下的表现,并由独立团队复现结果,仍然需要更多工作。
安全准备
OpenAI 表示,化学能力需要被谨慎对待,因为能够推动医药和材料科学的工具,也可能被滥用。公司称,这项工作的范围被刻意限定在一个正当的药物化学任务上:改进一种已知的偶联反应,用于合成类药分子。实验并未涉及毒素、化学武器,也没有包含设计有害化合物的请求;OpenAI 认为,这项结果不应被解读为系统具备处理这些有害应用的能力证据。
用于本研究的模型此前已经与 UK AI Security Institute 完成了相关评测,而且系统本身被设计为会拒绝有害请求。实验流程本身又增加了一层控制,因为由人类化学家决定哪些方案进入实验室、审查实验计划,并持续掌控实体实验设施。
接下来
OpenAI 表示,眼下的下一步仍然是科学问题本身:测试更广泛的起始原料,研究这些添加剂为何能改善反应,梳理这种效果在哪些条件下有效、在哪些条件下失效,并推动独立复现。这些研究将决定该方法究竟能在多大范围内适用,以及它在实际药物化学 workflow 中有多大价值。
从更长期看,目标是让 AI 系统成为可靠的科研伙伴,帮助研究人员提出假设、设计实验、解释结果,并决定下一步该测试什么,同时始终以专家判断、可靠测量和强有力的安全保障为基础。OpenAI 将这项成果视为一个更大方向的早期例子:前沿模型、专门 agents、自动化实验室与人类专家协同工作,以加速科研循环。