Coscientist:大语言模型驱动的化学研究自动化革命
论文名称:Autonomous chemical research with large language models
论文地址:https://www.nature.com/articles/s41586-023-06792-0
在科学研究的漫长历程中,人类从未停止过对效率与突破的追求。从实验室里科学家手动记录实验数据的艰辛,到自动化设备的逐步应用,每一次技术革新都推动着科研的进步。而今,随着人工智能技术的飞速发展,一场更为深刻的变革正在化学研究领域悄然发生。2023 年 12 月 20 日,发表在《Nature》杂志上的一项研究,向世界展示了名为 Coscientist 的人工智能系统,它以 GPT-4 为核心驱动力,开启了自主设计、规划和执行复杂化学实验的新纪元。这不仅是技术层面的重大突破,更可能重塑整个化学研究的范式。
大语言模型与化学自动化的完美融合
近年来,以 transformer 为基础的大语言模型(LLMs)在各个领域都取得了令人瞩目的成就。从自然语言处理到生物研究,从化学探索到计算机编程,大语言模型的应用边界不断拓展。OpenAI 推出的 GPT-4 更是凭借其卓越的问题解决能力,在 SAT、BAR 考试、LeetCode 挑战等诸多任务中展现出了超越以往的水平,甚至在处理化学相关问题时也初露锋芒。
与此同时,化学研究的自动化进程也在稳步推进。从有机反应的自主发现与优化,到自动化流动系统和移动平台的开发,一系列成果为化学实验的自动化奠定了坚实基础。当实验室自动化技术与强大的大语言模型相遇,一个能够自主设计和执行科学实验的系统便应运而生,Coscientist 正是这一融合的杰出代表。
Coscientist 并非单一的模型,而是一个基于多语言模型的智能代理。它能够灵活运用各种工具,浏览互联网和相关文献,借助机器人实验应用程序接口(APIs),并利用其他大语言模型完成多样化的任务。这一系统的出现,并非孤立的探索,而是与其他领域的自主代理研究并行发展,在化学领域,ChemCrow 便是另一个相关的例子。
Coscientist 的核心架构与工作机制
Coscientist 的架构设计精妙且高效,各个模块协同工作,共同支撑起自主实验的全过程。其核心模块“Planner”如同系统的大脑,基于用户输入的目标,通过调用一系列定义好的命令来规划实验流程。Planner 本质上是一个 GPT-4 聊天完成实例,它将初始用户输入以及各种命令的输出都视为用户消息,从而不断调整和优化实验计划。

为了实现全面的功能覆盖,Planner 的系统提示以模块化的方式设计,包含了四个关键命令,构成了系统的行动空间:“GOOGLE”“PYTHON”“DOCUMENTATION”和“EXPERIMENT”。
“GOOGLE”命令负责通过“Web searcher”模块进行互联网搜索,而“Web searcher”本身也是一个大语言模型。它能够将用户的提示转化为合适的网络搜索查询,借助 Google Search API 执行搜索,浏览网页并将相关答案反馈给 Planner,为实验提供丰富的外部信息支持。
“PYTHON”命令则让 Planner 可以借助“Code execution”模块进行实验所需的计算。该模块在隔离的 Docker 容器中执行代码,有效保护用户的机器免受潜在风险,同时,Planner 背后的语言模型还能在出现软件错误时对代码进行修复,确保计算过程的准确性。
“DOCUMENTATION”命令如同一个知识宝库,为主要模块提供有关所需 API 的文档信息。通过检索和总结相关文档,帮助 Coscientist 准确理解和运用各种实验设备的接口,这对于系统与实验室硬件的有效交互至关重要。
“EXPERIMENT”命令则通过“DOCUMENTATION”模块所描述的 APIs 实现“Automation”,将实验计划转化为实际的操作指令,驱动实验设备完成具体的实验步骤。
这些模块相互配合,使 Coscientist 能够接收用户简单的纯文本输入提示,如“进行多个 Suzuki 反应”,并据此自主完成复杂的实验流程。
多任务验证:Coscientist 的实力彰显
为了全面展示 Coscientist 的多功能性和卓越性能,研究团队设计了六项任务对其进行验证,每一项任务都针对性地考验了系统不同方面的能力。
第一项任务是利用公开可用数据规划已知化合物的化学合成。研究团队设计了一个包含七种化合物的测试集,对比了不同大语言模型在合成规划任务中的表现。结果显示,不具备浏览功能的模型中,GPT-4 的两个版本表现最佳,Claude v.1.3 性能与之相近,而 GPT-3 表现明显较差,Falcon 40B 则在大多数情况下失败。所有非浏览模型在合成布洛芬时都出现了错误,对于硝基苯胺的合成,也只有 GPT-4 模型偶尔能给出正确答案。

而配备了 GPT-4 的 Web Searcher 则显著提升了合成规划的质量。在对乙酰氨基酚、阿司匹林、硝基苯胺和酚酞的合成中,它在所有试验中都获得了最高分。尽管在乙酸乙酯和苯甲酸的合成上,其表现略低于部分其他模型,这可能是由于这些化合物的普及性导致信息筛选难度增加,但总体而言,Web Searcher 展现出的能力凸显了将大语言模型与外部信息源相结合以避免“幻觉”的重要性。相比之下,基于 GPT-3.5 的 Web Searcher 由于在遵循输出格式指令方面存在不足,性能稍逊一筹。
第二项任务聚焦于高效搜索和浏览大量硬件文档。将大语言模型与实验室自动化相结合,关键挑战之一便是让 Coscientist 能够有效利用技术文档。Coscientist 通过向量搜索的方式,将 OT-2 API 文档的各个部分嵌入向量空间,再通过距离计算筛选出与 Planner 查询相关的文档内容,确保了对 API 的正确使用,例如为化学反应提供关于加热 - 振动硬件模块的必要信息。

对于更复杂的 Emerald Cloud Lab(ECL)机器人生态系统,研究团队开展了三项关于 ECL 符号实验室语言(SLL)的研究。在“prompt-to-function”研究中,Docs 搜索器能根据 ECL 提供的文档正确识别任务所需的函数;“prompt-to-SLL”研究中,系统能生成可在 ECL 成功执行的 SLL 代码,如高效液相色谱(HPLC)实验代码;“prompt-to-samples”研究则展示了系统根据搜索词从大量样本目录中识别相关储备溶液的能力。
第三项和第四项任务分别是使用文档在云实验室中执行高级命令,以及通过低级指令精确控制液体处理仪器。以 Opentrons OT-2 液体处理器为例,在不接入互联网的情况下,Coscientist 凭借提供的文档,能够根据简单的自然语言提示生成准确的协议,完成如为 96 孔板的每隔一行着色等任务。

第五项任务考验系统同时使用多个硬件模块并整合多种数据源的能力。研究团队设计了一个有趣的任务:让系统确定 96 孔板三个孔中分别存在的红、黄、蓝三种颜色及其位置。Coscientist 首先制备原始溶液的小样本,然后请求进行紫外 - 可见光谱测量,获取数据后生成 Python 代码分析最大吸收波长,最终结合光吸收原理正确识别出颜色及其位置。
第六项任务是解决需要分析先前收集实验数据的优化问题。研究团队选取了两个包含完整反应条件空间和产率数据的数据集,设计了一个以最大化反应产率为目标的“游戏”。Coscientist 在 20 次迭代内,通过选择特定反应条件并提供合理的化学解释,展现出了出色的化学推理能力。对比发现,有先验信息的 GPT-4 初始猜测更优,且随着迭代进行,GPT-4 基于的方法在归一化优势 metric(NMA)和归一化优势值上都优于标准贝叶斯优化,表明其能有效利用获取的信息指导后续实验。
复杂化学实验设计:从理论到实践的跨越
Coscientist 在复杂化学实验设计与执行方面的能力,在 Suzuki - Miyaura 和 Sonogashira 偶联反应中得到了充分体现。实验中使用的 OT-2 加热 - 振动模块是在 GPT-4 训练数据收集截止后发布的,这更凸显了系统利用文档和实时信息解决新问题的能力。
Coscientist 首先通过互联网搜索获取目标反应的信息、化学计量比和反应条件,正确选择对应反应的偶联伙伴。在不同的运行中,系统的策略会有所变化,但始终不会出现化学错误,例如不会为 Sonogashira 反应选择苯硼酸。系统还能对试剂选择做出合理解释,体现出对反应性和选择性等概念的理解。
在计算所有反应物所需体积并编写 OT-2 机器人的 Python 协议时,Coscientist 曾使用了错误的加热 - 振动模块方法名称,但它能通过 Docs 搜索器查阅 OT-2 文档,修正协议并成功运行。随后的气相色谱 - 质谱分析证实了两种反应都生成了目标产物,Suzuki 反应在 9.53 分钟处出现与联苯匹配的信号,Sonogashira 反应在 12.92 分钟处出现与参考化合物 fragmentation 模式相近的信号。
尽管此次实验的化合物空间有限,但研究团队通过计算实验评估了类似方法从大型化合物库中检索化合物的能力。Coscientist 在五种常见有机转化中的表现,取决于所查询的反应及其具体运行情况,展示了其在更广阔化学空间中的应用潜力。

化学推理与优化:Coscientist 的智能核心
Coscientist 的化学推理能力是其核心优势之一,能够利用先前收集的数据指导未来的行动,在反应优化任务中表现尤为突出。研究团队将优化过程设计为一场以最大化反应产率为目标的“游戏”,要求 Coscientist 在 20 次迭代内完成,每次迭代都需选择特定反应条件并提供合理的化学解释,同时记录对先前迭代结果的观察。
为了客观评估 Coscientist 的性能,研究团队采用了归一化优势 metric。优势定义为特定迭代产率与平均产率的差值,归一化优势则是优势与最大优势(最大产率与平均产率差值)的比率。归一化优势值为 1 表示达到最大产率,0 表示完全随机行为,小于 0 则表示性能低于随机水平。随着迭代次数增加,归一化优势值的上升充分体现了 Coscientist 的化学推理能力。
在 Suzuki 反应数据集上的对比实验显示,有先验信息的 GPT-4 初始猜测更优,无先验信息的 GPT-4 虽初始有较差猜测,但最终与有先验信息的模型收敛到相同的 NMA。而 GPT-3.5 由于无法正确输出指定格式的消息,数据点有限。与标准贝叶斯优化相比,两种基于 GPT-4 的方法在 NMA 和归一化优势值上均表现更优,贝叶斯优化的归一化优势值基本维持在零附近且不随时间增加,这可能源于两者探索/利用平衡策略的不同。
在 Buchwald - Hartwig 反应数据集上,使用化合物名称和 SMILES 字符串作为化合物表示的 GPT-4 性能相近,但系统即使在化合物以 SMILES 字符串表示时,也能对化合物的电子性质进行推理,进一步证明了其强大的化学推理能力。

未来展望与挑战:Coscientist 引领的新方向
Coscientist 的出现为化学研究带来了前所未有的机遇,但同时也面临着诸多挑战和需要探索的方向。
从技术层面来看,扩展 Planner 的行动空间以利用 Reaxys、SciFinder 等反应数据库,有望显著提升系统在多步合成等任务中的性能。采用 ReAct、Chain of Thought、Tree of Thoughts 等先进的提示策略,分析系统先前的陈述,也将有助于提高其准确性。
在实验自动化方面,尽管 Coscientist 已取得显著成果,但实现完全自动化仍有很长的路要走。例如在云实验室中,实验过程中出现的气泡等问题,凸显了开发自动化质量控制技术的重要性。未来通过网络搜索进一步明确和优化实验参数,如色谱柱化学性质、缓冲系统、梯度等,将能不断提升实验结果的质量。
伦理和安全问题也是 Coscientist 及类似人工智能系统发展过程中必须重视的方面。随着这些强大工具的广泛应用,如何防止其被用于非法活动和制造安全威胁,确保伦理和负责任的使用,是科研人员和政策制定者需要共同面对的挑战。研究团队也开展了关于 Coscientist 的双重用途研究,为应对潜在风险提供参考。
数据和代码的可用性是推动相关研究进一步发展的关键。由于安全考虑,Coscientist 的完整数据、代码和提示将在相关美国法规完善后才会全面发布。但研究团队提供了一个简化的实现版本和用于定量分析的生成输出,有助于其他研究者理解和借鉴其中的策略。
Coscientist 作为大语言模型驱动的自主化学研究系统,其成功不仅证明了人工智能在科学研究中的巨大潜力,更为化学乃至整个科学领域的自动化和智能化发展开辟了新的道路。随着技术的不断进步和完善,我们有理由相信,未来的科学研究将更加高效、精准,不断突破人类认知的边界,为解决全球性的科学难题贡献力量。Coscientist 只是一个开始,一个属于人工智能与科学研究深度融合的新时代正缓缓拉开序幕。
更多推荐




所有评论(0)