AI能接管实验室了?中国科大最新研究给出真实物理世界的压力测试

marsbitPublished on 2026-08-06Last updated on 2026-08-06

Abstract

中国科学技术大学的最新研究对AI能否接管实验室进行了真实物理世界的压力测试。团队构建了一个机器催化实验室,将实验能力封装为机器可读技能,供AI智能体调用。 研究系统评测了48种由不同智能体框架和大语言模型构成的配置,在超过4600次测试中,仅3.3%的AI生成工作流无需人工修复即可直接执行。表现最佳的组合可执行率也仅为28.1%。 测试发现,当前AI存在明显局限: 1. 其规划能力难以转化为可靠的实验执行能力。生成长序列、复杂逻辑的工作流仍是瓶颈。 2. AI能够根据实验结果调整实验参数,但基本停留在局部优化,缺乏识别研究策略根本问题、进行科学层面重新规划的能力,例如无法纠正持续存在的关键实验设计遗漏。 该研究区分了AI科学能力的三个层次:生成实验计划、生成可实际执行的工作流、根据结果调整整体策略。结果表明,目前AI主要停留在第一层,向第二、第三层的跨越仍有巨大差距。 该机器实验室平台既可作为检验AI科学能力的“测试场”,其产生的闭环数据也可用于训练AI,推动其实现从方案生成到端到端自主科学发现的进化。

我们如何判断人工智能是否已经足够聪明,能够从事科学研究,实现端到端的自主科学发现?

中国科学技术大学发布的最新研究让AI「大脑」接管机器科学家实验室「身体」,由此将这一问题从知识问答和方案生成,推进到真实物理世界中的实验执行与反馈学习。

论文链接:https://arxiv.org/abs/2607.23045

研究团队搭建了一个机器催化实验室,其中包括45个覆盖合成、表征和催化性能测试的模块化自动工作站。

为了让AI理解和调用实验室能力,研究团队将这些能力封装为机器可读技能(skills)。AI智能体可以通过这些技能直接调用实验设备,同时接受真实设备能力、操作规范和实验条件的约束。

图1.用于催化研究的AI读得懂的机器科学家实验室架构。

图2.从科学意图到机器实验室执行路径。

压力测试

基于该平台,研究团队对由6种智能体框架和9种大语言模型构成的48种实际配置进行了系统评测。

测试覆盖32项由领域专家定义的研究任务,共计4,608次评测试次。评估不仅考察智能体能否生成实验计划,还追踪这些计划能否通过核验并下发至机器人系统,以及生成的工作流是否能够在无需人工干预的情况下直接执行。

残酷的真实世界评测结果

当前领先的大语言模型智能体距离「接管」仍有明显差距。在4,608次测试中,仅151个工作流无需人工修复即可执行,占全部测试的3.3%。表现最好的Claude Code与Claude Opus 4.7组合,可执行率为28.1%;Codex与GPT 5.5组合的可执行率为19.8%。

会调整参数,不等于会重新规划

研究还进一步考察了智能体能否从真实实验结果中学习。团队将Codex/GPT 5.5的组合置于一个开放式的五轮闭环中,连续开展实验规划、机器人执行、证据获取和重新规划。

智能体能够根据返回的实验结果调整材料配方和操作条件,但这些调整主要停留在局部参数优化层面。

在五轮实验过程中,智能体始终保留原有的工作流骨架,没有重新设计分析方法,也未能纠正一些持续存在的关键遗漏,例如缺少电极黏结剂和针对特定分析物的显色试剂。

结果表明,能够读取实验反馈并调整参数,并不等同于能够识别研究策略本身的问题,更不等同于进行科学层面的重新规划。

图3.AI智能体在可执行规划、验证和实验室任务下发各环节的表现。

长程规划仍然是瓶颈

虽然部分智能体生成了经专家评估可执行、且最多包含44个操作步骤的工作流,但在全部测试中,只有3个工作流超过30个操作步骤。这表明,随着任务链条延长,智能体维持实验逻辑完整性和物理可执行性的能力仍面临显著挑战。

重新定义AI的科学能力

研究由此区分了当前「AI科学家」讨论中经常被混为一谈的三种能力:一是流畅地生成实验计划,二是生成能够在物理实验室中实际执行的工作流,三是根据实验结果调整整体研究策略。

研究结果显示,语言层面的规划能力并不能自动转化为可靠的实验执行能力,局部参数调整也不能被直接视为科学层面的重新规划。

从「AI测试场」走向「AI训练场」

作为AI for Science的智能科研基础设施,机器实验室既可以成为检验AI科学能力的「测试场」,也可以成为推动AI持续进化的「训练场」。AI智能体通过机器可读技能与机器实验室直接对话,将科学意图转化为可执行任务,并接收来自机器执行、仪器状态和实验结果的真实反馈。

由此形成的「规划—执行—反馈—重新规划」闭环,不仅能够暴露AI在知识、操作和研究策略层面的缺陷,还可以将成功的工作流、失败案例、实验结果和专家评估沉淀为模型训练与智能体对齐的数据,持续迭代AI模型及其智能体系统。

机器科学家由此为回答「我们如何判断人工智能是否已经足够聪明,能够从事科学研究?」提供可量化、可重复、可验证的物理世界证据,并推动AI从生成实验方案,逐步走向涵盖科学问题提出、实验设计、机器人执行、数据分析和证据驱动重新规划的端到端自主科学发现。

图4.开放科学问题下AI-机器科学家的五轮迭代。

参考资料:https://arxiv.org/abs/2607.23045

本文来自微信公众号“新智元”,作者:新智元;编辑:LRST

Trending Cryptos

Related Questions

Q中国科学技术大学的最新研究如何评估AI在真实物理世界中从事科学研究的当前能力?

A研究团队搭建了一个包含45个模块化自动工作站的机器催化实验室,并将其能力封装为机器可读技能供AI智能体调用。他们通过让AI直接执行领域专家定义的32项研究任务,进行了总计4,608次系统评测。评测严格追踪AI能否生成物理可执行、无需人工修复的实验工作流,并考察其根据真实实验结果进行学习和重新规划的能力。

Q在压力测试中,AI智能体表现如何?成功无需人工干预执行的工作流比例是多少?

A测试结果显示,当前领先的大语言模型智能体距离“接管”实验室仍有明显差距。在全部4,608次测试中,仅151个工作流无需人工修复即可由机器人系统直接执行,占总测试数的3.3%。表现最好的Claude Code与Claude Opus 4.7组合,可执行率为28.1%。

Q研究发现AI智能体在“从实验结果中学习”方面,存在哪些关键局限性?

A研究发现在一个开放式五轮闭环实验中,AI智能体虽然能够根据返回的实验结果调整材料配方和操作参数,但主要停留在局部优化层面。它始终保留原有的工作流骨架,未能进行科学层面的重新规划,例如没有重新设计分析方法,也未能纠正一些持续存在的关键实验步骤遗漏(如缺少电极黏结剂和显色试剂)。

Q该研究区分了“AI科学家”哪三种常被混淆的能力?

A该研究区分了以下三种能力:一是流畅地生成实验计划(语言层面的规划能力);二是生成能够在物理实验室中实际执行的工作流(物理可执行能力);三是根据实验结果调整整体研究策略(科学层面的重新规划能力)。研究指出,第一种能力不能自动转化为第二种,而局部的参数调整也不等于第三种能力。

Q机器科学家实验室在AI for Science领域扮演什么双重角色?

A机器科学家实验室扮演着双重角色:它既可以作为检验AI科学能力的“测试场”,通过真实物理世界的约束和反馈暴露AI在知识、操作和研究策略层面的缺陷;也可以作为推动AI持续进化的“训练场”,将成功的工作流、失败案例、实验结果和专家评估沉淀为训练数据,用于持续迭代和改进AI模型及其智能体系统。

Related Reads

Trading

Spot

Hot Articles

Discussions

Welcome to the HTX Community. Here, you can stay informed about the latest platform developments and gain access to professional market insights. Users' opinions on the price of AI (AI) are presented below.

活动图片