Scaling Law一招鲜?首个晶体结构操作基准,顶级大模型集体翻车
大模型在原子级材料操作任务中遭遇瓶颈。一项名为AtomWorld的最新基准测试(发表于ICML2026)显示,尽管大模型在理解文本和材料知识方面表现出色,但在需要精确操控三维原子结构的实操任务中,主流模型(如Claude、GPT、Gemini、Qwen等)表现普遍不佳。
研究发现,单纯依靠扩大模型参数和数据规模的“Scaling Law”(缩放定律)在此类任务上效果有限。模型规模增大能提升规则明确的任务(如原子替换、删除)的成功率,但对于需要三维空间理解和几何规划的操作(如绕原子旋转、区域删除),即使是最先进的模型,成功率也极低(例如旋转任务仅约12%)。这表明,语言推理能力不能直接等价于原子级的空间行动能力。
该研究指出,AI for Science需要从专注于文本语料的“Language Scaling”转向注重行动能力的“Action Scaling”。未来的科学智能体不仅需要理解知识,更必须在可执行任务、工具调用、环境反馈和物理验证的闭环中学习,才能真正成为能完成科研操作的助手。
marsbit07/15 03:56