尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

NatureBench:清华新基准揭示,AI编码智能体仅17.8%超越Nature论文SOTA

NatureBench:清华新基准揭示,AI编码智能体仅17.8%超越Nature论文SOTA NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?作者Yuru Wang, Lejun Cheng, Yuxin Zuo, Sihang Zeng, Bingxiang He, Che Jiang, Junlin Yang, Yuchong Wang, Kaikai Zhao, Weifeng Huang, Kai Tian, Zhenzhao Yuan, Jincheng Zhong, Weizhi Wang, Ning Ding, Bowen Zhou, Kaiyan Zhang核心发表机构Frontis.AI、Tsinghua University论文链接arXiv:2606.24530v2发布于arXiv 预印本cs.CL|—|—|—|—|—|—|—|| Claude Opus 4.7 | Claude Code |17.8|47.8|−0.007| −4.54 |100.0|100.0|| GLM-5.2 | Claude Code | 15.6 | 41.1 | −0.058 | −3.85 | 96.7 | 98.9 || Gemini 3.5 Flash | Gemini CLI | 15.6 | 37.8 | −0.083 | −5.71 | 94.4 | 98.9 || GPT-5.5 | Codex CLI | 14.4 | 44.4 | −0.055 | −2.81 | 84.4 | 98.9 || Claude Opus 4.6 | Claude Code | 12.2 | 36.7 | −0.061 |−2.02|100.0|100.0|| MiniMax-M3 | Claude Code | 11.1 | 33.3 | −0.103 | −5.90 | 98.9 | 98.9 || Qwen 3.7 Max | Claude Code | 10.0 | 28.9 | −0.121 | −2.94 | 95.6 | 98.9 || Kimi K2.6 | Claude Code | 8.9 | 30.0 | −0.142 | −10.11 | 92.2 | 94.4 || GPT-5.4 | Codex CLI | 8.9 | 27.8 | −0.123 | −3.72 | 94.4 |100.0|| GLM-5.1 | Claude Code | 7.8 | 28.9 | −0.150 | −8.44 | 93.3 | 93.3 || DeepSeek-V4-Pro | Claude Code | 4.4 | 26.7 | −0.242 | −8.57 | 98.9 | 98.9 || MiniMax-M2.7 | Claude Code | 1.1 | 13.3 | −0.401 | −11.76 | 93.3 | 98.9 |核心发现显著超越已发表 SOTA 对全部 12 个配置而言都是罕见事件。即使最强的 Claude Opus 4.7也仅在 17.8% 的任务上实现g 0.1 g0.1g0.1的超越在不到一半的任务上匹配 SOTA。中位数相对差距g ~ a l l \tilde{g}_{\mathrm{all}}g~​all​最强为− 0.007 -0.007−0.007几乎贴零最弱为− 0.401 -0.401−0.401。图 6 展示了所有任务上的 gap 分布与各配置摘要。大多数任务落在略低于 SOTA的位置而非达到 SOTA 或严重失败少数任务携带极端负值——这是因为 SOTA 归一化差距会放大大幅落后均值被严重拉低。因此论文将 Surpass-SOTA 和 Match-SOTA 作为主要指标将中位数作为辅助汇总均值仅作参考。完成率与有效性方面两个 Claude Opus 配置的 SR提交率和 CR有效/可信率均为 100%没有任何被裁判标记为已评分但无效的捷径提交——因此它们未匹配的任务反映的是真实的性能短板而非方法无效。GPT-5.5 尝试捷径最多13 个无效提交被过滤但其第二高的 Match-SOTA44.4%以及唯一在裁判接受的子集上非负的中位差距g ~ v a l i d 0.001 \tilde{g}_{\mathrm{valid}} 0.001g~​valid​0.001仍然是真实的。GLM-5.1 的 SR 最低93.3%在其未评分的任务上该智能体自己的方案从未产生可评分提交。领域差异方面六个科学领域形成了跨智能体共享的难度梯度。按共识 Match-SOTA 率排序关系推理60.0% 蛋白质生物学37.5% 细胞组学35.5% 物理建模26.9% 分子设计18.2% 生物医学建模17.9%。中位差距佐证了这一分层较容易层的中位相对差距保持在 8% 以内g ~ − 0.08 \tilde{g} -0.08g~​−0.08较难层则超过 20%g ~ − 0.20 \tilde{g} -0.20g~​−0.20。全部 10 个被分析智能体的领域排序与该共识排序正相关Spearman ρ 从 0.71 到 1.00其中 9 个 ≥ 0.77说明这种跨领域差异是各智能体共享的而非特定模型的特有现象。值得注意的是没有任何智能体在分子设计和关系推理两个领域上实现 Surpass-SOTAS 率为 0.0%但关系推理的 Match-SOTA 率普遍高达 60%Qwen 3.7 Max 为 40%MiniMax-M2.7 为 20%说明该领域有相当一部分任务智能体能够达到 SOTA 但极少超越。物理建模是 Surpass-SOTA 率最高的领域Claude Opus 4.7 和 Gemini 3.5 Flash 均为 30.8%。跨学科任务进一步拉大了智能体与 SOTA 的差距。15 个跨学科任务与 75 个单学科任务相比合并后的中位g ~ a l l \tilde{g}_{\mathrm{all}}g~​all​从− 0.13 -0.13−0.13降至− 0.21 -0.21−0.2110 个智能体中有 9 个朝此方向移动Match-SOTA 率从 33.1% 降至 28.0%10 个智能体中有 8 个更低。跨领域知识整合仍然是当前大多数智能体的突出挑战。4.3 消融实验 / Ablation StudyNatureBench 作为基准评测工作不包含模型训练的消融本节对应的消融体现为对基准构建质量和评估协议有效性的系统性审计以及三段代表性案例的深度分析。质量校准的两种模式对比揭示了任务包与 SOTA 锚点的可达性。基础模式不给源论文下Claude Opus 4.6 达到 41/90 的匹配成功率DeepSeek-V4-Pro 为 29/90复现模式给源论文并指示忠实复现下分别降至 30/90 和 21/90。复现模式成功率更低的原因在于忠实复现触发更重的训练与更复杂的依赖DeepSeek 的无结果计数从 1 升至 29。这反过来说明基础模式下的低分并不能简单归咎于任务包缺陷。最终确定的任务集合中两者都成功的 16 个任务上g i m p g_{\mathrm{imp}}gimp​中位数为− 0.0026 -0.0026−0.0026、90% 的绝对偏差不超过 0.031这是校准环节最有说服力的证据——SOTA 锚点本身是可达到的。基准有效性三方面审计进一步排除了设计扭曲结果的可能性。1指标归一化极端负g gg是接近天花板的 SOTA 产生极小分母下的映射结果而非任务缺陷大的正g gg可能来自智能体直接优化单一主要指标从而超过报告值但未追求方法其他目标。论文审计了所有极端差距任务未发现任务错误。2任务覆盖度每个任务只评估源论文核心定量问题的有界切片bounded slice某些方向因无法结构化为数据或无法自动化确定性评分而被排除这是不可避免且合理的收窄被保留的切片仍是核心定量任务且评分正确因此 Surpass-/Match-SOTA 测量的是在该切片上的表现而非整篇论文。3泄漏与反馈风险源数据集来自公共仓库和基准少数任务上智能体可见输入与目标在本质上耦合可能直接读出部分答案重复提交的精确分数反馈可能让智能体博弈评分器。协议通过禁用网络搜索、事后有效性裁判过滤已评分但无效提交来约束这些风险审查最高风险任务后发现高频提交绝大多数是合法迭代真正的利用会被裁判捕获。三个代表性案例进一步揭示了智能体在 NatureBench 上的典型成败模式。案例 1方法对齐的图建模可产生有效成功。源论文 TREE 提出基于 transformer 的图表示学习用于癌症基因识别。任务是识别 8 个生物网络上的癌症相关基因64 维多组学节点特征基于图的二分类。Claude Opus 4.7 实现了 Chebyshev 多项式图卷积网络ChebNet集成加载 HDF5 网络数据、计算归一化图拉普拉斯、验证 AUPRC 早停训练、训练验证标签合并后重新训练、在 Chebyshev 阶数和随机种子间做模型平均。分数从初始g − 0.01715 g-0.01715g−0.01715逐步推进到g 0.12457 g0.12457g0.12457、0.161 0.1610.161、0.175 0.1750.175最终达到g 0.17666 g0.17666g0.17666裁判判为有效。这是真实的智能体成功——正确把任务当作图节点分类并使用合适的 GNN、类别不平衡处理、验证早停与集成把分数推到 SOTA 之上但智能体并未提出新的癌症基因识别方法本质上是方法对齐。案例 2大量有效迭代仍不足。源论文是 Nucleotide Transformer 人类基因组基准。任务是 19 个基因组序列预测实例18 个分类 1 个回归覆盖组蛋白标记、增强子、启动子、剪接位点等。GPT-5.5 共提交 258 次最佳分数出现在第 220 次尝试。起点是紧凑 k-mer 计数模型 快速线性分类器逐步加入剪接位点基序规则、GPU CNN、增强子活性 CNN 集成、两阶段分类器和阈值扫描分数从g − 0.41445 g-0.41445g−0.41445提升到− 0.20882 -0.20882−0.20882、最终− 0.14087 -0.14087−0.14087。裁判判为有效——所有预测都由在给定数据上训练的模型产生。但失败不是格式化或执行失败而是方法层限制从零训练模型缺乏大规模基因组预训练所具有的归纳偏置与表示容量。这解释了 NatureBench 上许多智能体失败更适合描述为可运行但不够强而非简单编码失败。案例 3看似合理的路线受限于执行深度。源论文 LocalTransform 使用基于广义模板的图神经网络进行有机反应性预测。任务是为 USPTO-480k 原子映射反应物预测主要有机反应产物该路线 Top-1 精确匹配准确率为 0.908强序列到序列基线为 0.887。DeepSeek-V4-Pro 实现了完整的序列到序列反应模型24.3M 参数SMILES 分词器、数据集加载器、Transformer、训练循环、检查点、beam-search 推理。Loss 从 2.0312 降至 1.3149但训练消耗大量预算贪心解码 Top-1 仅 13.68%beam search 提升至 58.53%最终g − 0.35540 g-0.35540g−0.35540。关键限制是执行深度而非无效——智能体找到了合理的科学计算路线但任务要求的更深训练、更高效生成、更专门化学建模超出了固定预算。4.4 行为与机制分析 / Solution Mechanism Analysis论文对10 个被分析的智能体配置在全部900 次任务—智能体运行90 任务 × 10 智能体上进行了系统标注对比论文侧方法族系与智能体实际实现的方法族系、将 Match-SOTA 运行归因到成功模式、将低于 SOTA 或无效的运行归类到失败层。这 10 个配置的 Match-SOTA 率仅为32.2%。)方法通路方面论文侧方法集中在结构化表示structured representation、统计建模statistical modeling、预训练或迁移学习pretraining/transfer learning智能体侧方法则系统性重塑为监督预测建模supervised predictive modeling占所有运行的 41.4%。这种重塑并非同样有效当智能体方法落入与源论文相同的方法族系时Match-SOTA 率为 37.7%使用不同方法族系时降至 29.6%。NatureBench 不限制方法选择但更接近任务原始科学结构的方法往往更有效。成功模式方面当智能体确实匹配 SOTA 时通常是通过通用 ML 工程而非领域知情的方法选择。在 Match-SOTA 的运行中监督代理预测supervised proxy prediction占 45.5%优化与调参optimization and tuning占 17.6%工程流水线engineering pipelines占 11.0%预训练或模型扩展pretraining/model scaling占 8.6%——以上工程驱动类合计82.7%。相比之下领域推理替代方案domain-reasoned alternatives仅占 8.3%方法对齐方案method-aligned solutions仅占 9.0%。结论非常明确智能体的成功主要源于将科学任务还原为标准 ML 流水线而非对任务科学细节的推理。失败模式方面在 67.8% 的未达 Match-SOTA 或无有效分数的运行中方法层失败method-layer占 61.1%主要来自方法选择错误wrong method choice45.1%执行层失败execution-layer占 28.7%主要来自预算/时间不足insufficient budget or time24.4%理解层失败understanding-layer仅占 3.1%策略层失败strategy-layer占 7.0%。这些失败运行大多确实产生了可运行方案但所选方法太弱或实现太浅无法弥合与论文 SOTA 的差距。方法选择与实现深度而非代码生成本身是当前智能体在 NatureBench 任务上的主要瓶颈。五、相关工作 / Related Work5.1 AI for Science 的第一波人类定义研究计划内的加速器论文将现有 AI for Science 工作梳理为一系列垂直结果结构生物学领域AlphaFold、RoseTTAFold、ESMFold、AlphaFold 3、Boltz-1 将原子级预测从单链扩展至生物分子复合物RFdiffusion 及其抗体扩展通过实验验证的de novo设计闭合回路基因组学领域AlphaMissense、PheMART 建模变异致病性和表型空间Geneformer、scGPT、Evo 2 在转录组或 DNA 上预训练基础模型材料、化学、数学与地球系统领域GNoME 和 MatterGen 发现或逆设计材料Coscientist 自动化化学实验AlphaTensor 和 AlphaProof 将基于搜索的推理扩展到算法和形式数学GraphCast、GenCast、Aurora 推进全球天气预测。这些系统共享同一种结构性局限人类指定研究计划、整理数据、确定成功标准AI 只是该计划内更强有力的仪器。许多进展是工具的革命而非革命的工具。大规模出版证据进一步表明AI 增强的科学可以提高个体产出和影响力但同时会收窄集体主题前沿使其向数据丰富的子领域集中。因此现有系统能在既有轴向上加速进步但本身并不能建立跨学科、范式转移式的问题求解。5.2 从 AI 辅助研究到 AI 原生问题求解自然的下一步是评估 AI 作为主要问题求解者给定科学任务系统必须自己选择方法、运行实验并以最终科学成果为评判标准。已有通用科学智能体包括 The AI Scientist、AI co-scientist、DeepScientist、AutoSOTA 等。但这些系统通常仅在自选主题或有限领域内演示尚不清楚 AI 原生问题求解能否在整体科学领域内泛化。NatureBench 的定位正是提供跨学科、标准化的评估以检验这种泛化能力——亦即在多大程度上打破信息茧房。5.3 论文复现类与工程优化类基准基于论文的基准按目标分为论文理解/评审PaperQA、OpenScholar、LAB-Bench、ReviewerGPT 等和把论文变成可执行工作两条线。后者包括PaperBenchagent 在作者 rubric 下从零重建 ICML 论文、AutoExperiment/LMR-Bench通过代码掩码或语言建模式测试对已报告实验的恢复、CORE-Bench/REPRO-Bench/ReplicationBench计算机科学、社会科学、医学、天体物理学的复现/评估/复制、AutoMat/Collider-Bench材料科学和 LHC 工具链、FIRE-Bench从 ML 论文提炼高层问题让 agent 重新发现已知见解。这些基准虽然以论文为评估基础但目标限于阅读、评审、复现、复制或重新发现已知结论。工程优化类基准包括 MLAgentBench、MLE-bench、MLGym、MLE-Dojo、MLS-Bench、AIRS-Bench、PostTrainBench、InferenceBench、AutoLab 以及 FrontCS、ALE-Bench、Frontier-Eng 等。它们覆盖 ML 实验、模型构建、后训练、推理优化和长时程闭环优化但任务本身不是从真实科学论文中提炼的发现型问题不要求自然科学所需的领域推理、专业工具或跨学科知识且因环境碎片化导致独立重跑不可靠。NatureBench 是第一个同时具备以下三个属性的基准论文来源任务 真实科学问题 面向优化评估以已发表 SOTA 为评分锚点。它与复现类基准的区别在于目标不是复现论文方法而是独立达到或超越论文报告的数值 SOTA与工程优化类基准的区别在于任务来自同行评审的自然科学论文要求跨学科知识整合和科学方法开发同时通过 NatureGym 流水线实现了容器化、标准化的任务环境解决了环境碎片化问题。六、局限性与展望 / Limitations Future WorkNatureBench 存在以下已明确的局限性第一任务覆盖是有界切片。每个任务只对源论文的核心定量问题的一个子集实例和指标进行评分无法覆盖论文的全部贡献方向——尤其是无法结构化为数据、无法自动化确定性评分的部分。因此Surpass-/Match-SOTA 测量的是在该切片上的表现而非整篇论文。第二数据量预算限制。超过数据量预算50 GB的实例不会被收集Tier M 在累计上限下逐实例下载、达到上限后跳过剩余实例。这可能遗漏某些数据资源但也是控制基准可复现性与存储成本的必要取舍。第三残余的泄漏与反馈风险。任务基于公共数据构建源数据集来自公共仓库和基准少数任务上智能体可见输入与目标在本质上耦合重复提交的精确分数反馈可能让智能体博弈评分器而非求解任务。这些风险只能被协议约束禁用搜索 事后裁判而非完全消除。第四实验结果的资源依赖。所有智能体使用统一的 4 小时墙钟预算GPU 按元数据记录分配。失败模式中 24.4% 归因于预算/时间不足因此性能评价与资源预算强相关。更强的算力或更宽松的时间预算可能改变部分结论。第五指标的单一化。SOTA 归一化差距只使用每个实例指定的单个主要指标可能只捕捉多目标方法的一个侧面极端正差距可能来自对单一指标的过度优化而非方法整体上的领先。其余辅助指标虽然作为反馈报告给智能体但不进入归一化分数。第六语料来源集中。基准任务集中在 Nature 系列六种期刊、以 2022–2025 年为主未必代表所有科学出版物的全貌。虽有十种期刊入选但其余四种在过滤、数据验证、任务构建和校准后未保留任何任务。展望方面论文明确提出了一个长期目标将 NatureGym 这套基板转化为未来科学发现智能体的训练数据。此外将基准扩展到更多期刊、更长期限和更多科学领域设计更细粒度的行为标注与失败归因以及开发自适应计算预算的动态评估协议都是自然的后续方向。七、总结 / ConclusionNatureBench 以 90 个来自 Nature 家族同行评审论文的真实科学任务为测试场以源论文报告的 SOTA 为统一评分锚点系统地检验了前沿编码智能体能否从复现走向发现。在严格禁用网络搜索的协议下最强的 Claude Opus 4.7 也仅在 17.8% 的任务上超越 SOTAg 0.1 g0.1g0.1在 47.8% 的任务上匹配 SOTA。这一结果表明当前编码智能体在真实科学问题上的方法开发能力远未达到可靠水平——它们能够理解任务并产出可运行方案提交率和有效率高但方法选择错误45.1%和计算预算不足24.4%构成了主要瓶颈。更深刻的洞察来自行为机制分析智能体的成功主要是方法论翻译——将科学任务重新表述为熟悉的监督预测/优化流水线——而非领域驱动的科学发明。工程驱动类成功模式合计占 82.7%而领域推理替代方案和方法对齐方案合计不到 18%。尽管更接近任务原始科学结构的方法往往更有效同族方法 Match 率 37.7% vs 异族 29.6%但智能体天然倾向于用自己的熟悉的 ML 套路去套用科学问题。六个科学领域形成跨智能体共享的难度梯度跨学科任务进一步稳定地拉大与 SOTA 的差距。NatureBench 的价值不仅在于给出一个还不行的结论更在于通过 NatureGym 流水线建立了一条从论文到可复现任务包的生产线通过两阶段质量校准和三轮有效性审计确认 SOTA 锚点可达共同成功任务上g gg中位数− 0.0026 -0.0026−0.0026。它使得AI 能否在真实科学问题上超越已发表 SOTA这一核心问题第一次有了跨学科、标准化、可独立复现的衡量尺度并为未来科学发现智能体的训练与评估提供了可扩展的基础设施。原文摘要:We introduce NatureBench, a cross-discipline benchmark of 90 tasks distilled from peer-reviewed Nature-family publications, designed to evaluate whether AI coding agents can move beyond reproduction toward discovery on real scientific problems. NatureBench is built on NatureGym, an automated pipeline that constructs a standardized, per-task containerized environment from a source paper, addressing the environment-fragmentation problem that has limited the credibility of prior agent-on-research benchmarks. Evaluating ten frontier agent configurations under a strict web-search-disabled protocol, we find that the strongest model surpasses SOTA on only 17.8% of tasks under the g0.1 criterion. Analysis of method pathways reveals that agents succeed primarily through methodological translation, converting scientific tasks into familiar supervised prediction problems, rather than through genuine scientific invention. Failures are dominated by wrong method choice and insufficient compute budget, not by task misunderstanding. We release the benchmark, the NatureGym pipeline, and a public leaderboard with maintainer-side reproduction. Code: https://github.com/FrontisAI/NatureBenchPDF链接:https://arxiv.org/pdf/2606.24530v2部分平台可能图片显示异常请以我的博客内容为准
返回列表