AI 智能体真的能独立搞科研吗?
- 《Can AI agents conduct open-ended AI research? Early evidence from two case studies》研究方法影子评估 (Shadow Evaluations)为了评估AI智能体在开放式研究中的真实能力研究团队提出并实施了“影子评估”方法以解决现有评估方式如狭窄的可验证任务或随机性强的盲审的不足。任务来源选取了两篇当时尚未公开的、已投稿至顶级AI会议NeurIPS 2026的高质量论文。研究问题将这两篇论文的核心开放式研究问题提取出来作为给AI智能体的任务。评估方式让AI智能体在无法接触到原论文的情况下独立进行为期六天的研究并最终产出一篇论文。然后由原论文的作者以会议审稿人的身份对AI智能体产出的论文进行评审和打分。这种方法确保了任务的开放性、问题的“未污染性”即答案不在智能体的训练数据中并由对该问题最了解的专家进行深度评估。 实验设置智能体主要实验使用了Anthropic的Claude Opus 4.8模型运行在OpenClaw这一通用智能体框架上。资源每个智能体被给予6天144小时的墙钟时间、3000美元的API预算、GPU算力以及一个完整的Linux虚拟机和互联网访问权限。目标产出一篇达到顶级AI会议发表水准的论文。 核心结果两位原论文作者对AI智能体产出的两篇论文都给出了明确的拒稿决定论文1 (Personas)评分为2分Reject拒稿。论文2 (TabPFN)评分为1分Strong Reject强烈拒稿。审稿人指出的主要问题包括实验和方法选择缺乏原则性、结论与证据不符、写作晦涩难懂、创新性有限等。 智能体的五种失败模式通过对实验日志的深入分析研究团队识别出AI智能体在研究过程中反复出现的五种失败模式缺乏对高质量研究标准的判断力 (Lack of judgment)智能体无法准确判断一个问题是否得到了充分的解决。它们会基于小规模的、人为挑选的或合成的数据集就轻易地证伪一个假设并将统计效力不足的负面结果作为实质性发现呈现。它们提交的论文质量远未达到顶级会议的标准但其内部的自我评审却未能识别出这些根本性缺陷。缺乏创造性的问题解决能力 (Lack of creative problem solving)当AI评审或初步实验给出负面反馈时智能体无法创造性地调整研究方向或设计更强的实验。它们的典型反应是缩小论断范围、增加限定条件而不是从根本上重新思考问题或提出新的解决方案。无法从死胡同中有效回溯 (Lack of effective backtracking)尽管智能体在初期会探索多个方向但它们会过早地放弃最有前景的宏大目标并固守在一个效果不佳的方案上。即使自我评审持续给出“弱拒稿”的信号它们也从未从根本上改变研究策略或推倒重来。缺乏资源意识 (Lack of context awareness)智能体对分配给它们的时间和计算资源缺乏直观的理解。两次实验结束时智能体都剩余了大量的API预算分别剩余约63%和59%并且在截止时间前数小时就宣布项目完成尽管其产出的论文远未达到成功标准。指令漂移 (Instruction drift)随着研究过程的推进智能体逐渐偏离了最初的明确指令。例如它们忽略了关于论文长度的限制、探索阶段的时间要求以及使用外部评审工具的频率等规定。️ 智能体的成功之处尽管在研究的核心环节失败了但智能体在工程实现方面表现出色在没有人工干预的情况下独立完成了大量的文献综述。成功调试了GPU环境并运行了数百次实验和鲁棒性检查。能够通过网页和邮件获取外部评审。编译了完整的、可发表的LaTeX文档。 鲁棒性检查为了排除实验结果是由特定智能体框架OpenClaw的缺陷导致的可能性研究团队使用OpenAI的GPT-5.6 Sol模型及其原生框架Codex在其中一个研究问题上复现了实验。结果发现GPT-5.6 Sol同样表现出上述几乎所有的失败模式尽管在资源消耗模式上有所不同它迅速耗尽了API预算。这增强了研究结论的可靠性表明这些失败模式是当前前沿模型在开放式研究任务中普遍存在的局限。 总结该论文通过严谨的“影子评估”方法提供了早期证据表明尽管AI智能体已成为强大的研究工程师能够自动化执行研究中的大量技术工作但它们尚不具备独立进行端到端、开放式AI研究的能力。它们在需要人类智慧、创造力和战略眼光的关键研究环节上仍然存在显著短板。