尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

如何从 10 篇论文形成一个研究 Proposal:问题、假设、方法和实验计划

如何从 10 篇论文形成一个研究 Proposal:问题、假设、方法和实验计划 如何从 10 篇论文形成一个研究 Proposal问题、假设、方法和实验计划系列AI 论文精读与复现训练营日期2026-08-20适合读者研究生、科研新人、有工程背景的 AI 读者检索日期2026-08-20目录为什么这个主题重要10 篇论文不是数量要求而是证据边界核心流程从 paper set 到 proposal代表论文与资料路线图关键论文精读AI 能帮到哪里帮不到哪里Gap Matrix把阅读笔记变成研究判断Proposal 草稿结构复现与预实验建议常见误区适合研究生继续做的选题总结与参考资料为什么这个主题重要论文精读训练的终点不是“我知道这个方向有哪些工作”而是“我能提出一个小而清楚、可被检验、可在现有资源下执行的问题”。这正是从阅读者转向研究者的关键台阶。在 AI 方向这个台阶尤其难。第一论文更新太快。一个 proposal 如果只停留在“改进某个 2024 baseline”可能在开题前就被 2025-2026 的模型或 benchmark 吞掉。第二很多论文把贡献包装成系统工程数据、模型、prompt、后处理、训练 recipe 和评测策略纠缠在一起读者很难判断真正有效的变量。第三LLM 已经开始参与文献检索、idea generation、proposal writing 和实验执行但最新研究也反复提醒我们模型能给出看似合理的 idea却容易在可行性、引用准确性、多样性和真实执行上出问题。DARPA 的 Heilmeier Catechism 很适合作为 proposal 的最低门槛你要做什么今天怎么做限制在哪里你的新方法是什么为什么可能成功谁在乎风险、成本、时间和中期/最终验收是什么NSF 的 proposal guidance 也把核心问题压缩成类似结构想做什么为什么做如何做如何知道成功以及成功后有什么价值。对研究生来说这些问题比“标题是否酷”“模型是否新”更重要。10 篇论文不是数量要求而是证据边界“从 10 篇论文形成 proposal”不等于随机读 10 篇。更好的构成是2 篇奠基论文定义任务、范式或核心假设。3 篇最近强 baseline代表当前主流做法优先选 2025-2026 年或仍被当前工作使用的技术报告。2 篇反例或负结果指出 benchmark、复现、泛化或机制解释的问题。2 篇邻近分支提供可迁移方法但不是同一套路的简单堆叠。1 篇综述、系统论文或 benchmark 论文帮助你理解评价边界。这 10 篇论文的目的不是覆盖所有相关工作而是建立一个“足够做判断”的证据边界。读完后你应该能回答四个问题这个方向的核心变量是什么哪些结论已经被反复验证哪些结论只在狭窄设置中成立如果我只能做一个月预实验最值得检验的缺口是什么如果十篇论文全是同一实验套路的 SOTA paper你很容易得到一个平庸 proposal换模型、换数据、换 loss、再跑一次 leaderboard。真正有训练价值的 paper set 应该包含张力一个方法声称有效另一个复现研究质疑它一个 benchmark 流行另一个 contamination 或 leakage 分析指出风险一个 agent 框架自动生成实验另一个评测显示 agent 仍远低于人类复现能力。核心流程从 paper set 到 proposal第一步做 problem map。不要先按论文时间线排而要按“它们认为问题在哪里”排。每篇论文都填三句话它要解决的失败模式是什么它把失败归因于什么变量它认为成功应该如何测量例如在 LLM research ideation 方向有的论文把问题定义为 novelty有的定义为 feasibility有的定义为 groundedness有的定义为执行成功率。它们表面上都在做“生成研究想法”但问题定义并不相同。第二步做 claim extraction。把每篇论文的核心 claim 写成可验证句子而不是摘要句。错误写法是“提出一个自动科研系统”。更好的写法是“在给定模板和代码库的条件下系统能完成 idea generation、实验迭代、写作和自动 review但产出论文仍存在解释和可靠性问题”。claim 一旦被写成可验证句子就能进入下一步比较。第三步做 gap matrix。行是论文或方法列是问题定义、假设、数据/任务、模型规模、实验变量、metric、baseline、复现材料、失败案例、外部有效性。你要找的 gap 不是“没人做过 X”而是“现有证据不能支持某个重要判断”。比如idea generation 论文可能证明生成 idea 新颖但没有证明它们能被低成本实验验证proposal writing 论文可能改进文本质量却仍要单独核查 reference validityPaperBench 显示 AI agent 复现复杂 AI 论文仍困难这会限制全自动 proposal-to-paper 系统的现实可信度。第四步生成 3 个候选假设。每个假设都必须包含方向、机制和可证伪条件。弱假设是“加入检索会提升研究 proposal 质量”。强假设是“在从 10 篇论文生成 AI research proposal 的任务中把文献证据显式压缩为 gap matrix比直接 RAG 生成 proposal 更能提升 feasibility 和 reference validity若人工评审或执行预实验未显示显著差异则假设不成立。”第五步设计最小实验计划。proposal 不是要把所有实验列满而是要证明你知道第一块证据应该怎么拿。最小实验通常包括一个主对比、一个 ablation、一个失败案例分析和一个人工核验环节。对于 AI 论文训练尤其要写清楚 seed、数据版本、模型版本、prompt、推理预算、评分规则和日志保存方式。第六步写 pre-proposal。先写 2-4 页不要直接写 15 页。顺序是问题、已有证据、核心 gap、假设、方法、实验、风险、时间表。只要这几页讲不清长 proposal 只会把问题藏起来。代表论文与资料路线图类别代表资料对 proposal 训练的启发Proposal 判断框架DARPA Heilmeier CatechismNSF Preparing Your Proposal把选题压成目标、现状、创新、价值、风险、成本、验收顶会写作规范ICLR 2026 Author GuideNeurIPS 2026 review guidance关注贡献类型、可复现性、匿名代码、伦理和实验支撑AI research ideationSi et al., ICLR 2025Measuring the Gap Between Human and LLM Research Ideas, 2026LLM idea 可有新颖性但 feasibility、diversity 和 human taste gap 需要单独评估自动科研系统The AI Scientist / AI Scientist-v2PaperBench自动生成和复现仍受执行、代码、实验和评审可靠性约束Idea benchmarkLiveIdeaBenchInciteResearch / TF-Bench科学创意评价要拆成 originality、feasibility、flexibility、clarity 等维度Proposal writingAssisting Research Proposal Writing with LLMs, 2025文本质量和引用真实性应分开评估迭代提示不能替代人工核验关键论文精读AI 能帮到哪里帮不到哪里Si、Yang 和 Hashimoto 的 ICLR 2025 研究是读这个主题的入口。它招募 100 多位 NLP 研究者参与 idea 写作与盲审发现 LLM 生成 idea 在新颖性评价上可以超过人类专家但可行性略弱并暴露出 LLM self-evaluation 失败和生成多样性不足的问题。对 proposal 训练的直接启发是不要把“新颖”当作唯一目标。一个研究生 proposal 如果只有 novelty没有可执行实验和失败标准很容易变成漂亮但不可验证的空想。2026 年的 Measuring the Gap Between Human and LLM Research Ideas 更进一步。它不只评价单个 idea而是比较人类论文与 LLM idea 的分布差异。论文指出LLM idea 往往更集中在 bridge-like opportunity 和 synthesis method 上而人类研究 idea 的分布更分散。这个结论对使用 LLM 辅助选题的人很重要模型可能不断给你“把 A 和 B 结合”的建议但真正的研究机会也可能来自反常现象、测量缺口、负结果、机制解释或约束条件变化。The AI Scientist 和 AI Scientist-v2 展示了 agentic research pipeline 的可能性生成假设、写代码、跑实验、分析结果和写论文。AI Scientist-v2 的 GitHub README 也明确提醒系统会执行 LLM 写出的代码需要在受控 sandbox 中运行并且 v2 不一定比模板化 v1 产出更好特别是在有强模板的任务上。这对 proposal 设计是一条硬约束自动化可以帮助探索但 proposal 仍要写清楚哪些步骤由人核验、哪些实验可重复、哪些失败会触发 pivot。PaperBench 则提供了冷静的一面。OpenAI 在 2025 年发布的 PaperBench 要求 agent 从零复现 20 篇 ICML 2024 Spotlight / Oral 论文并用作者共同制定的层级 rubric 评分。公开结果显示当时最佳 tested agent 仍没有超过人类基线。这里不应只关注分数而要学习它的 rubric 思想一个 research plan 不能只写“复现论文”而要把复现拆成可评分任务例如数据准备、模型实现、训练目标、核心实验、ablation、图表和结论核验。LiveIdeaBench 和 InciteResearch 适合提醒我们proposal 不是简单的 convergent reasoning。LiveIdeaBench 用 originality、feasibility、fluency、flexibility 和 clarity 等维度衡量 scientific idea generation说明科学创意与一般智能分数并不等价。InciteResearch 则强调许多研究起点并不是清楚问题而是“隐性摩擦”你觉得某个方向不对劲但还说不出问题。这正是读 10 篇论文的意义不是马上生成答案而是把模糊不满变成可检查的研究问题。最后Assisting Research Proposal Writing with LLMs 直接讨论 proposal writing。它把内容质量与 reference validity 分开评估并用迭代 prompting 改善写作质量、减少引用错误。这个设定很实用当你用 LLM 辅助 proposal 草稿时应至少保留两张表一张评估论证结构一张逐条核查引用是否真实、是否支持对应句子。Gap Matrix把阅读笔记变成研究判断下面是一个可直接复用的 gap matrix 模板。字段要填什么判断标准Problem论文解决的具体失败模式是否比“大模型不够好”更具体Assumption方法成立依赖的前提是否能被实验打破Intervention方法真正改变的变量是否与工程细节混淆Evidence支持 claim 的证据是否包含 baseline、ablation、统计或人工核验Boundary证据适用边界是否说明数据、模型、任务和预算限制Missing仍未回答的问题是否重要且可实验Feasibility你能否在 2-4 周做预实验数据、算力、代码、评测是否可得Proposal Hook可形成的研究假设是否有机制和可证伪条件完成矩阵后不要急着选“最大”的 gap。研究生训练更适合选择“中等重要、低到中等成本、证据链清楚、能在一个月拿到预实验结果”的 gap。一个小 proposal 的目标不是击败整个领域而是建立一个能被导师、同学或 reviewer 认真讨论的证据起点。Proposal 草稿结构建议先写一页版本标题必须包含任务、变量和目标不要只写一个大方向。问题用 3-5 句话说明现有方法在哪个具体场景失败。文献证据列出 10 篇论文如何共同支持这个问题存在。核心 gap说明现有证据缺什么不要只说“尚未有人研究”。假设写成可证伪句子。方法说明你改变哪个变量以及为什么这可能解决 gap。实验计划列 dataset、metric、baseline、ablation、人工核验和日志。风险与替代计划写清楚失败后如何缩小问题或 pivot。再扩成 2-4 页版本时可以增加 related work map、pilot experiment、timeline 和资源预算。参考 NSF 的思路proposal 应该回答“想做什么、为什么做、如何做、如何知道成功”。参考 DARPA 的思路还要回答“谁在乎、风险是什么、阶段性考试是什么”。对于 AI 研究训练阶段性考试可以很具体两周内复现 baseline第三周完成主对比第四周完成 ablation 和 error analysis若主指标无提升则转向解释失败原因而不是继续堆技巧。复现与预实验建议第一先复现一个可信 baseline而不是先实现你的新方法。baseline 复现失败通常说明环境、数据、metric 或理解存在问题。这个阶段的日志应该包含 commit、依赖版本、seed、模型 checkpoint、数据 hash、运行命令和异常记录。第二把 proposal 的核心假设压成最小干预。例如你的假设是“gap matrix improves proposal feasibility”就不要同时换模型、换 prompt、换检索库、换评审标准。最小实验可以是同一组 10 篇论文、同一模型、同一输出格式对比 direct RAG proposal 与 gap-matrix-first proposal再由人工 rubric 评估 specificity、feasibility、reference support 和 testability。第三保留负结果。很多 proposal 的真正价值不是“方法立刻有效”而是发现现有 claim 的边界。NeurIPS 2026 等会议已经在贡献类型中给 negative results、concept feasibility、evaluation analysis 留出空间只要实验设计严谨负结果可以成为强选题。第四不要把 LLM judge 当最终证据。可以用 LLM 做初筛、结构检查和引用提醒但 reference validity、实验可执行性和关键 claim 必须人工核验。PaperBench 之所以有训练价值正是因为它把复现任务拆成层级 rubric而不是只问模型“这篇复现是否成功”。常见误区误区一把 proposal 写成 related work。Related work 解释过去proposal 必须押注未来的一个可验证判断。误区二把 gap 理解成“没人做过”。很多没人做过的事是不重要、不可能、或做了也没意义。更好的 gap 是“现有证据不足以支持一个重要 claim”。误区三只追求 novelty。Si et al. 和后续 ideation 研究都提示novelty 与 feasibility、diversity、execution success 不是一回事。误区四实验计划过大。proposal 的第一阶段不该依赖训练 70B 模型或构建全新 benchmark。先证明关键变量值得研究。误区五引用不核验。LLM 生成的 proposal 文字越流畅越容易掩盖引用错配。引用必须逐条对应 claim。误区六没有失败标准。没有失败标准的 proposal 不是研究计划而是愿望清单。适合研究生继续做的选题Gap-matrix-first proposal writing比较结构化 gap matrix 与直接 RAG 对 proposal 可行性、引用准确性和可测试性的影响。Research idea diversity audit复现 Measuring the Gap Between Human and LLM Research Ideas 的思想在某个 AI 子领域分析 LLM idea 是否过度偏向“方法融合”。Proposal reference validity benchmark构建小型中文/英文 AI proposal 数据集评估 LLM 是否引用真实论文、引用是否支持对应论断。PaperBench-style proposal rubric把一篇 proposal 拆成可评分任务研究这种 rubric 是否提升导师反馈质量。Negative-result-driven proposal mining从复现失败、benchmark 陷阱和 ablation 负结果中自动提取可执行 follow-up idea。Human-AI proposal co-writing protocol设计一个流程明确哪些步骤由 LLM 辅助哪些步骤必须由人类研究者核验。总结从 10 篇论文到 proposal 的核心不是“读得越多越好”而是把文献变成决策。你要从论文中抽取问题定义、核心假设、方法干预、证据强度和未解 gap再把其中一个 gap 压成可证伪假设和最小实验计划。一个合格的研究生 proposal 至少应该让读者相信三件事问题真实且重要你的方法选择有机制理由实验计划能在有限资源下给出清楚答案。LLM 可以帮助检索、整理、生成候选假设和检查结构但它不能替你承担最终判断。真正的训练在于你能否说清楚为什么是这个问题、为什么是这个实验、以及失败后你会学到什么。参考资料检索日期2026-08-20。以下链接均为写作时可访问的一手或近一手资料会议政策、代码仓库、benchmark 结果、模型版本和 arXiv 版本可能变化正式发表前请再次核验。DARPA, The Heilmeier Catechism. https://www.darpa.mil/about/heilmeier-catechismNSF, Preparing Your Proposal. https://www.nsf.gov/funding/preparing-proposalICLR 2026 Author Guide. https://iclr.cc/Conferences/2026/AuthorGuideChenglei Si, Diyi Yang, Tatsunori Hashimoto, “Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100 NLP Researchers”, ICLR 2025. https://mlanthology.org/iclr/2025/si2025iclr-llms/Ziyu Chen, Yilun Zhao, Arman Cohan, “Measuring the Gap Between Human and LLM Research Ideas”, arXiv:2607.01233, 2026. https://arxiv.org/abs/2607.01233SakanaAI, AI-Scientist-v2 GitHub repository. https://github.com/SakanaAI/AI-Scientist-v2Sakana AI, The AI Scientist project page. https://sakana.ai/ai-scientist/OpenAI, PaperBench: Evaluating AI’s Ability to Replicate AI Research, 2025. https://openai.com/index/paperbench/OpenAI frontier-evals, PaperBench README. https://github.com/openai/frontier-evals/blob/main/project/paperbench/README.mdJing Ren, Weiqi Wang, “Assisting Research Proposal Writing with Large Language Models: Evaluation and Refinement”, arXiv:2509.09709, 2025. https://arxiv.org/abs/2509.09709Kai Ruan et al., “Evaluating LLMs’ divergent thinking capabilities for scientific idea generation with minimal context”, Nature Communications, 2026. https://www.nature.com/articles/s41467-026-70245-1Jie Yu, Song Qiu, “More Than Can Be Said: A Benchmark and Framework for Pre-Question Scientific Ideation”, arXiv:2605.06345, 2026. https://arxiv.org/abs/2605.06345Rosni Vasu et al., “HARPA: A Testability-Driven, Literature-Grounded Framework for Research Ideation”, OpenReview ICLR 2026 withdrawn submission. https://openreview.net/forum?idzGr73fcSsBNeurIPS 2026 Evaluations and Datasets Reviewing Guidelines. https://neurips.cc/Conferences/2026/EvaluationsDatasetsReviewerGuidelines
返回列表