尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

小白必看!用收藏模式解锁大模型Loop Engineering的神奇世界

小白必看!用收藏模式解锁大模型Loop Engineering的神奇世界 本文以AutoResearch和Claude Code为例详细解析了Loop Engineering的概念、设计原则和应用。Loop Engineering作为Agent的重要组成部分通过设计循环系统让AI自主迭代从而提升任务完成效率。文章涵盖了循环设计的关键点、注意事项以及可能遇到的陷阱旨在帮助读者理解并实践这一前沿技术为AI应用开发提供新的思路和方法。最近学到个新词“Loop Engineering”初看以为叒有啥新技术了还有“Prompt已死balabala …”真是语不惊人死不休啊。看了之后第一时间就想到了AutoResearch和Claude Code的query loop不是新技术只是谷歌大佬Osmani的总结。想想也有道理年初时大家都在关注Harness现在看来Harness也是为了服务核心的Loop Engineering。无论是Prompt、Context、harness还是现在的Loop engineering都是Agent的重要组成部分彼此互补共同打造了Claude Code、Codex等惊艳的产品/系统。一、一夜 100 个实验Karpathy 的 AutoResearch2026 年 3 月Andrej Karpathy 开源了 AutoResearch。这个项目做的事很简单让 AI agent 自主跑深度学习实验——修改训练代码、运行 5 分钟、评估指标、保留改进或回退。一夜跑完约 100 个实验零人工干预。GitHub 80,000 Stars成果斐然Red Hat 用它跑了 198 个实验零干预拿到 2.3% 验证损失改进Shopify 用它把 Liquid 模板引擎的解析延迟从 7,469 微秒压到 3,534 微秒加速 53%。但最让我关注的不是结果而是它的循环结构整个系统只有三个文件prepare.py数据准备和评估函数 只读保护评估完整性train.py模型和训练循环 Agent 可修改program.md研究指令 人类编写循环逻辑极度简洁。判断标准只有一个val_bpb 有没有改善。没有复杂的条件分支没有动态策略选择。这就引出了一个核心问题Karpathy 没有在写提示词他在设计一个循环系统。这和我们日常用 ChatGPT 写 prompt 是完全不同的思维。二、三阶段跃迁你的 AI 工程在哪一层Karpathy 的 program.md 不是 prompt——它是一个循环系统的运行规则。这个区别代表了 AI 应用开发的阶段跃迁。Addy Osmani 在 2026 年 6 月提出了一个清晰的三阶段模型阶段核心问题人的角色典型产物Prompt Engineering如何提问-考验LLM的指令遵循能力每次手写提示ChatGPT 对话单次 API 调用Context Engineering给LLM更多的背景知识设计信息组装管道RAG 系统、System Prompt 拼装Loop Engineering怎么让 AI 自己迭代设计循环规则后退出执行AutoResearchClaude Code Agent等Karpathy 的 program.md 就是 Loop Engineering 的产物他不写每一步的指令而是定义研究方向和约束条件让 agent 在循环中自主决策。“Loop Engineering is replacing yourself as the person who prompts the agent, designing the system that does it instead.” —— Addy Osmani层间依赖不能跳级三个阶段是叠加关系不是替代关系没有好的 Context Engineering你的循环每一轮都在垃圾信息里打转没有好的 Prompt Engineering你的循环每一步的执行质量都不过关。AutoResearch 的 program.md 之所以有效是因为它同时做好了三层指令清晰Prompt、实验环境信息完整Context、循环规则正确Loop。多说一句claude code运行中特定步骤的prompt也可以看作是基于context 以及特定的压缩、组合策略得到的从这个角度更可以看出prompt与context的相互促进、彼此结合的特质。为什么Loop Engineering在这个时间点被提出技术成熟度拐点。LLM 推理能力支撑多步规划Claude 3.5、GPT-4Token 窗口够大1M上下文已成为标配工具调用趋于标准化Function Calling、MCP 协议。开发者需求拐点。从让 AI 回答问题到让 AI 完成任务从优化单次交互到优化整个流程。两个拐点叠加的结论工具已经就绪问题是你会不会设计循环。三、从 AutoResearch 提炼设计原则回到 Karpathy 的实验。AutoResearch 的循环只有 5 步判断标准只有 1 个。但它能一夜跑 100 个实验而且结果可靠。为什么因为它做对了循环设计的几个核心决策。原则 1循环本身应该简单AutoResearch 的循环逻辑没有条件分支。不是如果实验类型是 A 就走路径 1如果是 B 就走路径 2而是无论什么实验都走同一个流程修改 → 运行 → 评估 → 保留或丢弃。这不是 Karpathy 偷懒。VILA Lab 对 Claude Code 源码的逆向分析Jiacheng Liu et al., 2026发现了同样的模式Agent 的核心循环决策逻辑queryLoop()仅占代码总量的约 1.6%而运行时基础设施Harness占 98.4%。两个独立的工业级系统得出同一个结论循环决策逻辑应该占代码总量的 10%。复杂度放在循环之外的基础设施里。为什么简单循环有效对比设计循环逻辑出错时可维护性复杂循环10 条件分支动态策略难以定位哪个分支出了问题改一处影响全局简单循环固定步骤单一判断清晰的失败点每个子系统独立优化同样Simon Willison也认可这样的观点“Dumb loops beat clever workflows.”——简单循环反复迭代优于精巧的一次性编排。原则 2终止条件必须明确AutoResearch 有两个终止条件时间预算耗尽5分钟/实验或连续 N 次无改进。Claude Code 有五个停止条件无 tool use、max turns 达到、上下文溢出、hook 干预、abort controller 触发。没有明确终止条件的循环本质上就是一个死循环——或者更准确地说是一个烧钱的死循环。终止条件的四种类型终止类型适用场景AutoResearch 实例Claude Code 实例目标达成有明确可验证的目标val_bpb 不再改进无 tool_use问题已回答资源耗尽有预算约束固定 5 分钟窗口Max turns 达到质量劣化产出质量可量化连续 N 次无改进—主动中断人类需要介入—Abort controller 触发一个可复用的模板def should_stop(state): if goal_achieved(state): return True # 任务完成 if budget_exceeded(state): return True # 超出预算 if quality_degrading(state): return True # 质量在下降 if user_interrupted(): return True # 人类介入 return False关键原则如果你说不清楚终止条件是什么那就不要开始这个循环。原则 3回退策略决定容错模式AutoResearch 的 ratchet 机制是最激进的回退策略只前进不后退。改进了就 git commit没改进就 git revert。代码只能变好绝不会变差。但 ratchet 不是唯一选择策略机制适用场景实例Ratchet只前进保留改进丢弃无效目标函数明确且单调AutoResearch 的 git commit/revertRollback回滚恢复到上一个良好状态操作有副作用且不可重复数据库事务 claude -r 选择回滚位置Retry重试原地重新执行失败是随机性的Claude Code 的 tool 重试Branch分支多方案并行尝试解空间大且资源充足Git worktree 并行实验Karpathy 选择 ratchet 是因为他的场景完美匹配val_bpb 是一个明确的标量指标越低越好没有歧义。如果你的目标不是一个清晰的标量——比如代码质量——ratchet 就不适用。一点思考有时感觉Agent中的Loop跟SFT/RL有些像他需要监督数据 - 可以是标注数据、也可以是可量化的目标目标可衡量是决定能否Loop的关键四、从实验到工业Claude Code 的验证AutoResearch 是一个研究工具面向的是可重复的 ML 实验。但它的设计原则是否适用于更复杂的场景Claude Code 给出了答案。同一哲学不同规模VILA Lab 的逆向分析揭示了 Claude Code 的架构核心 - queryloop用户消息 → 上下文组装 → LLM 推理 → 工具调用 ↓ yes执行工具 → 结果加入上下文 → 继续推理 ↓ no输出回复 → 循环结束和 AutoResearch 一样的极简循环。但支撑这个循环的基础设施复杂得多关于Claude Code的基础设施可以阅读VILA Lab的论文-Dive into Claude Code: The Design Space of Today’s and Future AI Agent Systems网上有很多解读Harness的文章都有提及维度AutoResearchClaude Code循环逻辑占比极小3 文件结构~1.6%queryLoop()基础设施git commit/revert 固定时间窗权限系统 上下文压缩 子 Agent 沙箱 持久化终止条件1-2 个5 个权限模型无全自动7 种渐进模式plan → bypassPermissions上下文管理无每轮独立5 层渐进压缩管线Claude Code 证明了简单循环 复杂基础设施(Harness)的模式可以 scale 到通用编码场景。循环本身做的事很少——接收消息、推理、调工具、输出——所有复杂度都在外面权限该不该放行上下文装得下吗需不需要 spawn 子 Agent这些才是决定一个Agent系统能不能稳定、长期运行的关键。五个关键决策设计一个循环本质上是回答五个问题。AutoResearch 和 Claude Code 分别给出了自己的答案决策 1终止条件——何时停止上文已说明4种场景决策 2检查点——何时需要人工审批AutoResearch 的答案是不需要。因为有 ratchet 保底结果只进不退。Claude Code 的答案是分层deny-first 权限系统默认拒绝所有写操作7 种权限模式构成渐进自主频谱。高风险操作写文件、执行命令拦截低风险操作读文件、搜索放行。⚠️ 来自 Claude Code 的踩坑数据 研究表明用户对权限弹窗的批准率高达 93%。这说明人是有惰性的不靠谱久而久之会形成“无脑点同意”的肌肉记忆。所以绝对不要把系统的安全性完全押宝在“用户会仔细审查”上底层必须做沙箱隔离和严格的权限分级 - Harness。关于检查点如何设置可以根据下面的决策树确定决策 3回退策略——出错怎么办上文已讨论决策 4循环粒度——一步做多少工作细粒度 ←─────────────────────────────→ 粗粒度单工具调用 多步 plan-execute 完整子任务 ↑ ↑ ↑快速反馈 平衡 高自主但难调试AutoResearch 选择粗粒度一个完整实验是一步。因为实验是原子性的——跑到一半的实验没有意义。Claude Code 选择细粒度单个工具调用是一步。因为编码任务的步骤之间有强依赖每步都需要验证上一步的结果。选择依据任务可分解性高 → 细粒度任务已稳定运行 → 粗粒度。大多数情况下从细粒度起步验证稳定后再逐步放粗。决策 5子任务委派——何时派发子 Agent当子任务满足以下条件时应该委派给独立 Agent耗时超过 5 分钟阻塞主循环代价太高需要独立上下文避免信息互相污染多个子任务之间无依赖可并行关于子Agent何时使用的问题也有很多文章探讨这里仅做简单说明。Claude Code 的实现子 Agent 以 minimal 模式运行只有工具和技能不继承主Agent的记忆、不给用户发消息、不和其他Agent通讯完成后只返回一段摘要给主 Agent保证了上下文隔离。没有免费的午餐子Agent的代价不低Agent Teams 模式消耗约 7 倍标准会话 token。原则只在并行收益 协调成本时才拆分。可直接套用的决策表上述决策项总结如下表你的场景终止条件检查点回退策略粒度子AgentML 实验优化时间耗尽/无改进无Ratchet完整实验否代码生成测试全部通过高风险操作前Branch多步 plan大重构时数据处理质量指标达标每 10 个产出抽查Retry单步执行否研究综述信息饱和方向选择时Rollback搜索-阅读循环多主题并行时五、循环的暗面三重陷阱循环放大效率也放大风险Osmani 识别了三个随循环自主化程度提高而加剧的风险。AutoResearch 的社区实践暴露了这一点。陷阱 1验证困境Verification Gap问题循环产出速度远超人类审查带宽。AutoResearch 社区的一个真实案例一个针对 Shopify Liquid 模板引擎的 PR 最终未被合并被标记为probably somewhat overfit。循环优化了指标但产出了过拟合的方案。MSR 的研究数据更触目惊心56.1% 的 AI agent commit 降低了代码可维护性。超过一半的改进实际上在堆积技术债。对策分层验证。第一层自动门控测试通过、lint 无报错、类型检查正确第二层质量阈值监控指标跌破阈值时自动暂停循环第三层人工抽查10% 采样率随机抽检保持威慑效应陷阱 2人类不懂Agent产物Comprehension Debt问题你读了 AI 产出的代码觉得看起来没问题但其实没真正理解。Shen Tamkin2026的研究AI 辅助条件下开发者代码理解力测试得分低 17%。He et al.2025对 807 个仓库的因果分析采用 AI 编码工具后代码复杂度显著上升初始的速度提升在 3 个月后消散至基线。短期效率提升被长期维护成本吃掉了。在我们部门有两种观点人类不用读懂代码有问题丢给Agent去修就行人类设计好模块、框架Agent去填充人需要看懂代码知道细节你认为哪种观点更合理对策强制理解环节。在循环设计中加入AI 必须解释为什么这样改的环节代码和文档在同一个循环中更新定期手动重构核心模块重建深度理解陷阱 3放弃自主思考Cognitive Surrender问题逐渐放弃独立判断默认接受循环的结论。Anthropic 内部对 132 名工程师的调查Huang et al., 2025揭示监督悖论过度依赖 AI 可能萎缩你监督 AI 所需的技能。你越依赖循环的产出你越难以判断产出是否正确。对策保持手感。每周至少手动完成一次核心任务定期盲测对比自己独立判断再与 AI 产出对比让未参与循环设计的人审查产出这里也有另一种声音你的观点是什么呢我以为到了现在这个阶段我会感到害怕或无聊……但事实并非如此。相反我感到非常兴奋因为我能做的事情多得多了。我原以为我真的喜欢写代码但现在我发现我实际上只是喜欢我从写代码中获得的成果Loop Harness一体两面 - 爬出陷阱的梯子三个陷阱的应对方式有一个共同模式对策不在循环逻辑内部而在 harness运行时基础设施层。用 ETCLOVG 框架CMU/Yale/JHU 等联合发布的《Agent Harness Engineering: A Survey》提出的七层分类法理解Loop 只影响 C 和 L 两层而 Harness 覆盖全部七层Loop Engineering 主要影响两层├─ C (Context) — 每轮循环给 AI 看什么信息└─ L (Lifecycle) — 循环的启动、暂停、终止逻辑Harness Engineering 覆盖全部七层E (Entrypoint) — 用户如何触发循环T (Tooling) — 循环中可调用的工具集C (Context) — 上下文组装和压缩L (Lifecycle) — 循环状态管理O (Observability) — 循环运行的可见性V (Verification) — 评估和验证层G (Governance) — 权限和审计结论没有 harness 的 loop 就像没有刹车的跑车——跑得越快越危险。多说一句思考是灵魂保持思考保持批判精神即使可以通过Harness驯服Agent也请不要停止思考。六、一个思考题如果你现在手头有个任务需要 AI 帮忙问自己三个问题终止条件是什么 如果答不上来不要开始循环。最坏情况下会发生什么 如果不可接受加检查点。产出结果我能验证吗 如果不能这个任务不适合自动化循环。答完这三个问题你就已经在做 Loop Engineering 了。个人的小思考现在的Agent进化有点像编译器的“自举”冷启动之后开始向着自进化演进想想还真有点令人恐惧。结语Karpathy 用 AutoResearch 证明了一件事AI 工程的未来可以不是写更好的提示词也可以是设计更好的循环系统。循环的核心是简洁固定步骤、单一判断、明确终止。复杂度不在循环里在支撑循环运行的基础设施里。从 program.md 到 queryLoop()从 5 分钟 ML 实验到通用编码 Agent设计模式惊人一致。这不是巧合——这是循环工程的第一性原理让循环笨而可靠让基础设施聪明而强壮。如何学习大模型 AI 由于新岗位的生产效率要优于被取代岗位的生产效率所以实际上整个社会的生产效率是提升的。但是具体到个人只能说是“最先掌握AI的人将会比较晚掌握AI的人有竞争优势”。这句话放在计算机、互联网、移动互联网的开局时期都是一样的道理。我在一线科技企业深耕十二载见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事早已在效率与薪资上形成代际优势我意识到有很多经验和知识值得分享给大家也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包✅ 从零到一的 AI 学习路径图✅ 大模型调优实战手册附医疗/金融等大厂真实案例✅ 百度/阿里专家闭门录播课✅ 大模型当下最新行业报告✅ 真实大厂面试真题✅ 2026 最新岗位需求图谱所有资料 ⚡️ 朋友们如果有需要《AI大模型入门进阶学习资源包》下方扫码获取~① 全套AI大模型应用开发视频教程包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点② 大模型系统化学习路线作为学习AI大模型技术的新手方向至关重要。 正确的学习路线可以为你节省时间少走弯路方向不对努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划带你从零基础入门到精通③ 大模型学习书籍文档学习AI大模型离不开书籍文档我精选了一系列大模型技术的书籍和学习文档电子版它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。④ AI大模型最新行业报告2025最新行业报告针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。⑤ 大模型项目实战配套源码学以致用在项目实战中检验和巩固你所学到的知识同时为你找工作就业和职业发展打下坚实的基础。⑥ 大模型大厂面试真题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我精心整理了一份大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。以上资料如何领取为什么大家都在学大模型最近科技巨头英特尔宣布裁员2万人传统岗位不断缩减但AI相关技术岗疯狂扩招有3-5年经验大厂薪资就能给到50K*20薪不出1年“有AI项目经验”将成为投递简历的门槛。风口之下与其像“温水煮青蛙”一样坐等被行业淘汰不如先人一步掌握AI大模型原理应用技术项目实操经验“顺风”翻盘这些资料真的有用吗这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理现任上海殷泊信息科技CEO其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证服务航天科工、国家电网等1000企业以第一作者在IEEE Transactions发表论文50篇获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。资料内容涵盖了从入门到进阶的各类视频教程和实战项目无论你是小白还是有些技术基础的技术人员这份资料都绝对能帮助你提升薪资待遇转行大模型岗位。以上全套大模型资料如何领取
返回列表