
让Agent自动构建Agent过去LlamaFactory让每个人都能微调大模型现在PenguinHarness希望让每个人都能构建自进化Agent。LlamaFactory的作者郑耀威最近开源新项目PenguinHarness这个“企鹅驾驭师”能自动完成Agent的构建、评测和持续改进实现从“手动调优Agent”到“Agent自我迭代”的跨越。PenguinHarness是原生支持自我进化的AgentHarness主打轻量、开源、易用基于原创Agent内核能驾驭GPT - 5.6、DeepSeek V4等框架。其开源地址为https://github.com/Prism - Shadow/penguin - harness 主页链接是https://penguin.ooo 。项目初衷与2026年热门的AI4AI、递归自我进化RSI等方向契合。Meta前研究总监田渊栋的Recursive探索AI递归自我改进潜力首篇博客证明Agent可训练模型、优化GPU算子MSRA前副院长边江的XYZ AI Lab探索出用数百个Agent完成Deep Research模型后训练的路径。而PenguinHarness立志做最好用的开源Harness让Agent自进化无需手动调优。它能让Agent自动构建另一个Agent。对比PenguinHarness和OpenAI Codex在“让AI生成RAG应用”案例中的表现视频显示PenguinHarness耗时少、成本低于Codex数十倍还产出可直接落地的RAG Agent应用其回答语言通顺、有流式输出和来源引用而Codex结果中英混杂、缺少流式输出。过去开发Agent应用需框架选型、模型部署等耗费团队数周精力Claude Code等工具也难像开发前端网页一样容易。PenguinHarness则设计好一切选项只需说明需求它就能生成脚手架、Prompt等交付完整能跑的Agent应用仅花费0.2元Token和一杯咖啡时间。郑耀威揭示PenguinHarness原理将文件系统作为唯一真相来源Agent、提示词、对话历史都是文件框架把文件拼装成可运行的Agent对象构造新Agent就是文件复制粘贴。运行时PenguinMessage作为消息协议在模型、环境和用户间交换统一轻量的接口让其可轻松接入任意代码。PenguinHarness既是框架又是实体非常了解自身。本地可复现的Agent自进化闭环让Agent构建Agent只是第一步PenguinHarness长远目标是让每个人能在本地拥有自进化Agent。构建Agent从0到1优化从1到100面临诸多挑战。郑耀威认为Agent是代码和文件修改易但变好难大模型有随机性Agent更具不确定性做好自进化需可靠评估系统。ReAct论文作者姚顺雨称评估是大模型下半场对Agent自进化同样适用好的评估基准是根本。郑耀威团队花半年多探索评估方式因现有评估大多只有测试集在测试集跑自进化难区分Agent是背答案还是真进化所以团队制作了GDPevo评估基准覆盖医疗等六大场景划分训练/测试集防止“偷看答案”。PenguinHarness吸纳GDPevo思想将Agent评估和优化凝练为Skills。调用Skill后它启动多智能体完成Agent调优即“自进化”。比如做预测球赛、投资策略等的Agent初始准确率低过去需手动调优现在PenguinHarness可自动完成。视频显示PenguinHarness多次迭代后Agent分数从53分提升到95分使用DeepSeek V4 Flash正式版仅花0.5元Token。背后是多智能体协作流程先由Benchmark Builder出题并校准难度优化阶段三个Agent组成闭环经组织评测、独立打分、分析优化、验证迭代四步只有候选版本得分更高才接受否则回退到上一版本。从一次性交付到持续进化这是PenguinHarness对下一代Agent Harness的回答。和自进化Agent之间的契约为让Agent自进化更“稳”PenguinHarness设计了“契约”。重点包括限定Agent修改范围为提示词和Skills不触及Harness内核防止安全风险Agent自进化有快照和回滚能力可应对负面作用目标Agent进化中只能看题目不看Rubrics防止Reward Hacking优化流程形成文件记录用户可审计提供可解释性。该契约形式化为“CONTRACT.md”文件便于复制分发。PenguinHarness的其他有趣特性团队探索中为PenguinHarness赋予多种能力。它内置LlamaFactory、vLLM、Ollama等相关Skills可用类似Vibe Coding方法启动模型训练和部署集成统一模型网关支持接入1000多种在线与本地模型适配Kimi K3、Gemini 3.6、Ling 3.0 Flash等为DeepSeek装上眼睛可配置视觉代理模型让DeepSeek基于视觉反馈调整支持细粒度行为轨迹分析可分析Agent性能卡点可作类似Pi Agent的空白样板内置Agent设计极简以Shell为通用接口工具少优化Subagent等功能系统提示词仅Claude Code的十分之一1,300 vs 15,000。在严谨评估基准上PenguinHarness配合DeepSeek模型表现佳成本仅其他产品数十分之一。实际部署中某体检机构用其生成报告核查Agent核查时间从30分钟减至几十秒某制造企业将其构建的Agents用于流水线巡检产线停机时间减少65%产出提升近2倍。PenguinHarness以Apache2.0协议开源支持Linux、Mac、Windows一键安装可本地部署或远程浏览器访问支持多用户隔离和团队协同可作Agent自动构建平台或Codex本地平替低成本完成任务。期待其获更多关注构建有趣Agent应用成为Agent生产引擎让大家享受自进化Agent带来的生产力提升。PenguinHarness背后的团队PenguinHarness由PrismShadow团队于2025年开源团队专注打造能在真实业务中持续学习的Agent基础平台将企业知识等转化为可部署、评测、优化的Agent。团队创始成员包括郑耀威LlamaFactory开源框架作者GitHub7万星标专注打造易用模型与Agent基础设施钱步月加州大学戴维斯分校博士曾任IBM TJ Waston高级研究员、复旦大学教授和博导吴雪军前百度NLP部门创始成员曾任阿里巴巴高级总监和京东数科副总裁胡俊豪北京大学博士生提出位置无关缓存参与MiMo V2模型、Hy3系列模型研发陈溪美国纽约大学商学院教授卡耐基梅隆大学博士曾任亚马逊首席科学家。团队从LlamaFactory到PenguinHarness坚持将复杂AI能力变成易用、可靠、高效的大众化工具的使命。