大家好我是玄姐。2026年2月OpenAI 披露了一组数字一个最初只有3人的工程师团队在完全禁止手写代码的前提下用 AI Agent 在5个月内产出超过100万行代码合并1500个 Pull Request效率提升约10倍。这组数字真正值得咀嚼的不是快而是它的前提条件禁止手写代码。这意味着所有质量约束、架构规范、审查流程必须全部沉淀到 AI 的运行环境里而不是依赖人的临场发挥。这就是 Harness Engineering 要解决的核心命题交付代码的成本已接近免费但交付好代码的成本依然很高。当团队里每个人都能用 AI 秒级生成代码拉开差距的不再是谁写得快而是谁写得稳、写得可维护。而 Harness 做的事情就是把好代码的标准写进系统让 AI 在约束下自己干活。一、为什么是 HarnessVibe Coding 的三条死路Harness 一词来自马术缰绳、马鞍、马镫。野马力量再大没有马具就无法耕地、运货、上战场。AI 同理Agent Model Harness。模型提供智能Harness 把智能变成生产力。LLM 本身无状态、无工具、无记忆。Harness 层就是给模型装上手脚与记忆的工程基础设施你写的每一份规则、配的每一个工具都是 Harness 的一部分。没有 Harness 约束的氛围编码Vibe Coding走的是一条起步极快→中期混乱→后期崩盘的路致命问题典型现象最终后果架构混乱Agent 爱走捷径功能 A 用库 X、功能 B 用库 Y毫无分层概念换底层逻辑等于重写整个项目上下文雪崩项目超过50个文件后 Agent 开始忘事今天user_id明天uid项目越大 Agent 越蠢修一个 Bug 冒出两个可维护性丧失开发过程是黑盒只有 Agent 知道代码怎么来的人想接手时读几千行垃圾代码不如重写Harness Engineering 正是为此而生它提供四类能力安全边界权限控制、审计日志、可观测性Token 计数、成本追踪、决策日志、可靠性重试、降级、确定性兜底、扩展性工具生态、技能系统、多 Agent 协同。二、六大支柱把 Agent 运行环境拆开看Harness 把 Agent 的运行环境拆解为6个支柱。单独的 MCP、Skills、Rules 都不难理解真正的关键是放进支柱体系里各自承担什么角色、在哪个环节发力、如何相互配合。支柱一上下文管理 -- AI 在对的时间看到对的信息上下文窗口有限且贵核心策略是渐进式披露用一份约100行的 AGENTS.md 当目录索引指向架构文档、Rules 等细分文档而不是一次灌入几千行规范。OpenAI 自己就踩过一个巨型 AGENTS.md 的坑正确做法是拆成多个专注文档、用索引串联。同时把需求与设计决策写进 Git 仓库的 Spec 文件成为 AI 随时可调取的长期记忆把团队 Wiki 和业务文档挂载为知识库让 AI 有业务上下文。原则只有一条仓库知识是系统记录System of Record别依赖聊天历史。支柱二工具系统 -- MCP、Skills、知识库的三角协同这是整个体系里最容易被混淆、也最见功力的一环。一个精准的比喻MCP 是开门的钥匙Skills 是开门后做的事知识库是进门前读的说明书。MCP连接层DB MCP 让 AI 读取实时数据库 Schema不再写出不存在的字段API MCP 保证微服务联调时接口参数一致运维 MCP 让 AI 直接触发构建、查看日志、分析告警。Skills能力层把领域专家经验、执行 SOP 固化成 AI 可执行的指令让 AI 从什么都会一点变成某个领域的专家。元技能如 skill-creator甚至能让 AI 根据现有代码自我扩展技能库。知识库上下文层挂载团队 Wiki、代码仓库、业务文档AI 从通用模型变成懂业务的助手少猜多做。三者缺一不可没有 MCPAI 闭门造车没有 Skills有钥匙不知道进门干什么没有知识库进了门也不懂业务。支柱三执行编排 -- 31 Phase多 Agent 工作流执行编排不是简单选 Plan 模式还是 Agent 模式而是一套多 Agent 角色协作的标准化流水线阶段角色输入→产出Phase 1 计划Planner Agent需求描述 → Plan 模式生成 requirements.md → 人工审核 → task.md 任务清单Phase 2 编码Generator Agent加载 RulesSkills调用 MCP 工具 → 源代码单元测试Phase 3 交付Evaluator Agent规范合规检查逻辑审查自动测试 → 通过核查的 PRPhase 4 沉淀Archiver AgentSpec 归档 → 更新项目知识库 → 持久化知识资产底层遵循 SDD规范驱动开发工作流requirements.md → 人工审核 → task.md → 执行 → 归档每个任务必须有明确的验收标准Acceptance Criteria。支柱四状态与记忆 -- 长周期开发的一致性分四层管理短期记忆当前会话、中期记忆Memories 跨会话持久化、长期记忆Git 仓库中的 Spec 文件、变更记忆changes/ 目录的 Spec Deltas。本质是把记忆从脆弱的聊天记录迁移到可版本化的工程资产里。支柱五评估与观测 -- AI 产出的四层验证L1 语法编译/Lint 通过→ L2 逻辑单测通过→ L3 规范符合 Rules 约束→ L4 架构不破坏现有设计人工 AI 联合审查。代码写完自动编译自测合入前 AI Code Review 把关形成编译→测试→审查的闭环。支柱六约束与恢复 -- 三级护栏硬性红线Rules不可违反如禁止在 Controller 层写业务逻辑、所有数据库查询必须走 Repository 模式软性约束Skills推荐遵循如优先复用项目已有工具类、日志格式遵循团队标准安全策略Safety兜底保护如数据库变更优先生成 SQL 脚本而非直接执行、高风险操作自动检测影响范围。恢复机制则依托 Git所有变更可回滚、Spec Deltas 可追溯、编译失败自动回退到上一个稳定状态。三、落地路线图三阶段渐进第一阶段基础建设1-2周让每个人用上工具、建立基本约束。核心动作IDE 插件安装与模型策略配置复杂任务用强模型敏感业务用内部部署模型代码不出域建立团队 team-harness 仓库作为规范的唯一真实来源集中管理 Rules、Skills 模板、AGENTS.md 模板业务项目通过同步脚本拉取编写分层 Rules 体系个人级/团队级/项目级项目根目录放置精简的 AGENTS.md挂载 P0 级知识库团队技术文档、核心公共库。第二阶段工具接入2-4周接 MCP、沉淀 Skills、跑通 SDD。MCP 接入遵循优先级清单P0DB MCP、代码仓库 MCPP1Wiki MCP、需求管理 MCPP2CI/CD MCP并守住一条判断标准引入 MCP 的复杂度大于它解决的问题就不用。Skills 通过skill-creator 分析现有代码→人工审查→验证效果→上传团队仓库四步沉淀。Plan 模式按 4 Stage 运行生成需求文档→人工逐项审核→生成任务清单逐步执行→审查归档。第三阶段持续优化持续建立度量看板AI 代码占比、需求交付量、Bug 率、Review 通过率用度量数据反哺 Rules 和 Skills 迭代形成知识飞轮。四、日常 SOP 与协作红线日常开发固化为三类 SOP新需求开发半天以内可直接 Agent 模式但仍受 Rules 约束超过半天必须走 Plan 模式Bug 修复一个 PR 只修一个 Bug、必须编写能复现 Bug 的测试用例、commit 信息标准化AI 辅助 Code Review提交前自查 Review 他人PR检查清单覆盖架构分层、错误处理、SQL 注入、N1 查询、commit 规范。团队协作有五条不可违反的红线先 Spec 后 CodeRules 必须同步至 Git 仓库不允许本地私有通用逻辑必须抽象为 Skill 全队复用关键元数据优先 MCP 实时同步而非手动维护副本所有变更可追溯。五、八个反模式踩坑对照表巨型 Prompt几千字需求一次性丢给 AI → 先 Plan 模式拆解再逐步执行跳过审核直接编码觉得需求简单就不写 Spec → 半天以上的需求必须走 Plan 模式Rules 写了不维护半年后与实际规范脱节 → 月度 Review 定期检查MCP 过度接入十几个 Server 导致 Token 暴增 → 只接 P0/P1 优先级Skill 不原子化一个 Skill 塞太多功能 → 一个 Skill 只解决一类问题盲目信任 AI 输出不审查直接合入 → 所有 AI 生成代码必须人工 CRChat 历史当文档需求细节全在聊天记录里 → 持久化到 plan 目录一个 PR 改所有让 AI 一次实现多个不相关功能 → 一个 PR 只解决一个问题。六、规范的最后一公里让规范可执行落地最大的痛点是规范写完容易执行下去难。解法是做一个 harness-audit 类的审计 Skill把整套规范的检查项固化成可执行的合规工具一句话给项目打分、找问题、开药方。它覆盖7个维度AGENTS.md15%、Rules 约束体系20%、Skills 沉淀15%、MCP 接入10%、Plan 模式实践15%、工程规范15%、Commit 规范10%按 S/A/B/C/D 五级评定问题按 P0-P3 优先级给出附带操作步骤的改进建议。每个审计维度精确对应规范的某一章节Skill 就是规范的可执行版本。但要记住审计报告是体检结果不是 KPI。重点是发现问题、推动改进而不是刷分考核。七、结语Django 创始人有句话交付代码的成本已经接近免费了但交付好代码的成本依然很高。AI Agent 能在代码质量的各个环节帮忙但最终的质量把关依然靠操作工具的人你得知道什么是好代码得能判断 Agent 的产出够不够好得在关键处做出正确的取舍。成本降低了标准不能降低。工具变强了人的判断力要跟着变强。让各类工具适配规范而不是靠个人去适配各类工具这就是从人驱动 AI到AI 自驱动的转变。当团队把交付代码交给 AI 执行、把交付好代码的标准写进 Harness 系统、把经验持续沉淀为可复用资产知识飞轮就会转起来新成员越多整体效率反而越高。流水的工具铁打的规范。学习资源推荐如果你想更深入地学习大模型以下是一些非常有价值的学习资源这些资源将帮助你从不同角度学习大模型提升你的实践能力。一、全套AGI大模型学习路线AI大模型时代的学习之旅从基础到前沿掌握人工智能的核心技能​因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取二、640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示​因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取三、AI大模型经典PDF籍随着人工智能技术的飞速发展AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型如GPT-3、BERT、XLNet等以其强大的语言理解和生成能力正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取四、AI大模型商业化落地方案作为普通人入局大模型时代需要持续学习和实践不断提高自己的技能和认知水平同时也需要有责任感和伦理意识为人工智能的健康发展贡献力量。