尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

2026.08.14Agent Harness 全景盘点:从 Claude Code、Codex 到昨日开源的 DeepSeek Harness,一张地图看懂「Model + Harness」时代

2026.08.14Agent Harness 全景盘点:从 Claude Code、Codex 到昨日开源的 DeepSeek Harness,一张地图看懂「Model + Harness」时代 2026 Agent Harness 全景盘点从 Claude Code、Codex 到昨日开源的 DeepSeek Harness一张地图看懂「Model Harness」时代更新时间2026-08-14北京时间信息截止2026-08-14 10:50 CST标签Agent HarnessHarness EngineeringDeepSeek HarnessClaude CodeCodexOpenClawHermes AgentDeep Agents适用读者AI 工程师、架构师、技术选型决策者、Agent 方向研究者TL;DR核心要点2026 年 AI 工程的第一公式是Agent Model Harness。模型负责推理与生成Harness 负责把模型能力落到真实环境工具调用、上下文管理、沙箱执行、记忆持久化、错误恢复与任务闭环。这一术语由 OpenAI 与 LangChain 在 2026 年初共同确立现已成为行业共识。工程范式完成了三级跳Prompt Engineering2023→ Context Engineering2025→Harness Engineering2026。模型层的竞争边际收益递减Harness 层成为新的护城河。昨天2026-08-13晚上DeepSeek 发布了 Harness 开发者预览版 v0.1MIT 协议开源主打「一切皆插件」模型、工具、技能、会话、沙箱、存储、循环、调度、UI 全部是基于 Cordis 元框架的可替换插件并提供标准 / PTC / 极简 / 创造四种运行模式。这是 DeepSeek 首款 Agent 产品也是首个由头部模型厂商开源的「全栈可组装」Harness。当前主流 Harness 工具可分为五大阵营模型厂商旗舰Claude Code、OpenAI Codex、DeepSeek Harness、开源社区OpenCode、OpenClaw、Hermes Agent、IDE 内嵌Cursor、Trae、框架自建LangChain Deep Agents、Open SWE、各家 Agents SDK、通用任务型Manus、WorkBuddy、Trae Work、Kimi Work。选型没有全局最优只有场景最优重型代码工程看 Claude Code / Codex私有化与可组装性看 DeepSeek Harness个人全能助理看 OpenClaw / Hermes企业自建看 Deep Agents / Open SWEIDE 重度用户看 Cursor / Trae。目录概念正名Harness 到底是什么简史Harness 如何在 9 个月内成为行业主词解剖学成熟 Harness 的六层参考架构全景盘点五大阵营、十四款主流工具焦点深潜DeepSeek Harness v0.1 逐层拆解横向对比与选型矩阵趋势研判关于 Harness 的七个判断FAQ高频问题速答参考资料一、概念正名Harness 到底是什么1.1 定义模型之外的一切Harness 原意为「马具」——缰绳、马鞍、挽具的总称。在 AI Agent 语境下它指包裹在大模型外部的全部运行时基础设施。用一个被广泛引用的公式表达Agent Model HarnessModel无状态的推理引擎。只接收 token、输出 token读不了你的代码库、写不了文件、跑不了测试也不记得上一次会话做过什么。Harness除模型权重以外的所有代码、配置与执行逻辑——上下文管理、工具调用、沙箱、记忆、调度、权限、验证回路、可观测性。一个更锋利的操作性定义是如果你没在做模型训练或推理服务本身那你干的活多半都属于 Harness 范畴。一个流传甚广的类比模型是一位被绑住手脚的天才顾问Harness 是给它配备的整间办公室——电话、电脑、秘书、日历与会议室。Model Harness才构成一个能真正交付工作的 Agent。1.2 术语消歧此 Harness 非彼 Harness为避免检索与讨论中的混淆需要区分三个同名概念术语含义代表Agent Harness本文主题模型外部的运行时基础设施让 Agent 可靠干活Claude Code、Codex、DeepSeek HarnessEvaluation Harness模型能力评测的执行框架是另一个独立领域EleutherAI lm-evaluation-harness、HELM、Inspect AICI/CD 平台 Harness一家持续交付软件公司的商标名Harness.io2025 年 11 月底 Anthropic 的一场内部实验成为分水岭他们让 Claude Code 在一条高级指令下「克隆 claude.ai」结果即便是 Opus 4.5 这样的前沿模型也无法稳定完成——上下文窗口耗尽、半成品无人接手、过早宣布完工。结论直指要害不是模型不够聪明而是缺少一个让它持续、可靠工作的 Harness。1.3 为什么「模型决定上限Harness 决定下限」中金研究在 2026 年 6 月的报告《Agent Harness模型之外、智能之内》中的概括最为精炼Agent Harness 是在模型外围构建一套可控、可编排、可验证的系统层使 Agent 稳定完成复杂长程任务。CMU、耶鲁等机构在 2026 年 6 月发布的 Harness 工程综述进一步给出了实证在不改模型权重的情况下仅调整 Harness 层本身就可能显著改变 Agent 在 coding 与 terminal benchmark 上的表现。二、简史Harness 如何在 9 个月内成为行业主词Harness 的爆火是一场「连环事件驱动的完美风暴」。以下是关键时间线时间事件意义2025 年OpenClaw「龙虾」发布MIT 开源 Agent 执行网关插件生态先行2025-11 下旬Anthropic 发布《Effective harnesses for long-running agents》提出长时 Agent 双智能体架构初始化 Agent 编码 Agent2026-01LangChain 发布 Deep Agents伴随 LangChain 1.0把 Claude Code 式设计抽象为开箱即用的开源 harness2026-02-05Mitchell HashimotoHashiCorp 联创发文喊出「Engineer the Harness」「Harness 工程师」角色首次被命名2026-02-11OpenAI 发布《Harness engineering: leveraging Codex in an agent-first world》披露 3 名工程师 Codex、5 个月、近 100 万行生产代码、0 行人工手写、约 1500 个自动 PR的实验Harness Engineering 正式成为方法论2026-02Nous Research 开源 Hermes Agent「自进化」路线登场2 个月 5.1 万 Star2026-03DeepSeek 组建 Harness 团队崔添翼负责头部模型厂商下场做独立 Harness 产品线2026-04Claude Code 源码泄露事件约 57MB全球开发者「狂欢式学习」Claude Code 成为 Harness 设计的事实教科书2026-06CMU/耶鲁等发布 Harness 工程综述中金发布 Agent Harness 研究报告学术与金融研究同时入场概念完成正名2026-08-01崔添翼在 X 发帖招募 DeepSeek Harness 内测招募帖变成开源 Agent 生态大摸底2026-08-12DeepSeek Harness 公众号注册「黑鲸」头像内测口碑刷屏有内测用户称愿称其为「宇宙最强」2026-08-13DeepSeek Harness v0.1 开发者预览版发布MIT 开源首个头部模型厂商开源的全栈可组装 Agent Harness2026-08-14DeepSeek V4 Pro 正式上线「模型 Harness」双线齐发一条隐藏主线值得注意OpenAI 产品负责人 Thibault Sottiaux 在 2026 年 8 月初公开表示「再过 2–3 个月Codex 这样的 Harness 就是个原始工具了」——Harness 正在从单机工具向云原生 Agent 基础设施演进。三、解剖学成熟 Harness 的六层参考架构对比 Claude Code、Codex、DeepSeek Harness、Deep Agents 等头部项目可以归纳出一套「六层 事件流」的参考架构。这也是后文盘点每一款工具时的统一分析框架层职责典型机制L1 上下文工程层管好模型的「注意力」项目指令文件CLAUDE.md / AGENTS.md、静态底座 动态模块的缓存优先 Prompt 组装、渐进式上下文压缩L2 记忆层跨会话的「经验」追加式会话日志、FTS5 全文检索 LLM 记忆、向量存储、进度日志progress logL3 工具与环境层给模型「手脚」Bash/Shell、文件编辑str_replace_editor、联网检索、沙箱隔离、MCP 工具接入L4 编排层任务的拆解与调度Plan→Work→Review 闭环、子 Agent / Agent Teams、Cron 定时、后台任务L5 验证与恢复层让错误「出不了门」Verification Agent、闭环测试、hooks 生命周期钩子、错误恢复、断点续跑/分叉/回放L6 治理与安全层让系统「可审计」权限门控、Human-in-the-loop 审批、审计日志、策略约束guardrails横切事件流一切行为可追溯append-only 事件日志DeepSeek Harness 的 Trajectory 视图即此层产品化一个判断 Harness 成熟度的简单标准看它如何对待失败。初级 harness 把错误抛给用户成熟 harness 把错误转化为反馈回路——自动重试、测试闭环、日志回放、架构护栏。四、全景盘点五大阵营、十四款主流工具4.0 总览表2026-08-14 快照工具阵营开源一句话定位Claude Code模型厂商旗舰闭源源码曾泄露终端工程级 Coding Agent 的行业标杆OpenAI Codex模型厂商旗舰闭源Harness Engineering 的发源地云端全自主DeepSeek Harness模型厂商旗舰MIT 开源v0.1一切皆插件的可组装 Harness昨日发布OpenCode开源社区完全开源GoJS多模型、可定制、隐私优先的终端 harnessOpenClaw开源社区MIT50 平台接入的个人 Agent 执行网关Hermes Agent开源社区开源会「自我进化」的通用 AgentCursorIDE 内嵌闭源IDE 内实时协作的 Agent HarnessTrae / Trae WorkIDE 内嵌闭源字节系的 AI IDE 与本地 AgentDeep Agents框架自建开源LangChain 出品的开箱即用 harnessOpen SWE框架自建开源企业内部 Coding Agent 的收敛架构OpenAI Agents SDK / Google ADK / MS Agent Framework / CrewAI / Mastra框架自建开源各家厂商的 Agent 开发底座Manus通用任务型闭源长程通用任务的自主 AgentWorkBuddy / Kimi Work通用任务型闭源国产本地办公 Agent4.1 模型厂商旗舰 Harness① Claude CodeAnthropic——「行业标杆教科书」定位终端 Coding Agent深度重构与大型代码库场景的事实标准。Harness 设计亮点2026-04 源码泄露后被社区系统性拆解公认是学习 Harness 设计的最佳教材三层架构技能层Skill封装代码审查等任务流程→ 工作流层Workflow编排执行顺序→ 配置层Profile全局规则核心是 Plan→Work→Review 闭环8 类基础工具bash、read、edit 等 子代理机制缓存优先的 Prompt 组装「静态底座 动态模块」静态在前、动态在后最大化 KV 缓存命中显著降低成本与延迟三层渐进式上下文压缩对抗长任务上下文腐烂六大内置 Agent其中 Verification Agent 充当「代码质检官」hooks 机制实现编辑后自动触发测试等流程自动化CLAUDE.md 作为项目级「说明书」。战绩据第三方评测数据2026-07Claude Code 以80.9%通过率位居 SWE-bench Verified 榜首在至顶 AI 实验室的六维评测中总分 82.5。适合谁中大型代码库的深度重构、需要严谨工程闭环的专业开发者。② OpenAI CodexCLI / Cloud / IDE——「Harness Engineering 发源地」定位OpenAI 生态的 Agent 全家桶本地 CLI 云端全自主双形态。关键事实2026-02 官方文章披露的「百万行实验」小团队用 5 个月、约 1500 个自动 PR、0 行人工手写代码做出内部 beta 产品。工程师的角色从写代码变为设计环境、指定意图、建立反馈回路Codex App Server 进一步明确了 harness 的完整边界不止「用户—模型—工具」核心 loop还包括线程生命周期与持久化、配置与鉴权、工具执行扩展、客户端与运行时之间的协议层至顶 AI 实验室六维评测中Codex 以91.6 分排名第一Manus 86.4、Claude Code 82.5、OpenClaw 79.9SWE-bench Verified 77.3%。适合谁OpenAI 生态用户希望把整条任务「扔进云端异步跑完」的团队。③ DeepSeek Harness——「昨日发布的开源全栈工作台」详见第五章深潜4.2 开源社区 Harness④ OpenCode——「社区之王」完全开源Go JS由开源社区Anomaly 团队维护截至 2026-05 GitHub Star 约158k是终端类 harness 中 Star 数最高的开源项目之一。卖点多模型任意切换、隐私优先、可深度定制国内可用性在终端类工具中最好。适合谁不愿绑定任何一家模型厂商、重视数据隐私、喜欢折腾的开发者。⑤ OpenClaw「龙虾」——「个人 Agent 的调度中心」MIT 开源2025 年发布定位为AI Agent 执行网关 / 多渠道消息路由器接入 50 消息平台把各种模型与能力「调度」起来。Harness 特征MEMORY.md 记忆约定、沙盒隔离执行、内置 Cron 定时任务、庞大插件生态。2026 年初成为开源史上增速最快的项目之一催生了「养龙虾」式的个人 Agent 文化。适合谁想要一个「常驻的、跨平台的个人 AI 管家」的用户。⑥ Hermes Agent「爱马仕」——「自进化路线旗手」Nous Research 于 2026-02 开源主打越用越聪明Skills 自动创建对比 OpenClaw 的手动创建跨会话记忆FTS5 全文索引 LLM 提炼RL 轨迹导出——把 Agent 运行轨迹变成训练数据形成「使用 → 进化」闭环6 种执行环境、内置 Cron、支持任意模型。开源不到 2 个月 Star 破 5.1 万、贡献者 300迭代至 v0.8.0。与 OpenClaw 的本质差异OpenClaw 是「管理 AI 资源的调度中心」Hermes 是「会自主学习的 AI 员工」。适合谁关注 Agent 自我进化与 RL 数据飞轮的研究型用户。4.3 IDE 内嵌 Harness⑦ Cursor——「IDE 里的 Harness」把 Agent Harness 直接嵌进编辑器上下文采集与 IDE 状态深度耦合实时辅助体验最顺滑。短板离开 IDE 的长程自主任务能力弱于终端类 harness。适合谁以编辑器为第一现场的日常开发。⑧ Trae / Trae Work字节跳动Trae 是 AI IDETrae Work 是面向本地办公场景的 Agent。在「同一项目跑多 harness」的对照实验中Trae 的 Harness 差异主要体现在上下文组织与工具权限策略上。适合谁国内环境、追求开箱即用与中文生态的开发者。4.4 框架自建型 Harness给「造马具的人」⑨ Deep AgentsLangChain2026-01 随 LangChain 1.0 发布官方定位非常直白「不是框架是 harness」——一匹已经套好缰绳的马。逆向分析了 Claude Code / Deep Research / Manus 的共性固化三件套任务规划planning 虚拟文件系统长任务外存 子 Agent上下文隔离底层跑在 LangGraph 有状态运行时之上可接入 LangGraph Store 获得跨会话持久记忆。适合谁要在自家产品里嵌入「Claude Code 式能力」、又要完全可控的企业团队。⑩ Open SWELangChain 生态2026 年发布的开源框架源于一个重要观察Stripe、Ramp、Coinbase 三家独立开发内部 Coding Agent最终收敛到相同的五大架构模式。Open SWE 把这种收敛直接产品化是「Harness 解剖学」的第一个大规模生产验证。⑪ 厂商 SDK 矩阵OpenAI Agents SDK、Google ADK、Microsoft Agent Framework、CrewAI、Mastra、LlamaIndex Workflows这些属于「给你积木自己拼」的 DSL / Runtime 层与 Deep Agents、DeepSeek Harness 这类「成品 harness」构成上下游关系。选型原则简单任务用 SDK 直连长程自治任务用成品 harness 或在其上做二次封装。4.5 通用任务型 Harness⑫ Manus通用长程任务 Agent调研、PPT、网站生成等至顶评测总分 86.4、仅次于 Codex。其创始人 Peak Ji 的上下文工程实践KV-cache 优先、todo.md 外存、文件系统当记忆被 Google DeepMind 工程师 Philipp Schmid 专文总结已成为 Harness 设计的经典案例。⑬ WorkBuddy / ⑭ Kimi Work国产本地办公 Agent 代表另有 Trae Work主打「把 Agent 装进自己的电脑」在国内网络与工作流环境下可用性最好。DeepSeek Harness 的「Agent 预设」能力正是对标这类现成工具的个性化方向。五、焦点深潜DeepSeek Harness v0.1 逐层拆解发布时间2026-08-13 晚间 版本v0.1 开发者预览版 协议MIT 仓库deepseek-ai/deepseek-harnessCLI 名dsh这是昨天刚发布、也是本文时效性最强的部分。DeepSeek Harness 是 DeepSeek 的首款 Agent 产品由 2026 年 3 月成立、崔添翼负责的 Harness 团队打造从招募内测到开源发布仅用约两周。5.1 设计哲学一切皆插件DeepSeek Harness 基于Cordis 插件元框架构建。Cordis 负责插件的加载、卸载与依赖管理Agent Harness 中的一切能力都是插件模型 / 工具 / 技能(Skill) / 会话 / 沙箱 / 存储 / 循环 / 调度 / UI └────────────── 全部是可独立加载、卸载、替换的 Cordis 插件 ──────────────┘插件之间通过服务与事件协作在配置层自由组合——开发者不改源码即可替换、扩展任一能力。这把 Agent 构建从「黑盒」变成了「可组装」企业可以无缝私有化部署也天然支持换用 OpenAI、Anthropic 等第三方模型框架先行不绑定特定模型。5.2 四种运行模式一套底座四种人格四种模式本质是预设的插件集合快照共享同一 Cordis 底座实现「一次开发、多态运行」模式加载策略适用场景标准模式完整工具组合文件编辑、Shell、联网检索、Skill 调用、多 Agent 编排日常全功能开发从零构建项目PTC 模式Programmatic Tool Calling模型生成 TypeScript 程序来组合多轮工具调用需要确定性、精细化控制工具链的场景兼顾效率与可解释性极简模式仅持久 bash str_replace_editor双工具轻量任务更是基准测试的「纯模型能力」对照组创造模式支持内存内调试、自定义 Agent preset 生成打造专属 Agent写代码、写作等预设孵化新模式极简模式的存在尤其体现「懂行」它给评测社区提供了一个标准化的低干预环境用来度量模型本身的 Agent 能力剥离 harness 加成——这正是 Harness 综述论文强调的「控制变量」思路。5.3 事件流一切有迹可循DeepSeek Harness 把「可追溯」做成了第一公民模型看到的一切都写入仅追加append-only会话日志Trajectory 视图按来源查看每条信息恢复、分叉、检索、回放共享同一份事件流——调试一个失败任务可以像 git 一样 fork 出多个分支重新尝试。5.4 能力清单与快速上手官方能力面项目管理、长任务执行、多 Agent 协同、Skill 集成、联网搜索、上下文管理。上手门槛压到极低——npx一行命令即可拉起 Web UI完整部署则克隆deepseek-ai/deepseek-harness仓库在配置层选择模式与插件组合即可。5.5 冷静评价优势①头部模型厂商背书 MIT 协议是「可组装 harness」路线的第一个大厂开源样本②PTC 与事件流回放的设计在工程先进性上对标甚至局部超越了闭源竞品③与同日上线的 V4 Pro / 登顶调用榜的 V4-Flash 形成「模型 Harness」闭环。风险提示官方明确 v0.1 为早期预览版「核心插件与基础接口将持续快速迭代」——意味着 API 尚不稳定生产引入需锁定版本、做好跟进升级的准备。六、横向对比与选型矩阵6.1 核心维度对比截至 2026-08-14维度Claude CodeCodexDeepSeek Harness v0.1OpenCodeOpenClawHermes AgentDeep Agents开源/协议闭源闭源MIT开源MIT开源开源模型绑定Claude 系GPT 系不绑定框架先行多模型多模型任意模型多模型扩展机制Skill/hooks/子代理声明式提示词协议层全插件化Cordis配置插件插件生态自进化 Skills规划文件系统子Agent记忆/可追溯三层压缩CLAUDE.md线程持久化append-only 日志分叉回放会话管理MEMORY.mdFTS5LLM、RL 轨迹导出LangGraph Store多 Agent子代理/Agent Teams云端并行多 Agent 编排插件子代理网关调度支持原生支持私有化部署受限受限原生支持原生支持原生支持原生支持原生支持成熟度高高预览版快速迭代高高中快速迭代中高6.2 场景选型速查你的场景首选备选10 万行级代码库深度重构Claude CodeCodex云端异步批量任务、零手写代码流水线CodexClaude Code后台任务私有化部署 / 必须可审计可组装 / 国产合规DeepSeek HarnessOpenCode多模型自由切换、隐私敏感OpenCodeHermes Agent跨平台个人 AI 管家OpenClawKimi Work / WorkBuddy研究型自进化与 RL 数据回流Hermes Agent—把 harness 嵌入自家产品Deep Agents / Open SWEDeepSeek Harness 插件化二开IDE 重度用户、实时协作CursorTrae非代码长程任务调研/文档/网站ManusTrae Work七、趋势研判关于 Harness 的七个判断竞争焦点已经换挡。模型跑分的边际收益在递减「Model Harness」的协同落地能力成为新赛点——DeepSeek 资深研究员陈德里在 V4 Pro 发布日的表述也印证了这一点。开源可组装路线将倒逼闭源阵营。DeepSeek Harness 用 MIT 全插件化把「黑盒 harness」变成公共基础设施类似当年 DeepSeek 对模型价格的冲击。Harness 正在云原生化。OpenAI 高管已明言本地 harness「再火俩月」就是原始工具线程持久化、协议层、远程执行将成为标配。事件流与可回放成为分水岭。append-only 轨迹、分叉、回放从调试特性升级为 harness 的核心架构DeepSeek Harness、Codex App Server 殊途同归。PTC程序化工具调用会普及。用代码而非逐次 JSON 调用编排工具是确定性、效率与可解释性的三重优化预计半年内被主流 harness 跟进。「Harness 工程师」岗位化。从 Mitchell Hashimoto 命名该角色到 883 实体、1590 条关系的 Harness 知识图谱出现这已是一门有方法论、有综述论文、有产业报告的正式学科。评测将被 harness 重塑。极简模式这类「纯模型对照环境」会催生新的基准范式先量模型裸能力再量 harness 加成二者分开报价。八、FAQ高频问题速答Q1Agent Harness 和 Agent 框架如 LangChain是一回事吗A不是。框架给你积木让你自己拼harness 是已经套好缰绳的完整运行系统。二者是上下游关系——例如 Deep Agents 就是「用 LangGraph 运行时实现的成品 harness」。Q2DeepSeek Harness 和 Claude Code 谁更强A截至发布日2026-08-14无法直接对比前者是 v0.1 预览版后者是经过一年打磨的闭源成熟产品。DeepSeek Harness 的差异化在于开源、可组装、不绑定模型能力上限需等正式版与第三方基准验证。内测用户的「宇宙最强」评价仅供参考。Q3Harness Engineering 和 Context Engineering 是什么关系A包含关系Prompt ⊂ Context ⊂ Harness。上下文工程管「喂什么」Harness 工程还包括工具与环境、编排、验证、治理是给模型搭出完整工作环境。Q4个人开发者现在该上车哪一款A编码为主选 Claude Code 或 Codex想折腾、重隐私选 OpenCode想要全能个人助理选 OpenClaw想体验最新的可组装范式npx一行命令试试 DeepSeek Harness。Q5「evaluation harness」如 lm-evaluation-harness也是这个概念吗A不是。那是模型评测执行框架属于另一个领域但二者正在交汇——如 DeepSeek Harness 的极简模式就是为基准评测设计的。九、参考资料DeepSeek Harness 团队《DeepSeek Harness 开发者预览版发布一切皆插件》2026-08-13腾讯网/每日经济新闻/PingWest 品玩同日报道OpenAI《Harness engineering: leveraging Codex in an agent-first world》2026-02-11InfoQ 中文报道2026-02-27Anthropic《Effective harnesses for long-running agents》2025-11中金研究《Agent Harness模型之外、智能之内》2026-06-04智源社区《全网最详细 Agent Harness 综述》CMU/耶鲁/杜兰/亚马逊联合论文解读2026-06-02智东西《120 万星开发者排队投简历DeepSeek 一条内测帖变成了 Agent 开源大摸底》2026-08-04界面新闻《黄仁勋押注DeepSeek 内测详解 Harness 到底是什么》2026-08-0336kr《OpenAI 高管Codex 这样的 Harness也就再火俩月》2026-08-09SegmentFault 思否《Hermes、Codex、Claude Code、OpenClaw 深度对比四大终端 AI Agent 完整选型指南》2026-05-11稀土掘金《2026 终端 AI 编码 Agent 六大工具深度横评》2026-05-14今日头条至顶 AI 实验室《Codex、Manus、Claude Code、OpenClaw 谁才是最强的 Agent》2026-06-25博客园《DeepSeek Harness 2026一切皆插件 — 开发者预览版完全指南》2026-08-13腾讯云开发者社区《Agent Model Harness模型决定上限Harness 决定下限》2026-05-20中国计算机学会CCF《驾驭工程崛起大模型智能体 Harness 技术体系与前沿进展》2026-04结语如果说 2025 年的问题是「哪个模型更聪明」那么 2026 年的问题已经变成「谁给模型配了更好的办公室」。DeepSeek Harness 昨天以 MIT 协议把整间「办公室」的图纸开源了出来——无论它最终能否成为事实标准「Model Harness」的公式都已经写进了这个时代的工程基因里。下一步轮到你了选好你的马具或者亲手打造一副。本文事实性信息均基于截至 2026-08-14 的公开报道与官方发布评测分数为对应来源在各自测试条件下的结果不构成绝对排名。欢迎在评论区聊聊你现在的主力 Harness 是哪一款。
返回列表