尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

ChatGPT、Codex趋势:多Agent真正的瓶颈,为什么正在从模型能力转向人类注意力?

ChatGPT、Codex趋势:多Agent真正的瓶颈,为什么正在从模型能力转向人类注意力? 过去讨论AI Agent大家最关心的通常是模型还能不能更强Codex一次能跑多久能不能同时开更多Agent一个工程师能不能同时让5个、10个甚至更多Agent工作从表面看多Agent时代最重要的资源似乎应该是模型能力、Token、算力和并发。但当Agent真正进入工程工作流以后一个非常反直觉的问题开始出现Agent越多人反而越忙。Agent A正在修Bug。Agent B等待Approval。Agent C测试失败。Agent D已经完成需要Review。Agent E发现新的问题希望扩大修改范围。如果每一个Agent都需要人不断查看现在做到哪里 为什么失败 要不要继续 这个Diff能不能接受 要不要批准这个动作那么即使Agent执行速度提高10倍人类最终仍然可能成为整个系统最慢的一层。OpenAI在2026年公开Symphony时就披露了一个非常有代表性的观察工程师通常可以比较舒服地同时管理3—5个Codex Session再往上频繁的上下文切换就开始明显影响效率。团队最终发现真正的系统瓶颈已经变成了human attention——人类注意力。这可能是多Agent时代比“模型又提升多少”更值得关注的变化。一、单Agent时代人类注意力几乎不是问题只有一个Agent时工作模型非常简单Human ↓ Agent ↓ Result人可以一直跟着它。Agent运行命令。你看一眼。测试失败。你继续指导。修改完成。你检查Diff。这种模式虽然需要人工参与但注意力只有一个方向。可以理解为Human Attention 1 Task所以Agent再复杂人仍然容易保持上下文。但多Agent以后完全不同。假设同时运行5个任务Agent A Auth Refactor Agent B Payment Bug Agent C Test Expansion Agent D Dependency Upgrade Agent E PR Review每个Agent都有独立的目标执行状态历史决策代码变化失败原因。此时人类需要维护的不再是一个Context。而是5个不断变化的Context。真正昂贵的动作开始从写代码变成重新进入某个任务的状态。二、多Agent最昂贵的操作可能是“重新理解发生了什么”假设Agent A运行了30分钟。你去处理Agent B。十分钟以后回来。Agent A告诉你已修改认证逻辑但Refresh Token测试仍然失败我认为可能需要调整Cookie策略。这句话看起来很简单。但为了做出正确判断你必须重新恢复很多信息最初目标是什么Agent已经改过哪些地方为什么选择这个方案之前排除了什么当前测试失败是不是原有问题修改Cookie会不会超出任务范围这就是Context Reconstruction Cost。Agent处理任务时它一直在任务上下文里。人却不断在多个任务之间切换。于是出现一个有意思的反转Agent拥有连续上下文人类反而拥有碎片化上下文。当Agent数量增加以后这种重建成本会越来越明显。OpenAI在Symphony实践中描述的正是这种现象工程师需要不断在多个Session之间切换、查看输出、重新引导卡住的Agent最终生产率反而开始下降。三、所以“同时运行更多Agent”不是一个完整的效率指标很多Agent产品喜欢展示1 Agent ↓ 5 Agents ↓ 10 Agents看起来并发越高越好。但真正的生产率应该更接近Agent Throughput - Human Coordination Cost假设一个工程师以前一天完成5个任务。现在10个Agent理论上能够完成50个任务。但如果这50个任务产生20次Approval15个失败30个Diff等待Review8个任务需要方向判断那么人类未必有能力真正消费这些结果。这时候系统会出现一种新的排队过去是Tasks ↓ 等待开发者实现未来可能变成Agent Results ↓ 等待人类Review瓶颈只是从Implementation Queue移动到了Attention Queue。OpenAI在Harness Engineering的实践中也明确把“human time and attention”称为真正稀缺的资源随着Agent代码吞吐量增加他们随后遇到的瓶颈之一就是人类QA能力。四、这意味着未来不能让人“监督每一个Agent”如果多Agent系统的设计逻辑仍然是Agent执行一步 ↓ 人检查一步 ↓ Agent继续 ↓ 人再次检查那么Agent数量永远无法真正扩张。因为10 Agents 10份监督工作最终人只是从写代码的人变成盯AI写代码的人。这其实没有真正解决规模问题。所以真正可扩展的Agent系统必须发生一个变化从Continuous Supervision转向Exception-Based Supervision。正常任务Agent ↓ Execute ↓ Verify ↓ Complete不需要人持续介入。只有异常情况才进入Agent ↓ Cannot Resolve ↓ Escalation ↓ Human人类注意力就从监控全部工作转变成处理系统自己无法决定的少数问题。这也是为什么上一层的Control Plane会越来越重要。Control Plane真正节省的不是Agent时间。而是Human Attention。五、未来好的Agent系统应该主动“压缩”给人的信息今天很多Agent完成任务后会输出非常长的过程记录读取了什么文件运行了什么命令失败过几次修改了什么代码为什么做这些事情。这些信息对于Audit非常重要。但如果每个Agent都把完整过程直接交给人10个Agent一天可能产生几万行日志。人根本无法消费。所以未来系统需要同时存在两层信息。第一层Machine Evidence。保存完整Logs Terminal Diff Test Decision History用于追踪审计回滚。第二层Human Summary。只告诉人Goal Status Risk Evidence Decision Needed例如Task 修复支付接口超时。 Status 已完成。 Evidence 12项相关测试通过。 Build成功。 Risk 未验证生产环境第三方支付服务。 Human Action Review 3个核心Diff。这比让人阅读一整段Agent聊天记录有效得多。真正好的Agent系统应该做的是把大量机器行为压缩成少量高价值的人类决策点。六、Review本身也必须从“看所有代码”转向“看高风险变化”Agent吞吐量越来越高以后另一个问题会出现人还能不能Review所有代码OpenAI的Agent-first工程实践已经遇到类似情况。随着Codex生成代码的速度提高团队逐渐把大量Review工作转向Agent-to-Agent Review人类并不一定需要查看每一个Pull Request他们的目标就是把有限的人类判断力投入到更高价值的位置。这意味着未来Review也可能分层。Low Risk例如文档小范围测试机械性重构。可以Agent Review Automated Test直接完成。Medium Risk例如业务逻辑修改。可能Agent Review Test Human Spot CheckHigh Risk例如认证支付权限数据库生产基础设施。必须Human Review这里真正发生的是Review Attention Allocation。不是所有代码都值得获得同等的人类注意力。七、未来高级工程师的核心能力可能变成“注意力分配”过去高级工程师最大的价值之一是知道应该怎么写。Agent越来越强以后这种价值不会消失。但会增加一个新的能力知道什么值得自己亲自看。例如同时有20个Agent结果。工程师需要判断哪个只是普通测试补充哪个修改了认证边界哪个涉及架构变化哪个失败3次以后仍然没有收敛哪个Agent虽然测试通过但Diff范围异常人类真正的工作开始像一个Attention Scheduler。把有限时间分配到High Risk High Ambiguity High Impact Irreversible Action Architecture Decision而不是平均分配给所有任务。这也是为什么Agent时代的人类价值可能越来越集中在判断力。八、人类注意力为什么比算力更难扩展算力有一个非常好的特点可以横向扩展。任务多了增加机器。Agent多了增加并发。但人类注意力不一样。一个工程师无法CPU × 10也无法真正同时深入思考十个复杂工程问题。所以Agent系统存在一个天然的不对称Agent Capacity 可以快速扩张 Human Attention 扩张非常慢当模型能力持续提高以后这个差距只会越来越大。OpenAI的Codex产品也已经明显按照这种变化设计官方把Codex in ChatGPT描述为Agentic Coding的“command center”支持多个Agent跨项目并行执行而Codex App从一开始就是为了让开发者能够同时管理多个Agent、独立线程和Worktree。也就是说Agent已经开始规模化。现在的问题变成人的注意力怎么不被规模化Agent拖垮九、所以未来Agent系统需要一个“Attention Architecture”过去软件系统设计常讨论Compute Architecture。Data Architecture。Network Architecture。多Agent时代可能还需要一个新的概念Attention Architecture。它解决什么情况下需要人可以简单拆成四层。第一层Auto Execute低风险、高确定性。Agent直接执行第二层Auto Verify执行完成后Agent ↓ Tests ↓ Policy ↓ 完成不需要人。第三层Human Review存在较高风险Agent ↓ Evidence ↓ Human Review第四层Human Decision涉及架构安全不可逆行为需求歧义。Stop ↓ Human Decision ↓ Resume最终形成Automation ↓ Verification ↓ Exception Detection ↓ Attention Routing ↓ Human Decision这里最重要的已经不是多少Agent在运行。而是每天有多少事情真正需要打断人。十、一个成熟Agent系统的指标可能是“中断人类多少次”过去评价开发工具响应速度准确率代码通过率。未来企业可能还需要一个非常有意思的指标Human Interruptions per Task。例如系统A完成100个任务。需要人工介入80次。系统B完成100个任务。只需要介入12次。即使两个系统最终成功率相同B的可扩展性也会完全不同。类似的还有Human Review Minutes / Task Escalation Rate Auto-Recovery Rate Evidence Quality Decision Density这些指标真正衡量的是Agent到底释放了多少人类注意力而不是Agent自己工作了多久。十一、真正值得追求的不是“Human Out of the Loop”这里还容易走向另一个极端。既然人类注意力是瓶颈是不是应该彻底把人拿掉不一定。真正合理的方向不是Human Out of the Loop。而是Human at the Right Loop。例如让Agent决定怎么修一个普通测试。没有问题。但让Agent自己决定是否改变公司核心权限架构就完全是另一回事。所以目标不是所有事情都自动化。而是把人放到最有价值的决策位置。OpenAI在Harness Engineering总结中也明确表示他们仍在探索“哪些地方最值得加入人类判断以及怎样把这些判断编码进系统让价值持续累积”。这可能才是多Agent工程真正成熟的方向。十二、Agent越强人类工作的粒度反而会越来越高过去工程师操作Line Function File后来操作Feature Bug PRAgent继续增强以后人可能越来越多地操作Goal Policy Architecture Priority Exception也就是说人的工作单位正在逐渐变大。从How转向What / Why / Whether。Agent负责怎么完成。人类负责做什么、为什么做、结果能不能接受。这也是为什么OpenAI在Agent-first工程实践里把工作方式总结为Humans steer. Agents execute.这句话真正重要的地方不在“Agent执行”。而在Human Steer。十三、从多Agent到“组织级Agent系统”如果把前面两篇放在一起会出现一个很清晰的演化过程第一阶段Human ↓ Single Agent第二阶段Human ↓ Multiple Agents很快出现Attention Bottleneck。于是需要Human ↓ Control Plane ↓ Multiple Agents再往后Control Plane负责普通调度和异常检测。人只接受Decision Queue最终变成Human Decision Layer ↓ Attention Router ↓ Control Plane ↓ Agent Runtime ↓ Agents这时候才真正接近组织级Agent系统。因为人不再直接管理每一个Worker。系统开始替人管理Worker。十四、未来团队真正稀缺的可能不是Agent而是高质量判断Agent可以复制。Prompt可以复制。模型调用可以扩容。但真正难复制的是一个资深工程师看到一个Diff以后能够判断这个架构会不会半年以后失控这个权限是不是开得过大这个测试虽然通过但是否验证了真正需求这个Agent是不是解决了症状却没有解决Root Cause这些判断本质上都是Compressed Experience。所以AI Agent越强人的价值可能越集中到Architecture Judgment Risk Priority Taste这也是为什么Agent并不一定让资深工程能力变得不重要。反而可能让高质量判断的杠杆变得更大。最后多Agent时代最容易产生的误解之一就是Agent数量越多生产率越高。真正的关系更可能是Productivity Agent Throughput × System Coordination ÷ Human Attention CostAgent Throughput持续上升以后真正决定系统能否继续扩张的会越来越是人类注意力能不能被保护起来。所以未来最成熟的Agent系统不应该让人同时盯着20个Agent。而应该让20个Agent自己运行验证恢复汇总筛选异常。最后只把真正需要判断的3个问题交给人。从这个角度看Control Plane真正的价值并不是管理更多Agent。而是让更多Agent运行时不需要同比增加人类注意力。这可能才是多Agent时代真正的规模效应。未来高级工程师的工作也可能越来越不像同时操控更多AI。而更像设计一个系统让AI自己工作只在真正需要人类判断的时候打断我。当这一点实现以后AI Agent才真正从个人效率工具走向可扩展的组织执行系统。
返回列表