
Claude Code 是 Anthropic 推出的命令行 AI 编码代理它能读取项目文件、执行命令、修改代码、运行测试把一个多步骤开发任务拆成连续的工具调用来完成。正因为它具备“离开对话框干活”的能力一个关键问题就越来越绕不开在完成真实开发任务时开发者到底要付出多少交互成本才能保证最终结果既正确又可维护。最近社区里讨论较多的一个信息点是Anthropic 正在对 Claude Code 中的工作量降低程度进行 A/B 测试。这背后的工程含义是同样一个任务在不同思考预算、不同权限模式、不同人工介入强度下开发者承受的负担会有明显差异而这类差异应当用对照实验来验证而不是靠演示视频或单次体验来下结论。这类测试不只在 Anthropic 内部有价值。普通团队引入 Claude Code 时同样需要先做一组可重复的对照实验再决定默认配置、权限模式和协作流程。否则很容易出现“几个人用得很好另一批人用不起来”的割裂局面。问题往往不是模型能力不够而是没有找到适合自己团队的参数组合。接下来的内容从工程实操角度出发拆解如何设计并完成一套可复现的 Claude Code A/B 测试先明确概念再准备环境然后跑实验、采数据、排查故障最后把经验沉淀成日常开发流程。1. 先厘清Claude Code 中的“工作量”到底指什么1.1 “工作量降低”不指代码行数而是交互和决策成本要对“工作量降低程度”做 A/B 测试得先定义这里的工作量指什么。程序员完成需求时付出的成本远不止“写代码”这一步。常见构成包括阅读需求、拆解任务并翻译给 AI审查 AI 生成的代码判断逻辑是否合理反复补充提示、纠正方向、回滚错误改动修测试、查日志、处理构建失败在多个候选方案之间做决策并验证边界条件。如果用代码行数来衡量往往会出现“代码量没减少甚至增多”的结果但这并不代表工作量没有降低。真正能通过编码代理改变的是交互成本和决策成本同样的功能原本需要人工写多个文件、做多次判断现在可能只需要给几条清晰提示再对 AI 的产出做一轮审查。具体到 Claude Code 场景可以把工作量拆成四类可观测成本成本类型说明为什么影响 A/B 测试等待成本模型从开始到完成任务的绝对耗时高思考预算会导致更长的等待需要和收益一起评估确认成本开发者对命令执行、文件修改、权限申请进行确认的次数权限模式不同人工介入次数差异非常明显修正成本提示补充、修改意见、回滚操作的轮数模型思考得越充分修正轮数通常越低但不绝对验收成本人工阅读 diff、跑测试、检查边界的时长最主观也最容易被宏观指标掩盖这四类成本就是 A/B 测试里可以量化的因变量。比如 A 组使用较高思考预算和较宽的自主权限B 组使用默认配置最终比较的不是“谁的代码跑得更快”而是“谁在完成一次可验收结果的过程中需要更少的人工介入、更少的往返修改、更短的有效验收时间”。1.2 A/B 测试的价值把随机波动和真实提升分开AI 编码工具和传统编译器最大的区别是输出存在随机性。同一个模型、同一个提示、同一个任务连续跑五次结果大概率不同。差异可能来自采样温度、模型版本变化、上下文窗口里的历史对话、工具调用中断点恢复方式也可能来自