
系列导语本系列基于 Anthropic《The AI-Native SDLC Playbook》改写保留 Claude Code / Claude Tag / MCP 等原品牌名。第 4 篇讲了 Build 和护栏这篇进第四阶段Test怎么在把代码交给你之前让 agent 先给自己验工。《The AI-Native SDLC Playbook》相关文章链接https://blog.csdn.net/justlookxia/article/details/164093318你交给人的代码agent 自己验过吗传统测试是在阶段边界摆一个 QA 门实现完了才测。AI-native 反过来每个会话在把成果交给你之前先自己验一遍把什么算对固化成能反复跑的回归测试。a) 反馈回路告诉 agent 怎么验工你给 Claude 一套验证工作的方式——测试、构建、截图 diff。规则很简单遇到 bug先写一份会失败的测试并提交再去修红→绿UI 改动用浏览器或 MCP 截图跟 mock 比对而不是凭感觉。把验证方式写进CLAUDE.md的验证块agent 每次完工前都会自己跑一遍## Verifying your work - Build: make build (must finish with Build succeeded) - Test: make test (all green; never skip or delete a failing test) - Lint: make lint (zero warnings) Run all three before reporting any task complete, and paste the output. If a test fails, fix the code, not the test.关键点测试失败了“修代码别修测试”。这条纪律决定了 agent 产出的可信度。b) CI 里的持续 evals把正确行为变代码eval评测是把我们期望 agent 怎么做固化下来的套件。每当配置变动——模型、提示词、skills——就跑一遍 eval 套件线上出了事故就把事故转成一条 eval保证不再犯。举个在 CI 里跑 agent eval 的例子name:Agent evalson:pull_request:paths:[CLAUDE.md,.claude/**]schedule:-cron:0 2 * * *jobs:evals:runs-on:ubuntu-lateststeps:-uses:actions/checkoutv4-run:npm install-g anthropic-ai/claude-code-name:Run eval suiteenv:ANTHROPIC_API_KEY:${{secrets.ANTHROPIC_API_KEY}}run:|for eval in evals/*.json; do claude -p $(jq -r .prompt $eval) \ --allowedTools Read,Edit,Bash(make test) \ --output-format json result.json ./evals/check.sh $eval result.json done注意on.pull_request.paths——只要CLAUDE.md或.claude/**动了就触发 eval。等于给agent 的行为规范加了回归保护。这一篇记住两句话验收要前置到每个会话里而不是堆在阶段末尾。把什么算对写成 eval配置一动就跑事故直接转 eval。下篇预告第 6 篇Deploy人审不过来就让 agent 先审。看分层评审、hooks 批准门以及 CI/CD 里claude -p怎么当判步用。系列文快链【AI原生研发转型·第1篇】为什么你的AI写码很快团队却还是慢【AI原生研发转型·第2篇】想法不该等人写文档用intent.md把意图一次性钉死【AI原生研发转型·第3篇】需求与设计合体一次会话出spec.md【AI原生研发转型·第4篇】没有计划不写码机构知识变成文件【AI原生研发转型·第5篇】让agent自己先验收反馈回路持续evals【AI原生研发转型·第6篇】人审不过来让agent先审分层评审hooks批准门07-08待发布原文出处https://claude.com/blog/the-ai-native-sdlc-playbook Louis Claxton, 2026-08-21, Anthropic系列索引① 总论 · ② Plan · ③ Design · ④ Build · ⑤ Test本篇· ⑥ Deploy · ⑦ Maintain · ⑧ 番外本系列为外部技术博客的改写保留原品牌名仅供团队学习交流。