本文整理自 QCon 北京 2026 张亦驰分享《小红书GUI Agent在智能化测试中的工程落地实践》通过AI音视频总结工具Ai好记进行语音转文字整理以下为整理总结后的内容。测试自动化到底提效没有张亦驰在小红书负责 GY 和 AI Coding 方向分享开头就抛了一个很真实的问题测试自动化到底提效没有对外汇报通常都是正面的——省了多少人力、提升了多少测试覆盖率。但实际呢可能只是把「人工维护用例」变成了「人工维护脚本」。紧急情况还是要人工介入。他用一个案例说明问题传统自动化找到了 80 个 bug但最后还是要人工兜底没能彻底释放人力。理想的测试 Agent 应该是什么样人尽量少参与能独自长时间运行。给个意图AI 自己去探索执行。传统测试自动化的三个硬伤小红书的团队总结了三方面的问题一是用例维护难。XPath 复杂度高而且是静态的很容易被页面改动破坏。自然语言用例的结构虽然更稳定但写起来仍然耗时。二是多端多机型适配复杂。Android、iOS、鸿蒙三端再加上不同机型代码里要写大量兼容逻辑。一个资深测试才能搞定。三是断言能力弱。传统断言只能识别简单的文本「有还是没有」产品换个文案就识别失败了。无法做视觉层面的校验比如颜色、布局、元素缺失。测试自动化的三个阶段演进小红书测试自动化的演进分为三个阶段第一阶段传统自动化。XPath 定位 脚本维护。覆盖率高但人力节省有限编写和维护成本都很高。第二阶段自然语言用例。用自然语言描述测试意图结构更稳定编写成本降低。但执行引擎需要足够智能才能把自然语言翻译成可执行步骤。第三阶段GUI Agent 智能化测试。这是小红书目前重点落地的方向。人只需要给出测试意图Agent 自主理解页面、规划步骤、执行操作、验证结果。核心解题思路执行引擎 知识补充小红书的方案分为两大模块。执行引擎是核心要解决 Agent 怎么理解页面和怎么操作页面。纯视觉的方案截图 多模态大模型来理解当前页面的状态不需要依赖 DOM 树或 XPath。具体执行流程上张亦驰参考了 AI Coding 的思路。做过 AI Coding 的人对这套逻辑应该很熟悉——就像 AI 理解代码库一样Agent 理解 App 界面然后自主规划操作路径。减少幻觉和知识补充是第二个关键模块。纯视觉方案的问题是大模型对某些场景没有足够的知识储备。所以小红书建设了企业级知识库把业务场景、操作链路、常见异常都沉淀进去。Agent 在执行过程中先查知识库再结合视觉理解来做决策。开源方案参考小红书在落地过程中参考了几个开源工程。张亦驰重点推荐了智谱 AI 开源的 AppAgent他认为这是一套轻量化的方案纯视觉识别与执行单步执行时间在 10 秒以内。适合作为企业二次开发的起点。其他方案各有优劣。阿里的开源方案是多 Agent 模式视觉校验和自愈方面有借鉴价值。最早一批开源的工具依赖 DOM 树和 XPath 做定位在复杂场景下容易误识别。谈两个容易被忽视的问题张亦驰在分享里特别提到了两点我觉得挺有启发的。一个是用例的「思考时间」不能被节省。测试人员花 50% 的精力在执行测试用例另外 50% 在写测试规划15%、跨岗位沟通15%、写用例25%。AI 能帮你省掉执行和写用例的时间但思考测试规划的时间不能省。这其实说明了测试人员的核心价值在哪——不是写脚本而是设计测试方案。另一个是从 AI Coding 视角看 GUI Agent。他之前在 AI Coding 方向的积累直接迁移到了 GUI Agent 的落地中。两个领域的核心挑战是相通的怎么让 AI 理解复杂环境、怎么保证执行的可靠性、怎么处理边界情况。这给团队降低了不少学习成本。后续展望张亦驰在展望部分提到几个方向执行引擎从纯视觉方案向多模态融合演进知识库从人工维护向自动沉淀进化单端执行向多端协同安卓iOS鸿蒙同时跑推进整个测试领域的 AI 化还在早期。把「人工维护脚本」换成「调试 AI 决策」确实提升了效率但距离「人只给意图」的理想状态还有一段路要走。以上内容由Ai好记转录整理。Ai好记 是一款支持音视频转图文笔记的视频总结工具支持音视频的转录、翻译、总结。可以将B站、抖音、小红书、小宇宙等平台链接及本地/网盘的音视频文件解析成笔记语音转文字后自动生成精华速览、思维导图和结构化笔记帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。