尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Synthetic Cognitive Walkthrough: Aligning Large Language Model Performance with Human Cognitive W...

Synthetic Cognitive Walkthrough: Aligning Large Language Model Performance with Human Cognitive W... 文章总结与翻译一、主要内容本文聚焦于利用大型语言模型(LLMs)自动化认知走查(CW)这一可用性测试方法,核心探索LLMs能否模拟人类在CW中的行为,以降低传统测试的成本和资源消耗。研究设计双角色LLM代理架构:设计了 facilitator(引导者)和 evaluator(评估者)两个AI代理,分别模拟CW中的研究人员引导角色和用户评估角色,通过迭代优化的提示词实现界面导航、思维外显和流程推进。两项对比研究:研究1:对比GPT-4、Gemini-2.5-pro与10名人类评估者在两款移动应用(语言学习类、旅行预订类)上的CW表现,从任务完成率、导航路径一致性、潜在失败点识别三个维度展开分析。研究2:探索通过额外提示词优化LLM对人类潜在失败点的预测能力,对比“有上下文”(LLM完整走查流程)和“无上下文”(仅单屏独立评估)两种模式的效果。核心发现LLM与人类的行为差异:LLM的任务完成率更高(GPT-4达100%,Gemini-2.5-pro达97.2%,人类为88.2%),导航路径更接近最优路径,步骤更少;人类评估者在不确定下一步时更倾向于广度优先搜索(探索性行为),且易受记忆误差影响;LLM则更理性,优先选择最可能的
返回列表