尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Can LLMs Generate User Stories and Assess Their Quality?

Can LLMs Generate User Stories and Assess Their Quality? 文章主要内容总结本文研究了大型语言模型(LLMs)在敏捷开发框架中自动生成用户故事(User Stories, US)以及评估其语义质量的能力。具体内容如下:研究背景:需求获取是需求工程中极具挑战性的环节,而高质量需求对软件开发至关重要。现有自动化工具多关注需求的句法质量,语义质量(如语言清晰度、内部一致性)的评估仍依赖人工,耗时且低效。LLMs在自然语言处理任务中表现优异,有望自动化需求工程相关活动。研究方法:使用10个最先进的LLMs,模拟基于访谈的需求获取过程(复制Ferrari等人的实验),生成13958条用户故事,并与人类(领域专家和学生)生成的用户故事对比。从覆盖率(与基准用户故事的语义重叠)、多样性(生成内容的差异度)、可检测性(是否易被识别为AI生成)三个维度评估LLMs生成用户故事的质量。基于Quality User Story(QUS)框架,让LLMs在不同指导条件(无手册、部分手册、完整手册)下评估用户故事的语义质量,并与人工标注结果对比。主要结果:LLMs生成的用户故事在覆盖率和风格质量上与人类相似,但多样性和创造力较低,满足验收标准的频率更低(与模型规模无关)。当提供清晰的评估标准(完整手册)时,LLMs(尤其是Claude 3 Opus)能可靠评估用户故事的语义质量,可减少大规模评估中的人工工作量。
返回列表