尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Hierarchical Evaluation of Software Design Capabilities of Large Language Models of Code

Hierarchical Evaluation of Software Design Capabilities of Large Language Models of Code 文章核心总结与翻译一、主要内容本文针对代码大语言模型(LLMs)对软件设计核心概念的掌握能力展开实证研究,聚焦内聚性(模块内部元素关联性)和耦合性(模块间依赖程度)两大基础设计原则,通过系统化实验评估DeepSeek-R1系列模型(14B、32B、70B)的表现。实验设计:基于布鲁姆分类法设计三层任务梯度(认知负荷递增):验证任务(确认预设断言)、引导生成任务(基于部分上下文补全)、开放式生成任务(仅提供原始代码自主发现设计问题)。引入可控噪声(干扰元素注入)模拟真实开发环境,量化模型在不同噪声水平下的鲁棒性。通过程序化代码转换生成具有明确内聚/耦合缺陷的测试样本,避免数据污染。核心发现:理想条件下,模型对两种概念均具备扎实的基础认知(70B模型内聚性F1=0.825,耦合性平均F1=0.899)。实用性知识存在显著不对称性:耦合性推理极易受噪声影响,开放式场景下F1分数降幅超50%;内聚性在引导任务中对内部噪声表现出强鲁棒性,但失去引导后性能崩溃。模型性能随引导减少、认知负荷增加而显著下降,且模型规模与性能正相关(70B模型整体表现最优)。推理轨迹分析揭示:耦合性任务中模型存在"认知捷径"(噪声下缩短分析范围),内聚性任务中
返回列表