
1.研究问题与目标问题软件工程标准SES文本冗长、非结构化、含领域术语和高噪声难以自动构建本体Ontology而传统方法依赖人工或简单提示工程存在可重复性差、难以扩展、缺乏成熟工程流程等问题。目标提出一个完全自动化、基于开源LLM的AOG工作流程以SES为对象优先进行关系三元组提取RTE作为构建本体骨架的第一步并确保输出忠实于原文、具有可用性和最大覆盖率。2.方法论创新策略转向不同于主流“TBox优先”先定义类和分类体系的方法该研究采用“ABox实例断言驱动、ABox与TBox协同提取”的策略先提取实体-关系三元组后续再从中推导概念层次。工作流程设计文档分割→候选术语挖掘用spaCy提取名词短语和动词→LLM关系推理通过受约束的提示让Mistral-7B生成JSON格式三元组→术语归一化词形还原→跨章节对齐。引入动态令牌预算、JSON解析重试机制、低温度采样以保证输出格式稳定。开源优先全程使用Mistral-7B7B参数和BERT等开源模型避免成本与隐私问题。3.实验设计与评估数据选择采用《软件工程道德规范和职业实践》SECEPP的短版本278词和完整版本2653词短版本用于概念验证和基准构建。参考集构建由领域专家手工构建三种粒度的黄金标准参考集Ref-Short细粒度高召回率压力Ref-Medium中等粒度平衡Ref-Long粗粒度高精确率导向对比基线与斯坦福OpenIE传统开放信息抽取系统进行对比。评估指标采用嵌入相似度阈值扫描τ从0.1到0.9在节点级别和三元组级别计算精确率、召回率和F1值。4.主要实验结果Pred-LLM本方法表现精确率普遍高于OpenIE尤其在节点和三元组层面。召回率在Ref-Long上最高因边少易匹配在Ref-Short上最低验证了召回率压力假设。当τ 0.5时召回率与OpenIE差距缩小当τ ≈ 0.6时三元组结果趋于稳定可靠。结论一个7B的开源LLM已能在零样本设置下与OpenIE竞争尤其在精确率上占优证明该方法的可行性与潜力。5.当前局限与未来工作局限仅使用单个LLMMistral-7B缺乏跨模型、跨规模的比较。参考集由单一位标注者构建未报告标注者间一致性IAA。尚未处理跨句子共指、长文档扩展和完整本体转换。未来计划引入多位标注者构建公开基准并报告IAA。扩展到完整版SECEPP及其他SES文档。改进跨句子关系抽取进行小规模微调。完成后续本体转换阶段输出正式的OWL 2本体。6.总体贡献提出了首个面向SES的、完全基于开源LLM的零样本RTE自动化工作流程。设计了稳定的提示约束与解析机制有效应对LLM输出不稳定的问题。构建了三种粒度的专家标注参考集为该领域提供了可复用的评估资源。通过系统实验证明了轻量级开源LLM在本体生成任务中的竞争力和实用性为后续AOG研究提供了新思路和工程参考。论文设计了一套利用开源7B LLM自动从软件工程标准文本中提取实体-关系三元组的工程化流程在零样本设置下取得了优于或可比传统OpenIE系统的效果并为后续全自动本体生成奠定了坚实基础。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要——数十年来本体论一直支持知识表示和白盒推理因此自动本体生成AOG在扩展其应用方面发挥着关键作用。软件工程标准SES由冗长、非结构化的文本包含大量噪声和包含领域特定术语的段落组成。在此背景下关系三元组提取RTE与术语提取一起构成了实现AOG的第一阶段。本工作提出了一种基于开源大型语言模型LLM辅助的SES关系三元组提取方法。本研究不单纯依赖基于提示工程的方法而是提倡使用LLM作为构建本体的辅助工具并探索了一种有效的AOG工作流程该流程包括文档分割、候选术语挖掘、基于LLM的关系推理、术语归一化和跨章节对齐。我们构建了三个粒度级别的专家标注参考集并用于评估本研究生成的本体。结果表明该方法在三元组提取方面与OpenIE方法相比具有可比性甚至可能更优。索引词——大型语言模型本体论自动生成三元组提取软件工程标准。I. 引言自2007年以来自动本体学习就一直被讨论[1]但直到最近几年关于自动本体生成AOG的研究才出现[2]-[5]。传统上本体是手动创建的[6]或半自动地从文本[7]或从结构化/表格数据如关系数据库中创建[8]。自动本体生成的最新进展利用了深度学习方法[2],[3]。大型语言模型LLM最初是自然语言处理NLP中以文本为中心的工具现在已发展为处理多模态输入的通用模型[9],[10]因此被选为本AOG研究的主要辅助工具。显而易见LLM已能够帮助从文本生成本体[11]-[13]。当向LLM提供一段文本时可以指示其以指定的模式例如JSON或OWL/Turtle格式的三元组输出本体工件。然而用于AOG的简单提示方法面临三个挑战1可重复性和提示敏感性有时当提示发生变化或没有标准提示格式时生成的内容可能会有所不同。即使使用相同的提示生成的结果例如术语和关系也会变化。2扩展到长文本或多模态源处理大型文本语料库或多模态信息如文本和图像的生成需要跨章节的术语整合。大型文本语料库将包含许多章节和段落因此需要考虑本体对齐以便术语能够与另一章节中的术语匹配。3工程工作流程当问题规模庞大且需要持续维护和发展时需要一个成熟的工作流程来完成复杂的AOG任务。软件工程标准SES可能已在预训练期间以模型参数的形式隐式编码在LLM中然而据我们所知尚未有深入研究以显式方式表示和提取该知识为结构化形式例如支持知识推理[14],[15]和以人为中心/人在回路的的知识表示[16],[17]的本体的工作。由于SES的AOG任务所涉及的复杂性本研究的问题被刻意限定在以下范围1使用单一SES及其官方短版本以保持文本聚焦并易于构建评估基准。2专注于关系三元组提取RTE将其作为基于LLM的全自动本体生成流程的第一阶段该流程的目标是可用性、对源文本的忠实度和最大覆盖率。3由于成本控制和在使用此类方法时潜在的隐私问题[18]采用开源LLM例如Mistral-7B和仅编码器模型例如BERT。与流行的、优先构建TBox先识别类型和分类体系的本体创建方法[11]-[13]相比本研究提出了一种面向断言的、ABox实例级断言-TBox协同提取的AOG方法来处理文本SES设计了一个利用开源LLM的工程工作流程和最佳实践并探索了针对带有噪声和开放关系的文章数据集的评估指标。后续章节组织如下第二节回顾相关工作。第三节详述方法论。第四节介绍实验和初步结果。第五节讨论局限性和未来工作并总结。II. 相关工作Giglou等人[11]提出了LLMs4OL这是一个概念性框架涵盖了使用LLM进行本体学习的TBox和ABox任务。在他们的实验重点——以及Lo等人[19]的工作中——方法是TBox优先从类型识别和主要局限于is-a层次结构的分类体系归纳开始。相比之下本研究侧重于从SES文本中提取实体-关系断言三元组未来的工作将专注于从这些断言中推导概念及其层次结构。先前的评估已在通用领域资源如WordNet、地理资源如GeoNames和生物医学资源如NCI上进行并评估了商业和开源LLM的组合。我们的工作目标是SES——一种具有更高噪声和稀缺黄金本体的开放关系环境——并构建了一个完全使用开源LLM的工程工作流程。Lippolis等人[20]的相关工作侧重于提示工程PE提出了两种改进的提示技术用于本体生成。Kommineni等人的工作[12]致力于一个半自动的知识图谱构建工作流程并辅以LLM如ChatGPT 3.5。人在回路参与其LLM支持流程的不同阶段。他们的方法依赖于收集能力问题来创建本体并填充本体中的数据。他们将其方法论应用于创建关于深度学习DL方法论的本体和知识图谱这些方法论是从生物多样性领域的学术出版物中提取的。Gong等人[21]提出了ZS-SKA一种基于提示的零样本RTE方法并应用语义知识增强来识别未见关系。他们的数据增强是通过使用类比将句子从原始所见关系翻译成新的未见关系来实现的。在词汇层面他们使用前10个相似词作为新词的候选。与我们的工作类似他们的工作也是在零样本设置下进行然而他们用于评估的数据集例如FewRel是句子级别的具有预定义的关系集[22]。相比之下我们的研究针对的是具有开放集关系的SES文章级别包含多个段落且噪声更高并专注于提取实体-关系三元组。III. 方法论A. 工作流程概述与优先构建TBox首先识别类型和分类体系的方法相比本研究提出了一种面向断言的、ABox-TBox协同提取流程从SES文本中关系三元组提取RTE产生实例级断言和模式级候选例如类、is-a关系、定义域/值域这些可以在后续被验证并整合到OWL本体中。图1所示的工作流程包含两个主要阶段上半部分的组件侧重于使用LLM进行本体生成的子任务。下半部分的组件用于后处理包括结果合并和各种检查这计划在下一步进行。绿色矩形中所示的子任务并行执行允许某些流程同时运行。这些生成可以是三元组或关系甚至可以根据内容检查结果修复质量问题。B. 本研究的标准选择在众多可用的软件工程标准中选择软件工程道德规范和职业实践SECEPP进行初步探索。选择该文档的主要原因包括1它是一个公开可用的软件工程标准并且旨在成为一份有用的规范一份能够指导实践和教育的文档[23]。2它简洁且不过长但足够用于启动研究。3它有一个短版本278词和一个完整版本2653词其中短版本可用于概念验证完整版本适用于测试和进一步研究。章节和列表的组织引入了SES处理的常见噪声和挑战这有助于将该方法迁移到处理其他类型的文档。4对于自动化软件工程和演化确保这些智能体遵守本文提供的伦理规范至关重要。因此将其以本体形式/结构化形式呈现具有重要意义。C. 构建本体骨架为开源LLM进行提示工程的一个挑战是生成稳定的输出格式。对于不同的所需输出格式例如简单数组或JSON三元组格式LLM的性能可能完全不同。它甚至可能决定整个路线是否成功。因此本研究不依赖LLM生成所有内容而是主要依赖LLM寻找节点术语关系的能力。结果从代码文本中自动提取出一个概念-关系图三元组。该图作为后续丰富化的本体骨架。算法1的伪代码描述了从SECEPP构建本体骨架 G(V,E) 的过程通过逐句处理文本。对于每个句子 SspaCy [24] 提取名词短语和动词形成候选实体 P 和关系词汇 Vb两者都经过清洗和去重。如果没有动词候选则该句子被保存为孤立句 O。使用 (S,P,Vb) 组合成一个受约束的提示一个低温LLM在动态令牌预算下根据句子的术语数量计算返回JSON三元组 T。该方法严格解析JSON最多重试 k3 次归一化每个术语例如engineers 归一化为 engineerrunning 归一化为 run将节点添加到 V将边添加到 E。轻量级术语归一化通过spaCy词形还原实现例如engineers → engineer同时保留缩略语/专有名词并使用相似度阈值拒绝过于激进的更改。处理完所有句子后剩余的孤立句被插入到 V 中。结果是一个低噪声的骨架可供后续的类型化/合并使用。图2面板d是本研究的自动化工作流程生成的一个示例性骨架。D. 数据和专家标注参考集为SECEPP的短版本手工构建了三个专家标注参考集——Ref-Long、Ref-Medium和Ref-Short。它们使我们能够评估该方法在不同术语粒度和严格程度下的稳健性其可视化对应图2面板a、b和c。Ref-Short保留了细粒度子句密度更高面向召回率因为召回率更难实现因此需要更彻底地测试Ref-Medium合并了Ref-Short的次要边Ref-Long保留了较长的子句和核心关系面向精确率。表I预测系统输出与专家标注参考集短/中/长的计数。表I包含了三个参考集的节点、三元组和孤立子图的数量。正如预期Ref-Short拥有最大的图68个节点/83个三元组孤立子图较少。Ref-Medium由于剪枝了连接而更加碎片化26个孤立子图提供了一个平衡的中间地带。Ref-Long最为紧凑32个节点/25个三元组。IV. 实验与初步结果A. 比较的系统Pred-LLM是本研究的成果——图2面板d是五次运行中的一次代表性输出其平均性能报告在图3中。在本研究的开放关系生成中使用了开源的7B LLMMistral-7B-Instruct-v0.1 [25]。代码和数据可在 GitHub - songhui01/aog-ses · GitHub 获取。Pred-openIE是一个句子级的OpenIE基线——图2面板e展示了一个示例。使用了斯坦福CoreNLP [27]中实现的斯坦福OpenIE [26]。B. 评估协议完全自动化的输出无后期编辑针对SECEPP短版本的三个参考标准集进行评估Ref-Short、Ref-Medium、Ref-Long图2统计信息见表I。通过嵌入相似度阈值扫描 τ∈{0.10,0.15,…,0.90} 在节点和三元组层面评估质量。精确率、召回率和F1值以曲线形式报告图3顶部节点底部三元组列短/中/长。匹配要求主语、关系和宾语的拼接使用单个空格分隔的相似度超过 τ贪婪一对一对齐。C. 主要发现(1) 召回率在Ref-Long上最高在Ref-Short上最低证实了密集参考集的召回率压力假设。Ref-Long是一个紧凑的骨架便于提高召回率边更少但任何不在骨架中的额外预测边都会被计为假阳性从而降低精确率。(2) Pred-LLM通常比OpenIE产生更高的精确率并且只有在 τ0.5 时召回率差距才会缩小这很合理因为Pred-LLM的结果数量远少于Pred-openIE的结果在Ref-Short下为42对74并且OpenIE产生的虚假/重复三元组被过滤掉了。(3) 实验检查中的另一个观察结果是当 τ 达到大约0.6时三元组通常会稳定下来并变得可靠。由于篇幅限制本篇短文未能包含支持证据但这一初步发现促使我们进一步研究最优 τ 值作为此类研究的关键指标。(4) 一个7B的开源LLM已经可以与OpenIE竞争——在节点和三元组上都具有更高的精确率并且在更严格的参考集上当 τ0.5 时具有可比的召回率——而在Ref-Short上的召回率仍然是需要改进的主要空间。(5) 三元组匹配严格难于节点匹配头部/关系/尾部中任何一个的错误都会导致失配因此通常在节点层面上精确率和召回率都会下降。D. 讨论结果表明一个7B的开源LLM在节点和三元组提取的精确率方面已经可以与OpenIE竞争。这表明更强的LLM——无论是具有更大参数规模还是在领域特定数据上进行微调——都可能进一步提高提取质量。然而这项初步研究有几个局限性。首先它仅使用单个LLM评估了工作流程因此缺乏跨LLM家族和规模以及跨主干变体如稠密vs.MoE的比较实验。其次参考数据集由单一位标注者领域专家以三种不同粒度手工构建以支持在缺乏该领域/任务现有黄金标准的情况下进行系统性评估因此未报告标注者间一致性IAA。这些标签旨在用于形成性评估而非作为社区基准。在未来的工作中我们将包含多位标注者并报告IAA以提高标签可靠性并支持公共基准数据集的构建。V. 结论/未来工作本工作启动了针对软件工程标准的LLM辅助本体生成研究提出了一个全自动的工作流程为短版本构建了三个专家标注参考集本初步研究中为单一位标注者并在节点和三元组层面使用阈值扫描指标进行了评估。初步结果显示一个7B的开源LLM与斯坦福OpenIE基线相比具有竞争力通常精确率更高在更严格的参考集上召回率相当。接下来我们将致力于改进结果从短版本扩展到完整长版本以及其他SES文档通过跨句子共指处理和小范围微调来提高召回率并执行后续的本体转换阶段以生成并发布一个正式的OWL 2本体和公共基准。