背景经验别只躺在老员工脑子里事务所值钱的是见过什么坑。但经验常散在老员工的 Excel、往年底稿、零散笔记里。把审计知识沉淀成可检索的系统是AI审计平台常见的卖点。工程上知识检索有三条主流路线关键词倒排、向量库Embedding 检索、知识图谱。它们的取舍决定了你问收入确认该看哪些凭证时系统能不能答对。三方案对比维度关键词倒排Inverted Index向量库Vector/ embeddings知识图谱KG匹配方式字面命中语义相似关系跳转问收入确认要点需含关键词收入能召回营收/确认条件相关能沿收入→准则→凭证类型跳转建库成本极低中需切片向量化高需抽取实体关系更新成本低低重算片段高改 schema可解释强命中原文弱相似度黑盒强路径可查适合内容制度原文、模板非结构化经验、案例准则-科目-凭证的关联关键词倒排便宜但死板Elasticsearch/Lucene 一类按词建索引。问函证控制能精确返回含该词的段落。优点是可解释、零算力、即建即用缺点是字面匹配——你写询证函它就搜不到函证同义词、缩写全抓瞎。适合放制度原文、模板、底稿规范这类术语稳定的内容。向量库语义检索的甜点区把文档切片成 chunk用 embedding 模型转向量查询时算余弦相似。问怎么防止函证被截留即使原文写的是函证回函应直接寄回事务所也能语义召回。代价是黑盒——相似度高的段落未必真相关且中文 embedding 对专业术语如其他收益与营业外收入区分度有限需要领域微调或混合检索向量关键词兜底。知识图谱关系型问题的答案图谱把准则条款—会计科目—常见错报—对应凭证连成节点边。问收入截止性错报通常看哪些凭证图谱能沿关系跳出具体清单。代价是构建贵实体抽取、关系标注、消歧都要人工或模型参与schema 一变全盘重来。中小所通常先用倒排向量打底图谱留到数据量足够、问题确实关系密集时再上。落地建议起步制度/模板用倒排索引立刻可用。进阶经验案例、往年底稿用向量库配混合检索降误召。谨慎上图谱只有当关系跳转类问题频繁出现、且有专人维护时才投入。无论哪种都要让人能看到原文出处——审计结论要可溯源黑盒检索只能当线索。以审小匠为例其审计知识能力多建立在检索增强RAG 领域规则之上先召回相关上下文再让模型作答既补了倒排的字面短板又用原文锚定抑制幻觉。但这套能力同样依赖你喂进去的知识是否干净——垃圾进垃圾出。小结知识库不是越大越好而是问得出答得准。倒排管字面、向量管语义、图谱管关系按内容类型分层建比一把梭建大模型更务实。