
1. 基础概念RAG检索增强生成将信息检索与大模型结合先从外部知识库检索上下文再交给LLM生成答案传统向量RAG以Chunk文本片段为检索单元适合局部事实问答制度、API文档查询。GraphRAG基于图结构的检索增强生成把文档内容抽取为实体、关系、社区摘要构成知识图谱检索不再只依靠语义相似度可沿图关系路径收集证据实现「关系可追溯」。类比向量RAG图书馆按语义找相似书页GraphRAG整理人物/事件关系图顺着线索查找证据。2. 传统向量RAG三大局限性Chunk是信息孤岛文档切分把完整业务对象拆到不同片段语义相似不等于业务关系完整。不擅长多跳推理Top‑K相似度召回无法自动完成多步实体跳转例如A系统→负责人→故障复盘→支付链路。难以回答全局性归纳问题全局聚合类问题统计风险、投诉分类召回太少看不到全貌召回太多Token爆炸。3. GraphRAG vs 传统向量RAG对比维度传统向量RAGGraphRAG检索对象文本Chunk实体、关系、路径、社区摘要、原文片段核心能力语义相似度召回图遍历、多跳推理、全局主题聚合数据结构向量索引知识图谱向量全文索引适用场景局部事实问答多跳关系问答、跨文档归纳、复杂业务分析构建成本中等高抽取、消歧、图谱维护风险召回片段不全图谱抽取错误带来系统性答案误导4. GraphRAG核心概念知识图谱节点实体边实体关系属性时间、置信度、来源等补充信息。实体Entity图谱最小业务对象不限于人名组织也可以是系统、组件、风险、事件实体抽取质量决定系统上限。关系Relationship显式记录实体之间依赖、影响、负责等联系是实现多跳推理的基础关系方向错误会直接导致答案错误。社区发现使用Leiden/Louvain算法把连接紧密的节点聚合为主题社区并生成社区摘要服务全局归纳。四种检索模式Basic Search标准向量Top‑K普通事实查询Local Search局部检索围绕实体向外扩展邻居实体关系问答DRIFT Search实体焦点跨社区摘要补充Global Search全局检索基于社区摘要做Map‑Reduce处理全局归纳问题5. GraphRAG完整流程构建阶段文档→图谱文档解析 → 文本切分 → 实体抽取 → 关系抽取 → 图谱归一实体消歧合并 → 社区发现 → 摘要生成 → 索引入库图库向量库全文库关键风险实体抽错/重复、关系方向错误、摘要幻觉、增量更新复杂。查询阶段查询路由不会所有请求都走GraphRAG按问题类型路由简单事实走向量Basic Search实体关系、多跳推理Local Search图遍历全局归纳Global Search读取社区摘要6. 适用 不适用场景适合场景企业知识库复杂跨文档问答IT架构、故障链路影响分析金融风控、供应链、合规强对象关系访谈/工单/复盘文档全局主题归纳不适合场景优先用向量RAG文档少、问题都是简单事实问答源文档质量差、术语混乱会造成图谱脏数据极高实时性要求图谱更新成本高团队缺少图建模、评测、实体消歧维护能力判断标准如果已经召回全部相关文本但无法把文本按业务关系串联才引入GraphRAG。7. 主流实现方案Neo4j GraphRAG图数据库做核心Cypher做图遍历适合已有业务实体关系支持VectorCypherRetriever、Text2Cypher注意Text2Cypher需要做白名单、权限、超时限制。LangChainNeo4j适合已有LangChain技术栈快速接入Agent/RAG。LlamaIndex PropertyGraphIndex基于LlamaIndex生态做属性图索引。FalkorDB GraphRAG SDKNeo4j替代侧重低延迟多租户。轻量自研图谱业务表存储少量核心实体关系用来做POC验证不引入重型图数据库。8. 核心工程难点实体问题别名、缩写带来重复实体需要术语词典、别名表、置信度过滤、人工校验。关系抽取关系方向极易出错每条关系必须记录来源文档、原文位置、置信度、模型版本。社区摘要成本高大量LLM调用更新文档要刷新摘要容易产生幻觉。增量更新复杂单篇文档修改会连锁影响实体、关系、社区、摘要全量重建成本高。权限过滤复杂社区摘要会融合多文档信息仅文档级过滤无法保护摘要中的敏感信息需要分区生成摘要。9. 项目落地五阶段阶段1搭建向量RAG基线做好文档解析、混合检索、Rerank、溯源、权限。阶段2收集Badcase区分是召回问题、切分问题还是多跳关系/全局归纳问题只有后者才适合GraphRAG。阶段3轻量图谱POC仅抽取少量核心实体与关系保留原文证据验证收益。阶段4引入社区发现全局检索语料规模大、全局问题多时开启配套评测。阶段5混合路由Hybrid RAG分类器判断问题类型自动分发到向量检索 / GraphRAG增加降级、日志。10. 评测体系检索层实体召回率、关系召回率、社区一致性。生成层忠实度Faithfulness、答案相关性、上下文精确度RAGAS。业务层用户采纳率、转人工率、回归测试集。11. 其他RAG增强路线对比方案解决问题短板多向量ColBERTChunk细粒度匹配无法处理实体关系HyDE/Query改写查询与文档表述差异不能做多跳推理Self‑RAG提升答案可信度不改变底层检索结构GraphRAG关系检索、全局归纳抽取、消歧、维护成本高GraphRAG不是唯一方案RAPTOR、Agent检索也可以解决部分同类问题。12. 总结GraphRAG把检索单元从文本片段升级为实体、关系、社区解决多跳推理、跨文档全局归纳。但代价是抽取、消歧、更新、权限治理复杂度大幅上升。落地原则先修复召回、切分等基础问题原文能召回但无法建立业务关系时再引入GraphRAG。