尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

graphify 中文支持完整指南:jieba 分词让知识图谱中文查询更精准

graphify 中文支持完整指南:jieba 分词让知识图谱中文查询更精准 graphify 中文支持完整指南jieba 分词让知识图谱中文查询更精准【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphifygraphify是一款把代码库、文档、SQL 模式和配置文件变成可查询知识图谱的开源工具它为 Claude Code、Cursor、Codex 和 Gemini CLI 提供/graphify技能采用本地确定性 AST 解析不依赖向量库。更值得中文用户关注的是graphify 内置了jieba 中文分词支持让页面路由这样的复合中文词也能被精准命中。 为什么中文查询容易失手graphify 的查询引擎实现在 graphify/serve.py采用分词 IDF 加权的搜索管线把查询拆成词元再按词频给节点打分。这套逻辑对英文很友好——空格天然分词但对中文来说页面路由如果不拆分就很难命中只含路由的节点。graphify 给出的解法很直接检测到中文就分词查询词元中包含 CJK 字符时自动走分词分支jieba 优先安装了 jieba 就用它做语义分词页面路由 → [页面, 路由]优雅降级没装 jieba 时退化为双字滑窗bigram页面路由也会产生页面、路由等片段保留原词完整复合词会和分词结果一起参与匹配确保页面路由这类精确词不丢失。核心实现在 graphify/serve.py 的_segment_chinese函数def _segment_chinese(text: str) - list[str]: Segment Chinese text and keep the original term for exact matching. if _jieba is not None: segments [w for w in _jieba.cut(text) if len(w.strip()) 0] else: segments [text[i:i 2] for i in range(len(text) - 1)] or [text] if len(text) 1 and text not in segments: segments.append(text) return segments jieba 分词快速安装步骤jieba 是可选依赖通过chineseextra 引入见 pyproject.toml。推荐用 uv 安装uv tool install graphifyy[chinese]如果已在用 pippip install graphifyy[chinese] 不安装 jieba 也能查中文——双字滑窗回退机制保证基本可用装上 jieba 后长复合词的分词质量会明显更好。jieba 模块在 graphify/serve.py 中被缓存式导入导入成功就全程复用失败则记为None不阻塞服务启动。 中文查询是如何被处理的整条管线可以概括为检测中文 → jieba 分词 → 过滤疑问词 → IDF 加权打分 → 子串匹配加分。以查询前端 router 路由配置为例graphify 会同时得到前端 / router / 路由 / 配置四个可搜索词元中英混合场景在 tests/test_serve.py 中有对应测试。打分阶段有三个细节让中文查询更稳IDF 权重像错误这种出现在上百个节点的词权重低稀缺的专有名词权重高graphify/serve.py子串匹配中文节点标签常是短语路由可以直接命中路由桥接核对表这类节点tests/test_serve.py全链路验证页面路由查询能穿透图谱父子边找到含路由标签的子节点tests/test_serve.py。另外注意日文假名、韩文不会被误判为中文分词对象它们会整体保留为词元tests/test_serve.py。⚙️ 中文环境使用清单Windows 中文系统graphify 已修复系统默认编码导致的乱码问题——技能文件统一指定encodingutf-8json.dumps使用ensure_asciiFalse中文标签原样存储见 CHANGELOG.md。验证分词行为跑一下tests/test_serve.py中test_query_terms_chinese_segments_with_cached_jieba等用例可直观看到页面路由的分词产物。查看更新历史中文分词特性记录在 CHANGELOG.md。✅ 常见问题 FAQQ不装 jieba 会影响使用吗不会。双字滑窗回退能保证基本分词但复合词边界判断不如 jieba 精准建议按需安装。Q查询支持中英混合吗支持。同一句里英文按常规分词、中文走 jieba互不干扰。Q查询没命中中文节点怎么办试试直接用节点标签中的子串如只查路由子串匹配本身就是一等公民。 总结graphify 的中文支持体现了本地确定性的设计哲学不上传、不依赖向量库仅靠 jieba 分词 IDF 打分就让中文复合词查询变得精准可靠。配合 docs/translations/README.zh-CN.md 中文版说明中文用户开箱即用。【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphify创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表