
如何用graphify连接llama.cpp、vLLM等OpenAI兼容自建模型完整配置指南【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphifygraphify是一款开源代码知识图谱工具能把你的代码、文档、SQL 表结构和 PDF 变成可查询的知识图谱而不需要向量数据库。对自建模型用户来说它有个隐藏福利通过--backend openai后端graphify 可以直接连接llama.cpp、vLLM、LM Studio等任何 OpenAI 兼容接口——文档、PDF、图片的语义抽取完全在本地跑零 API 费用数据不出你的机器。为什么要把 graphify 接到本地模型上零成本本地推理不花 token 钱大仓库反复重建也不心疼数据不出门私有代码、内部文档全程留在本地graphify 对代码本身走本地 AST 解析本来就不调用 LLM只有文档、PDF、图片这类语义抽取需要模型⚡模型自由llama.cpp 的 GGUF 量化模型、vLLM 部署的 7B~70B 模型、LM Studio 里下载的任何开源模型都能用原理很简单graphify 的openai后端把OPENAI_BASE_URL当作任意 OpenAI 兼容服务器的入口llama.cpp、vLLM、LM Studio 都实现了这套接口详见 graphify/llm.py 中的后端注册逻辑。一键安装先装好 graphifyuv tool install graphifyy[openai] # 带 openai 插件安装或 pipx install graphifyy[openai]只需这一个带[openai]插件的安装命令其他都不需要。连接 llama.cpp3 个环境变量搞定llama.cpp 用--server启动后会暴露 OpenAI 兼容接口默认端口 8080# 先确认 llama.cpp 在运行curl http://localhost:8080/v1/models 能看到模型列表 OPENAI_BASE_URLhttp://localhost:8080/v1 \ OPENAI_MODELLFM2.5-8B-A1B-UD-Q4_K_XL \ OPENAI_API_KEYsk-local \ graphify extract ./docs --backend openai三个变量各自的作用环境变量填什么说明OPENAI_BASE_URLhttp://localhost:8080/v1llama.cpp 的兼容接口地址OPENAI_MODEL你服务器暴露的模型名不是GGUF 文件名以/v1/models返回为准OPENAI_API_KEY任意非空值即可本地服务器不校验但必须有值连接 vLLM换个端口就行vLLM 的 OpenAI 兼容服务默认跑在8000 端口其他完全一样OPENAI_BASE_URLhttp://localhost:8000/v1 \ OPENAI_MODELQwen2.5-7B-Instruct \ OPENAI_API_KEYsk-local \ graphify extract ./docs --backend openaiLM Studio 则是http://localhost:1234/v1。记住这个规律base_url 换成你的服务地址 /v1model 填服务暴露的名字剩下的都是同一条命令。本地模型 3 个关键调优参数自建模型通常比云端 API 更娇气README 官方给出的调优杠杆就三个完整参数见 README.mdgraphify extract ./docs --backend openai --token-budget 30000 # 减小语义分块适配小上下文模型默认 60000 graphify extract ./docs --backend openai --max-concurrency 2 # 降低并行数默认 4小显存可设 1 GRAPHIFY_API_TIMEOUT1200 graphify extract ./docs --backend openai # 本地推理慢放宽单次超时默认 600 秒--token-budget每次发给模型的文档块大小。本地模型上下文吃紧时优先调小它官方 FAQ 也强调如果模型有自己的输出上限调低 token-budget 是最可靠的旋钮--max-concurrency同时在途的语义抽取请求数本地推理建议 1~2GRAPHIFY_MAX_OUTPUT_TOKENS16384模型 JSON 输出被截断出现LLM returned invalid JSON警告时调高输出上限常见问题排查❓ 报 401 或模型不存在多半是旧版 graphify 被加载了环境变量被静默忽略。用uvx --from graphifyy graphify extract . --backend openai显式点名包并检查终端是否出现skill is from graphify newer, package is older警告。❓ 模型名填错了会怎样访问你服务器的/v1/models端点填那里返回的名字llama.cpp 里常常是文件名去掉后缀的别名。❓ 代码文件会发给本地模型吗不会。代码走 tree-sitter 本地 AST 解析确定性、零 LLM 调用纯代码仓库甚至完全离线可跑--code-only。只有文档、PDF、图片才会进入语义通道详见 docs/how-it-works.md 的三段式流程说明。建完图之后查询代替翻文件跑完后你会得到三个文件graph.html浏览器里点节点、过滤社区、GRAPH_REPORT.md关键概念与 surprising connections 报告、graph.json完整图谱。之后就可以这样问graphify query 认证流程是怎么串起来的 graphify path FastAPI ModelField # 追踪两个概念之间的最短路径 graphify explain APIRouter # 解释一个概念小结场景核心命令llama.cppOPENAI_BASE_URLhttp://localhost:8080/v1 graphify extract . --backend openaivLLMOPENAI_BASE_URLhttp://localhost:8000/v1 graphify extract . --backend openai小模型适配追加--token-budget 30000 --max-concurrency 1整个过程就是装一次 设 3 个环境变量 换端口graphify 让你手边的开源模型免费充当知识图谱的语义引擎。【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphify创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考