尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

10分钟看懂LLM Wiki:三层架构与Ingest/Query/Lint三大核心操作完整原理

10分钟看懂LLM Wiki:三层架构与Ingest/Query/Lint三大核心操作完整原理 10分钟看懂LLM Wiki三层架构与Ingest/Query/Lint三大核心操作完整原理【免费下载链接】llm_wikiLLM Wiki is a cross-platform desktop application that turns your documents into an organized, interlinked knowledge base — automatically. Instead of traditional RAG (retrieve-and-answer from scratch every time), the LLM incrementally builds and maintains a persistent wiki from your sources。项目地址: https://gitcode.com/gh_mirrors/ll/llm_wikiLLM Wiki 是一款让大模型自动构建并维护的 Wiki 知识库桌面应用它把 PDF、网页、文档等原始资料增量编译成结构化、互相链接的 Markdown 维基而不是每次提问都从零检索传统 RAG 模式。本文用 10 分钟带你吃透它的三层架构与Ingest / Query / Lint 三大核心操作的完整原理帮你快速上手这个会自我进化的 AI 知识库工具。一、为什么需要 LLM Wiki它和 RAG 有什么区别 传统 RAG 工作流是提问时临时去原始文档里捞相关片段再现场拼一个答案。问题是——LLM 每次都在重新发现知识没有积累。当你问一个需要综合 5 份文档的问题时它每次都得重新找、重新拼。LLM Wiki 的思路完全相反知识只编译一次然后持续保鲜。当你新增一份资料LLM 不只是建个索引而是真正读进去抽取关键信息、更新实体页、修订主题综述、标记新旧知识的矛盾。交叉引用早已就位矛盾早已被标注综述已经反映了你读过的一切。知识库随每一次资料导入、每一次提问而复利式增长。分工也很清晰人类负责挑选资料、提问和做判断LLM 负责摘要、交叉引用、归档和记账——这些没人愿意做的维护工作对 LLM 来说成本趋近于零。这个模式源自 Andrej Karpathy 提出的个人知识库方法论项目内保留了原始设计文档llm-wiki.md。二、三层架构Raw Sources → Wiki → Schema LLM Wiki 的知识库分三层职责边界非常干净层级内容谁在写① Raw Sources原始资料层你收集的论文、文章、图片、数据文件存放在raw/sources/不可变人类② Wiki维基层LLM 生成的 Markdown 文件摘要、实体页、概念页、综述、对比分析LLM③ Schema规则层定义维基结构、页面类型约定、Ingest/Query 工作流程的配置规则人与 LLM 共同演化关键设计点原始资料只读LLM 只从raw/sources/读取绝不修改——这是你的事实之源维基层完全归 LLM 所有它创建页面、更新交叉引用、保持全局一致你负责阅读Schema 是纪律来源它让 LLM 从一个普通聊天机器人变成一个有章法的维基维护员。项目提供 Research、Reading、Personal Growth 等场景模板预配置好purpose.md维基的目标与灵魂和schema.md结构规则。一个项目就是这样一个目录结构Wiki 目录甚至可以直接作为 Obsidian 库打开使用应用会自动生成.obsidian/配置my-wiki/ ├── purpose.md # 目标、关键问题、研究范围 ├── schema.md # 维基结构规则 ├── raw/sources/ # 上传的原始文档不可变 ├── wiki/ │ ├── index.md # 内容目录LLM 导航入口 │ ├── log.md # 操作历史可解析的时间线 │ ├── overview.md # 全局综述每次 Ingest 自动更新 │ ├── entities/ # 人物、组织、产品 │ ├── concepts/ # 理论、方法、技术 │ └── sources/ # 来源摘要页 └── .llm-wiki/ # 应用配置、聊天记录、Review 条目三、Ingest / Query / Lint三大核心操作完整原理 ⚙️3.1 Ingest摄入两步链式思考把资料编译进维基Ingest 是知识库增长的引擎。你把新资料丢进原始资料层LLM 开始处理。实现位于 src/lib/ingest.ts。第一步分析Analysis——LLM 先读原始资料产出一份结构化分析关键实体与概念、与现有维基内容的关联、与已有知识的矛盾与张力、维基结构调整建议。第二步生成Generation——LLM 基于自己的分析生成维基文件带 YAML frontmatter 的来源摘要页、带[[wikilink]]交叉引用的实体页/概念页、更新index.md与log.md、为需要人类判断的事项生成 Review 条目。 单个来源可能触及 10~15 个维基页面。这就是编译的含义。除了两步流程工程上的增强让 Ingest 非常省心SHA256 增量缓存资料内容先做哈希未变更的文件自动跳过省 token 省时间持久化 Ingest 队列串行处理防止并发调用 LLM队列落盘可跨重启存活失败任务自动重试最多 3 次来源可溯源每个生成的维基页面在 frontmatter 里都带sources: []字段指回贡献了它的原始文件目录递归导入 源文件夹自动监听文件夹结构会作为分类上下文提示给 LLM在raw/sources/外部新增/删除的文件也会被自动同步处理。3.2 Query查询多阶段检索管线答案还能存回维基你向维基提问时并不是简单的读几个页面而是一条精心设计的检索管线实现见 src/lib/search.tsPhase 1 分词搜索中文 CJK 双字切分、英文去停用词、标题命中加分 同时搜 wiki/ 与 raw/sources/ Phase 1.5 向量语义搜索可选OpenAI 兼容端点生成 Embedding 存入 LanceDB 做近似最近邻无关键词重叠也能语义命中 Phase 2 图谱扩展搜索结果作为种子节点用四信号相关性模型 做 2 跳遍历找到相关的相关 Phase 3 预算控制4K~1M token 可配置上下文窗口 按 60%维基页 / 20%对话历史 / 5%索引 / 15%系统提示 分配 Phase 4 上下文组装带编号的完整页面喂给 LLM 要求以 [1] [2] 形式引用作答Query 有一个特别棒的设计洞察好答案可以存回维基。你让 LLM 做的对比分析、发现的联系不该消失在聊天记录里——点击Save to Wiki答案会归档到wiki/queries/并自动触发 Ingest把其中的实体/概念抽取进知识网络。你的每一次探索都在知识库中复利。3.3 Lint体检让维基保持健康的周期维护维基会长大也会生病。Lint 就是定期让 LLM 给维基做健康检查实现见 src/lib/lint.ts分为结构检查runStructuralLint与语义检查runSemanticLint两层。它检查的典型问题矛盾检测页面之间相互冲突的表述⏰过时断言已被新资料取代的旧结论孤儿页面没有任何入站链接的页面缺失交叉引用被多处提及却没有独立页面的重要概念数据缺口可以通过一次网络搜索填补的知识空白。LLM 特别擅长在 Lint 时建议新的研究问题和新资料方向——这正是知识库越用越健康的机制。配合异步 Review 系统LLM 在 Ingest 时标记的待判断事项会进入队列你可以随时按创建页面 / 深度研究 / 跳过等预定义动作处理不会阻塞主流程。四、知识图谱让知识结构看得见 ️[[wikilink]]交叉引用不仅方便阅读还支撑起完整的知识图谱实现见 src/lib/wiki-graph.ts四信号相关性模型直接链接×3.0、来源重叠×4.0、Adamic-Adar 共同邻居×1.5、类型亲和×1.0综合计算页面间的相关强度Louvain 社区检测基于链接拓扑自动发现知识聚类并给出内聚度评分低内聚聚类会被警告提示Graph Insights自动找出令人惊讶的连接跨社区、跨类型链接和知识缺口孤立页面、稀疏社区、桥接节点并可一键触发Deep Research自动搜索补全。Deep Research知识缺口的一键补全 当 LLM 识别出知识缺口Deep Research 会调用 Tavily / SerpApi / SearXNG 等搜索源抓取完整内容由 LLM 综合成带交叉引用的研究页并自动 Ingest进维基——研究结果直接融入知识网络。五、10 分钟上手从零到可用 # 从源码构建需要 Node.js 20 与 Rust 1.70 git clone https://gitcode.com/gh_mirrors/ll/llm_wiki cd llm_wiki npm install npm run tauri dev # 开发运行 npm run tauri build # 生产构建也可为 macOS / Windows / Linux 直接使用预编译二进制包。上手流程新建项目选一个场景模板Research / Reading / General…设置→ 配置 LLM 提供商API Key 模型Sources→ 导入文档PDF、DOCX、EPUB、网页剪藏……盯住Activity Panel——LLM 正在自动建页Chat里提问Graph里看连接Review里做判断定期跑Lint。两个实用彩蛋配套的Chrome 网页剪藏扩展extension/目录AltShiftL 一键剪藏并自动 Ingest和内置的本地 HTTP API MCP Servermcp-server/目录127.0.0.1:19828token 保护可以让 Claude Code 等外部 AI Agent 直接查询你的维基。六、写在最后 ✅回顾一下核心心智模型三层架构人类只写原始资料与规则LLM 全权维护中间的知识层Ingest把资料编译成结构化维基两步链式思考 增量缓存 持久队列Query用多阶段管线精准检索且答案可以存回维基继续复利Lint定期体检让矛盾、孤儿页、知识缺口无所遁形。正如原始文档里那句精辟的总结**人类放弃维基是因为维护成本的增长快于价值而 LLM 不会无聊、不会忘记更新交叉引用一次可以触及 15 个文件。**维护成本趋近于零维基才得以真正长寿。这就是 LLM Wiki 的完整原理——想动手试试的话上面的 10 分钟上手步骤就是起点。更多细节可参阅项目文档README_CN.md、README.md。【免费下载链接】llm_wikiLLM Wiki is a cross-platform desktop application that turns your documents into an organized, interlinked knowledge base — automatically. Instead of traditional RAG (retrieve-and-answer from scratch every time), the LLM incrementally builds and maintains a persistent wiki from your sources。项目地址: https://gitcode.com/gh_mirrors/ll/llm_wiki创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表