尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Hyper-Extract 的 he dump 命令指南:知识摘要如何持久化到磁盘

Hyper-Extract 的 he dump 命令指南:知识摘要如何持久化到磁盘 Hyper-Extract 的 he dump 命令指南知识摘要如何持久化到磁盘【免费下载链接】Hyper-ExtractHypergraph is more powerful. Transform unstructured text into structured knowledge with LLMs. Graphs, hypergraphs, and spatio-temporal extractions — with one command.项目地址: https://gitcode.com/GitHub_Trending/hy/Hyper-ExtractHyper-Extract 是一款基于 LLM 的知识提取工具能把非结构化文档转换为结构化的知识摘要Knowledge Abstract简称 KA。dump正是这条流水线的最后一步将提取出的知识摘要持久化到磁盘供后续的可视化、语义搜索和对话复用。本文带你看懂这套存得下、读得回的持久化机制。 先认识主角知识摘要Knowledge Abstracthe parse命令从文档中提取出的并不是零散的笔记而是一个完整的知识摘要目录。一个 KA 就是结构化数据 元信息 向量索引的集合体全部继承自统一的基类 BaseAutoType因此任何类型的 KA图、超图、集合、模型等都共享同一套保存协议。 dump 一次写入的三件套ka.dump()是整个持久化流程的总入口定义在 base.py#L526-L557。它会在目标目录下写出三部分./my_ka/ ├── data.json # 核心知识数据实体、关系等结构化 JSON ├── metadata.json # 模板、语言、创建/更新时间戳 └── index/ # 向量索引文件FAISS支持语义搜索三者地位并不对等这一点决定了系统的容错设计文件地位写入策略data.json 关键由 Pydantic 模型序列化写出dump_data() 保证 UTF-8 与缩进格式metadata.json 推荐记录created_at/updated_at等dump_metadata() 写入index/ 可选索引保存失败只打印警告、不中断流程随时可用he build-index重建这种数据为主、索引可弃的分层设计意味着即使索引损坏你的知识本体也安然无恙。⚙️ 哪些 he 命令在暗中替你执行 dump在官方工作流图中保存被标记为he dump见 docs/zh/cli/index.md 的流程说明而在当前实现中这个保存动作由ka.dump()承担被以下三个命令自动触发无需你手动执行he parse— 提取完成后保存数据若未跳过索引--no-index构建索引后会再 dump 一次把索引一并落盘见 cli.py#L346-L368he feed— 向已有 KA 追加新文档后合并结果自动保存见 cli.py#L825-L827he build-index— 重建向量索引后重新持久化见 cli.py#L887-L889也就是说只要你正常走完提取流程知识就已经安全躺在磁盘上了。 load 读回来一场完整的往返旅行持久化的另一半是 load()它与 dump 严格对称且按重要性分级处理data.json缺失 → 直接报错没有数据就没有 KAmetadata.json缺失 → 静默跳过index/缺失或损坏 → 打印提示建议用he build-index或ka.clear_index()重建此外还有一个贴心的细节读回时会把metadata里被序列化成字符串的时间戳还原为datetime对象保证加载后的 KA 与新创建的行为完全一致见 base.py#L641-L652。 Python API手动掌控保存时机如果你用 Python 而非 CLIdump与load同样是显式方法保存时机完全由你决定——这也是长任务中做定期快照的关键手段示例见 docs/zh/python/guides/incremental-updates.mdka.feed_text(text) ka.dump(./kb_v1/) # 任意时刻手动快照 ka.load(./kb_v1/) # 随时恢复现场完整读写指南参见 docs/zh/python/guides/saving-loading.md。️ 模块速查内容路径CLI 命令入口hyperextract/cli/cli.pydump / load 核心实现hyperextract/types/base.py知识摘要类型族hyperextract/types/预置提取模板hyperextract/templates/presets/CLI 文档含工作流图docs/zh/cli/index.md一句话总结he parse/he feed/he build-index背后都藏着同一个ka.dump()它把知识摘要拆成数据、元信息、索引三层落盘load()再按同一协议读回——一次 dump知识永久可查。【免费下载链接】Hyper-ExtractHypergraph is more powerful. Transform unstructured text into structured knowledge with LLMs. Graphs, hypergraphs, and spatio-temporal extractions — with one command.项目地址: https://gitcode.com/GitHub_Trending/hy/Hyper-Extract创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表