
LiteParse 文档解析跨平台部署指南Linux、macOS、Windows 快速全覆盖【免费下载链接】liteparseA fast, helpful, and open-source document parser项目地址: https://gitcode.com/GitHub_Trending/li/liteparseLiteParse 是一个快速、轻量的开源文档解析工具可将 PDF、DOCX、XLSX、PPTX 和图片解析为 Markdown、JSON 或纯文本并内置 OCR 与文字坐标信息。它基于 Rust 核心与 PDFium 引擎运行全平台支持 Linux、macOSIntel / ARM和 Windows数据 100% 本地处理无需云服务。本文提供从安装到容器化部署的完整步骤帮助你在任意系统上 5 分钟内跑起来 。一图看懂跨平台架构LiteParse 采用“Rust 核心 多语言绑定”的架构同一个核心引擎通过 npm、pip、cargo 和浏览器 WASM 四种方式交付所有安装渠道共享同一个lit命令行工具。Linux 部署pip / npm / cargo 一键安装Linux 是最直接的部署目标三种安装方式任选其一语言生态安装命令说明Pythonpip install liteparse附带 PyO3 原生绑定Node.jsnpm i -g llamaindex/liteparse附带 napi-rs 原生绑定Rustcargo install liteparse直接安装 CLI安装后验证lit parse document.pdf --format markdown -o output.md # 输出结构化 Markdown lit batch-parse ./input-dir ./output-dir # 批量解析整个目录Linux 专属加分项如果还需要解析 Word/Excel 等 Office 文档安装 LibreOffice 即可实现自动转 PDFapt-get install libreoffice或brew install --cask libreoffice。离线 / 内网环境可设置TESSDATA_PREFIX指向预下载的 Tesseract 训练数据目录。macOS 部署Intel 与 Apple Silicon 均预编译macOS 用户无需自己编译——项目为 Intel 和 Apple Silicon 都提供预编译二进制pip install liteparse或npm i -g llamaindex/liteparse会自动选择对应架构的包。brew install --cask libreoffice # 可选启用 DOCX/XLSX/PPTX 自动转换 pip install liteparse lit parse contract.docx -o contract.mdWindows 部署Chocolatey pip 组合拳Windows 上推荐先安装 LibreOfficeOffice 格式转换依赖它再安装解析器choco install libreoffice-fresh pip install liteparse⚠️Windows 注意事项安装后可能需要把 LibreOffice 的程序目录通常是C:\Program Files\LibreOffice\program加入系统 PATH否则 Office 文档转换会找不到可执行文件。Tesseract OCR 已随包捆绑Windows 上无需额外安装任何 OCR 组件开箱即用。Docker 部署最小化运行时镜像需要服务器化部署时项目自带的 Dockerfile 采用二阶段构建第一阶段基于rust:1-bookworm编译第二阶段只保留debian:bookworm-slim运行时安装最小依赖libtesseract5、liblept5、tesseract-ocr-eng后直接拷贝lit二进制与 PDFium 动态库镜像干净且体积小docker build -t liteparse . docker run --rm -v $(pwd)/docs:/data liteparse lit parse /data/report.pdf -o /data/report.md服务器环境冷启动慢项目文档 musl_build_cargozig.md 给出了基于cargo-zigbuild的 musl 静态链接构建方案x86_64-unknown-linux-musl/aarch64-unknown-linux-musl产物不依赖 glibc可部署到 Alpine 等极简系统。浏览器部署WASM 零安装方案如果你希望在网页端解析文档而完全不部署服务器LiteParse 还提供 WebAssembly 版本npm i llamaindex/liteparse-wasm全部逻辑在浏览器内运行无服务器、无云端调用。该方案支持 PDF 解析与自定义 JS OCR 引擎但不支持 Office 格式转换与截图功能详见文档 browser-usage.md。源码结构速览各平台模块在哪里模块路径作用核心库 CLIcrates/liteparse/src/解析、OCR、Markdown 布局重建markdown_layout/Node.js 绑定crates/liteparse-napi/napi-rs 原生绑定Python 绑定crates/liteparse-python/PyO3 原生绑定WASM 绑定crates/liteparse-wasm/浏览器端绑定PDFium 封装crates/pdfium/、crates/pdfium-sys/PDF 渲染与文本提取层npm / pip 包装packages/node/、packages/python/各平台发行包OCR 服务端ocr/easyocr/、ocr/paddleocr/、ocr/suryaocr/可选的高精度 HTTP OCR 服务需要更高 OCR 精度时可启动 EasyOCR 或 PaddleOCR 服务通过--ocr-server-url参数接入接口规范见 OCR_API_SPEC.md。跨平台部署检查清单✅统一 CLI无论哪种方式安装命令都是lit脚本可跨平台复用✅OCR 开箱即用Tesseract 已捆绑无需系统级安装✅Office 转换各平台装好 LibreOffice 即可解析 DOCX/XLSX/PPTX✅纯本地运行无云依赖文档不出内网✅多语言生态Python、Node.js、Rust、浏览器四端同源码构建一套代码全平台一致体验——从个人笔记本到服务器再到浏览器LiteParse 都能本地快速解析你的文档 。【免费下载链接】liteparseA fast, helpful, and open-source document parser项目地址: https://gitcode.com/GitHub_Trending/li/liteparse创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考