尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Papermerge 部署教程:从环境自检到跑通第一篇文档 OCR 索引

Papermerge 部署教程:从环境自检到跑通第一篇文档 OCR 索引 Papermerge 部署教程从环境自检到跑通第一篇文档 OCR 索引【免费下载链接】papermergeOpen Source Document Management System for Digital Archives (Scanned Documents)项目地址: https://gitcode.com/gh_mirrors/pa/papermergePapermerge 是一款专为扫描文档设计的开源文档管理系统DMS入库时自动执行 OCR、建立索引并支持全文检索。这篇 Papermerge 部署教程面向想在自有服务器或 NAS 上跑起它的新手全程基于 Docker Compose 完成。它适合谁 / 解决什么问题判断要不要装看下面三类场景是否命中你手头有一批扫描的发票、合同、票据想按关键字直接搜到原文而不是翻文件柜希望用层级文件夹加彩色标签组织数字档案并给团队成员分配不同权限坚持自托管部署不愿把文档存进第三方云服务它支持 PDF、TIFF、JPEG、PNG 四种格式界面是仿桌面文件浏览器风格左侧列表、右侧预览。图1Papermerge 主界面——左侧为文件夹与文档缩略图列表右侧展示 OCR 识别后的账单细节与元数据 部署前自检清单开始之前先确认宿主机满足前提其余依赖全部交给 Docker 处理操作系统已安装 Docker 与 Docker Compose 的 Linux内存2GB 及以上磁盘20GB 及以上可用空间网络能正常拉取容器镜像在准备安装 Papermerge 的目录执行获取代码的命令git clone https://gitcode.com/gh_mirrors/pa/papermerge cd papermerge预期结果当前目录下出现 papermerge 目录内含 docker、config、papermerge 等子目录。 部署实操编排定义在项目的 docker/ 目录中先进入该目录cd docker四条服务的启动命令都写在 docker/docker-compose.yml 里。启动全部组件docker-compose up -d该命令自动拉取主应用eugenci/papermerge、PostgreSQL 数据库、Redis 缓存、worker 工作节点四套镜像并后台启动。首次拉取镜像需要几分钟请耐心等待。确认启动状态docker-compose ps预期结果app、db、redis、worker 四项全部显示 Up部署步骤完成。️ 首次进入与默认信息默认访问信息如下初始账号由 docker/scripts/create_user.py 在容器首次启动时自动创建访问地址http://localhost:8000用户名admin密码admin权限超级管理员登录后立即进入账户设置修改默认密码这是必须执行的安全动作。完成标志浏览器打开后看到登录页用 admin/admin 成功进入 Home 文档面板即部署成功。图2文档列表与预览窗格——可见标签、文件夹层级以及 OCR 完成状态标记⚙️ 配置速查表高频配置集中在 docker/config/ 目录均为 Python 文件文件管什么典型改动docker/config/papermerge.config.pyOCR 语言、数据库连接OCR_DEFAULT_LANGUAGE 默认语言OCR_LANGUAGES 增加语种docker/config/app.production.py主应用生产设置DEBUG 开关、日志级别与输出文件docker/config/worker.production.pyworker 进程设置数据库连接、Redis broker 地址docker/docker-compose.yml容器编排ports 端口映射、volumes 数据卷docker/scripts/create_user.py初始账号创建修改初始用户名与密码改完配置后重新执行 docker-compose up -d 使变更生效。 故障排查Q服务起不来页面打不开怎么办查看日志定位原因docker-compose logs -f该命令实时输出各容器日志。重点看 app 与 db 两栏的报错数据库首次初始化较慢可稍等片刻再刷新页面。Q默认端口 8000 被占用如何修改编辑 docker-compose.yml把 app 服务的 ports 映射 8000:8000 改为 8080:8000再重启容器随后改用 http://localhost:8080 访问。QOCR 识别结果乱码或错字多半是语言不匹配。检查 papermerge.config.py 中的 OCR_LANGUAGES 是否包含文档语种以及 OCR_DEFAULT_LANGUAGE 是否设置正确改完重启容器。Q数据如何备份核心数据只存在两个命名卷里postgres_data7 存数据库media_root 存原始文档。定期备份这两个卷即可完整恢复不要遗漏媒体卷。 进阶玩法跑顺之后可以按需尝试以下方向自定义字段与多语种 OCR为不同文档类型定义金额、日期等元数据字段配合 OCR_LANGUAGES 处理混语种扫描件把非结构化扫描变成可统计的结构化数据自动化规则Automate在管理面板配置规则让新入库文档按关键字自动归入对应文件夹并打标签省去手工整理REST API 对接Papermerge 提供 OpenAPI 规范的 REST API可用于扫描目录批量入库或与其他系统做数据同步部署完成后的下一步指引到这里主应用、数据库、缓存、工作节点四个组件已全部跑通文档入库后即可通过全文检索直接定位原文。更深的用法——权限体系、邮件附件导入、备份策略等——请查阅 Papermerge 官方文档站点遇到部署或使用问题到该项目的元仓库meta-repository提交 issue那里同时跟踪项目状态与已知问题。【免费下载链接】papermergeOpen Source Document Management System for Digital Archives (Scanned Documents)项目地址: https://gitcode.com/gh_mirrors/pa/papermerge创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表