尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

三分钟把图片和 PDF 变成可编辑文字:DeepSeek OCR API 实战指南

三分钟把图片和 PDF 变成可编辑文字:DeepSeek OCR API 实战指南 三分钟把图片和 PDF 变成可编辑文字DeepSeek OCR API 实战指南【免费下载链接】deepseek_ocr_appA quick vibe coded app for deepseek OCR项目地址: https://gitcode.com/gh_mirrors/de/deepseek_ocr_appDeepSeek OCR 是一款开源的图片与 PDF 文字识别工具服务跑起来后对外只暴露两个 HTTP 接口一个收图片做文字识别一个收 PDF 做文字提取你传文件它返回结构化文本。一张发票照片、一份手写购物清单都能变成可直接粘进自己系统的可编辑文字。本文从部署讲起怎么把服务跑起来、第一个请求怎么发、不同需求该挑哪个识别模式。三步部署 DeepSeek OCR 服务整个服务用 Docker Compose 拉起后端会自动挂上 GPU先跑起来再说git clone https://gitcode.com/gh_mirrors/de/deepseek_ocr_app cd deepseek_ocr_app docker compose up -d容器起来之后记住这几个地址API 服务http://localhost:8000交互式文档挂在/docs下Web 前端http://localhost:3000不写代码也能用健康检查GET /health返回里model_loaded为 true 才算就绪。首次启动要下载模型权重多等几分钟是正常的改端口就在docker-compose.yml里动API_PORT。想读源码的话后端入口在 backend/main.pyPDF 渲染和格式转换的逻辑在 backend/pdf_utils.py。第一个请求怎么发图片与 PDF 是同一套玩法全服务就两个端点共性非常高端点文件参数干什么POST /api/ocrimage单张图片识别返回 JSONPOST /api/process-pdfpdf_filePDF 逐页渲染后识别拼成完整文档两者都是 multipart 表单提交共享同一组核心参数mode、grounding、base_size等PDF 端点只是多出了output_formatmarkdown/html/docx/json和dpi两个文档级参数。图片请求的最小示例import requests url http://localhost:8000/api/ocr files {image: open(invoice.png, rb)} data {mode: plain_ocr} r requests.post(url, filesfiles, datadata) print(r.json()[text])换成 PDF 只需两处改动URL 改成/api/process-pdf字段名改成pdf_file。此时output_formatmarkdown会直接回一个带附件头的完整 Markdown 文件存下来就是「PDF 转 Markdown」的全部流程。返回 JSON 里text是展示文本boxes是文本区域坐标配合 grounding 才有内容。识别效果大致是这样一张折线图走默认 plain_ocr 模式坐标轴上的年份和数值都被完整抽到右侧文本框里。OCR 识别模式怎么选4 个高频 mode 对比mode决定模型怎么输出。最常用的四个模式输出形态适用场景plain_ocr默认纯文本发票、清单、截图只要文字本身markdownMarkdown文档、论文需要保留标题与表格结构tables_csvCSV多张表用---分隔账单、图表要把表格灌进 Excel 或数据库find_ref定位坐标 文本要锁定图里某个字段如 Total的位置几条经验普通场景别动mode默认plain_ocr就够用想存档且保留版式选markdown批量识别流水、报表tables_csv最省事拿到的 CSV 能直接贴进 Excelfind_ref严格说是定位模式——模型找到指定词并返回坐标天然配合 grounding 用。此外接口还内置了tables_md、kv_json、figure_chart、layout_map、pii_redact、multilingual、describe、freeform等模式需要结构化 JSON 输出或敏感信息脱敏时再去看/docs。进阶参数精选文本区域定位与自定义提示grounding—— 设为 true 后模型除了文字还会返回每个文本区域在图上的坐标前端可以高亮、也可以按区域裁剪。选find_ref/layout_map/pii_redact时它会自动开启不用手设。搜索词 helmet 被精确框在图中出现的位置返回的boxes里就是可以直接用的坐标。find_term—— 要定位的关键词与find_ref搭配。多处出现时会一起框出来输入 all birds四只鸟各自一个框。多目标定位适合图里有几个同种元素、分别在哪这类需求。prompt—— freeform 模式的钥匙把你的要求原样写进去模型照着执行比如只提取车身上的品牌和编号。内置的 describe 模式本质上是一条预设好的指令让模型描述画面这里除了识别出车身文字模型还额外输出了一段对赛车画面的描述。DeepSeek OCR 常用参数速查必选二选一参数端点说明image/api/ocr要识别的图片文件pdf_file/api/process-pdf要识别的 PDF 文件常用默认值一般不用改参数默认值说明modeplain_ocr识别模式见上方对比表output_formatmarkdownPDF 输出格式markdown/html/docx/jsonextract_imagesTrue是否从 PDF 中抽取内嵌图片groundingFalse是否返回文本区域坐标find_termNonefind_ref模式下的定位词promptfreeform 模式的自定义指令schemaNonekv_json模式使用的 JSON 模式调优效果不满意再动参数默认值什么时候调dpi144扫描件模糊、字太小或排版密集时调高base_size/image_size1024/640超大图或极小字时调整模型输入尺寸crop_modeTrue裁切处理出问题时可以关掉include_captionFalse想在结果末尾追加一段图片描述test_compressFalse调试压缩效果用生产别开选型建议与下一步图片提文字 →plain_ocrPDF 转 Markdown 文档 →/api/process-pdfmodemarkdownoutput_formatmarkdown图表取数 →tables_csv定位或高亮字段 →find_reffind_term给上游系统喂结构化数据 →kv_jsonschema。接下来可以做一件事从手机相册里随便找一张发票截图用上面的 Python 片段丢给/api/ocr核对金额和发票号是否正确抽出。这一步跑通整条图片到文字的链路就齐了。【免费下载链接】deepseek_ocr_appA quick vibe coded app for deepseek OCR项目地址: https://gitcode.com/gh_mirrors/de/deepseek_ocr_app创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表