
Unlimited OCR Works作者Youyang Yin, Huanhuan Liu, YY, Qunyi Xie, Chaorun Liu, Shiqi Yang, Shaohua Wang, Zhanlong Liu, Hao Zou, Jinyue Chen, Shu Wei, Jingjing Wu, Mingxin Huang, Zhen Wu, Guibin Wang, Tengyu Du, Lei Jia核心发表机构Baidu Inc.论文链接arXiv:2606.23050v1发布于arXiv 预印本cs.CV|—|—|—|—|—|—|—|| DeepSeek-OCR | 3B-A0.5B | 87.01 | 0.073 | 83.37 | 84.97 | 88.80 | 0.086 ||Unlimited-OCR|3B-A0.5B|93.23|0.038|92.61|90.93|94.07|0.045|| 相对提升 | – | ↑6.22 | ↓0.035 | ↑9.24 | ↑5.96 | ↑5.27 | ↓0.041 |从相对提升幅度来看公式识别Formula CDM的提升最为显著达到 9.24 个百分点文本编辑距离降低了 0.035表格 TEDS 提升了 5.96 个百分点阅读顺序编辑距离降低了 0.041。这些改进覆盖了所有任务维度说明 R-SWA 带来的收益并非局限于单一技能而是整体性地增强了文档解析能力。对比其他 SOTA 模型Unlimited OCR 的优势同样明显。DeepSeek-OCR 2 的 Overall 为 89.17Qwen3-VL235B为 89.15OCRVerse4B为 88.56dots.ocr3B为 88.41Gemini-2.5 Pro 为 88.03Qwen2.5-VL72B为 87.02。值得注意的是Unlimited OCR 仅使用了 3B 总参数量、0.5B 激活参数却在 9 类文档类型上全面超越了规模远大于自己的模型。论文对这一结果给出了一个合理的解释R-SWA 使模型强制聚焦于参考源与局部上下文避免了全注意力机制在长输出序列中可能出现的注意力发散现象从而在密集 OCR 任务上表现得更加稳定和精准。此外R-SWA 的页内状态转移方式是可行且稳固的模型虽然只通过一个宽度为 128 的滑动窗口看到少量历史输出 token但仍能通过因果地、连续地传递历史信息来清晰定位 OCR 进度。在 OmniDocBench v1.6 上Unlimited OCR 同样取得了端到端模型中的最佳成绩Overall 达到 93.92%。表 2 列出了关键对比数值模型SizeOverall ↑Text Edit ↓Formula CDM ↑Table TEDS ↑Table TEDS-S ↑Read-order Edit ↓HunyuanOCR1B89.950.08887.6891.0192.230.171DeepSeek-OCR 23B-A0.5B90.250.05091.8483.8987.750.144dots.ocr3B90.770.04889.9587.1890.580.138FireRed-OCR2B93.260.03795.4488.0491.060.131Logics-Parsing-v24B93.330.04195.6588.4291.980.137Qianfan-OCR4B93.900.04095.0890.5393.310.130Unlimited-OCR3B-A0.5B93.920.04295.7990.1693.320.129v1.6 的结果进一步验证了 v1.5 的结论在单页 PDF 级文档 OCR 任务中将全部标准注意力替换为宽度仅为 128 的 R-SWA 是有效且无损的。Unlimited OCR 在公式识别95.79上明显领先在文本编辑距离0.042上紧追最优模型在阅读顺序编辑距离0.129上取得了最低值。考虑到 FireRed-OCR 和 Qianfan-OCR 等模型使用的参数规模更大或训练数据更多Unlimited OCR 的竞争力更加突出。在推理速度方面论文在 OmniDocBench 上进行了实测。采用 Base DeepEncoder 模式Unlimited OCR 达到 5,580 TPStokens/s512 并发DeepSeek OCR 为 4,951 TPS提速约 12.7%。需要指出的是OmniDocBench 的平均文档长度相对较短在这个场景下 R-SWA 的恒定 KV cache 优势尚未充分展现输出序列越长Unlimited OCR 的相对优势越明显。子类分析进一步揭示了模型在不同文档类型上的表现差异。论文使用 OmniDocBench v1.5 提供的 9 种文档类型PPT、学术论文、书籍、彩色教材、试卷、杂志、报纸、笔记、研究报告进行细粒度对比比较模型为 DS-OCRDeepSeek OCR、DS-OCR 2 与 UOWUnlimited OCR指标为 Text Edit Distance 与 Reading Order Edit Distance。结果显示UOW 在全部 9 类文档、全部指标上均优于 DS-OCR这种全面优势排除了偶然因素说明 R-SWA 的收益在多样化的版式风格上具有一致性。与更强的 DS-OCR 2 对比时DS-OCR 2 仅在四个子指标上优于 UOW学术论文 Text0.013 vs 0.023、试卷 Text0.047 vs 0.049、试卷 R-order0.048 vs 0.049、研究报告 R-order0.011 vs 0.013。也就是说在 18 个对比点中UOW 在 14 个上领先文本编辑距离 9 类中 7 类、阅读顺序 9 类中 7 类。对于复杂版式PPT、报纸、杂志、笔记等UOW 没有劣势。这一结果表明R-SWA 对解析任务的适配是完整且可靠的论文将其称为“免费午餐”free lunch——替换注意力机制无需任何额外的训练成本或模型容量就带来了全面的性能提升。在长时解析的自建测试集上Unlimited OCR 的表现同样稳健指标2 页5 页10 页15 页20 页40 页Distinct-20 ↑99.76%99.78%97.49%99.92%98.73%96.08%Distinct-35 ↑99.87%99.98%99.83%99.99%99.89%96.90%Edit Distance ↓0.03620.04520.05260.07870.05720.1069在 2 页到 20 页的范围内Distinct-20 与 Distinct-35 均保持在 96%–100% 之间Edit Distance 维持在 0.036–0.079 的低水平。即使对于 40 页的极端长文档Edit Distance 仍低于 0.11Distinct-35 达到 96.90%。这一结果证明Unlimited OCR 在数十页连续输入的场景下依然能够保持可靠的转录质量。论文通过错误案例分析指出40 页场景下出现的重复性错误主要源于 PDF 中小字号文本难以辨认其根因是多页条件下 DeepEncoder 使用了 Base 模式1024×1024 分辨率低分辨率导致小字号字符的视觉信息模糊而非 R-SWA 在长时解析中失去方向。这个分析说明长时解析能力的上限在当前实现中主要受限于编码器的分辨率选择而非解码器的注意力机制。4.3 消融实验 / Ablation Study论文并未设置传统意义上的一组独立消融实验例如变换窗口宽度、对比不同参考段设置等但通过多个角度的对比分析实现了等效的消融结论。最核心的消融对比是 R-SWA 与标准全注意力的差异。由于 Unlimited OCR 与 DeepSeek OCR 共享完全相同的编码器、解码器架构、参数规模和训练数据分布唯一的区别是将所有 MHA 层替换为 R-SWA因此两者在 OmniDocBench 上的性能差异可以被严格归因于注意力机制的改变。v1.5 上 Overall 从 87.01 提升至 93.236.22%这一显著提升表明 R-SWA 在密集文档解析任务中不仅没有信息损失反而比全注意力更加高效。论文给出的解释是全注意力在长输出序列中可能发生发散而 R-SWA 的受限注意力范围强制模型将注意力资源集中于参考源与局部上下文从而提升了识别精度。R-SWA 的页内状态转移是可行且稳固的——模型虽然只看到一个宽度为 128 的滑动窗口但通过因果地、连续地将历史输出信息送入窗口它能够充分定位当前解码位置并保持输出的一致性。第二个消融维度是 R-SWA 与 vanilla SWA 的对比。虽然论文没有直接给出 vanilla SWA 在 OCR 任务上的数值结果但在方法部分阐明了 vanilla SWA 的根本缺陷当滑动窗口在解码序列上移动时早期输入中的视觉 token 会被逐渐挤出窗口导致模型对源文档的视觉记忆随时间推移而退化。R-SWA 的改进在于将视觉 token 与 prompt 作为固定参考段保留在注意力范围内不参与滑动状态更新从而避免了渐进模糊。这一设计选择虽然看似简单但对于长时 OCR 任务具有决定性意义——如果视觉信息在解码的中后段发生模糊后续页面的转录质量将无法保证。第三个维度是窗口宽度的影响。论文明确采用了n 128 n128n128的默认设置并且在单页 PDF 任务上验证了该设置“无损且有效”。从理论角度看n 128 n128n128意味着每个解码 token 可以看到约 128 个最近生成的 token。在 OCR 场景中这通常覆盖了当前行及前后几行的文本内容足以维持语言连贯性与格式感知同时由于视觉参考段始终可用模型可以通过跨模态注意力从源文档中获取精确的字形信息而不必依赖长距离的输出历史。虽然论文没有提供n nn取不同值如 64、256、512的系统性对比数据但从方法论角度看更小的n nn意味着更低的计算成本与内存占用而更大的n nn可能为需要长程输出依赖的任务提供冗余信息。在类似 R-SWA 的滑动窗口注意力研究中如 StreamingLLM 等窗口大小通常选择 128–256 的范围Unlimited OCR 的选择在此区间内是合理且经过验证的。第四个维度是“软遗忘”机制的行为验证。论文将 R-SWA 类比为人类抄写书籍时的认知行为并非记住全部内容而是以软性方式遗忘旧信息并用参考reference维持必要信息的可及性。这种机制在长时解析测试中的表现为模型在 20 页输入时保持强性能在 40 页输入时虽然出现一定退化但退化幅度有限Edit Distance 从 0.057 升至 0.107且退化原因被归因于编码器分辨率限制而非注意力机制失效。这间接验证了 R-SWA 的“软遗忘”设计在超长序列下不会导致灾难性遗忘catastrophic forgetting——即使模型已经生成了数万个 token它依然能够从参考段中检索视觉信息来指导当前输出。最后在效率层面论文通过对比理论推理性能上限验证了 R-SWA 在长序列下的恒速优势。在理想并发、prefill 长度固定为 10 的条件下两种模型的 TPS 上限如下模型25651210242048307240966144DeepSeek OCR7229.327468.277422.507166.856790.726430.215822.87Unlimited OCR7229.527714.787840.947881.117881.937905.187847.71在输出长度为 256 token 时两者速度几乎相同随着输出长度增长DeepSeek OCR 的 TPS 持续下降而 Unlimited OCR 保持稳定。到约 6,000 token 时Unlimited OCR 比 DeepSeek OCR 快约 35%。这一结果直接体现了 R-SWA 恒定 KV cache 的计算优势生成速度不受历史输出长度影响这正是长时 OCR 任务的关键需求。论文还对比了 Flash Attention v3 内核的单次调用耗时DeepSeek OCR 的标准 MHA kernel 每个解码 step 的延迟随 KV cache 长度增长而逐渐上升期间还会出现尖峰当 KV cache 长度跨越对齐边界时传输效率骤降Unlimited OCR 的耗时则保持平直。GPU 内存的使用模式也呈现同样的对比DeepSeek OCR 随输出长度线性增长Unlimited OCR 保持固定。五、相关工作 / Related Work文档解析 OCR 领域的发展路径可以清晰地划分为两个范式流水线式框架与端到端模型。流水线式框架是传统文档解析的主流方案其典型代表包括 PaddleOCR、PaddleOCR-VL、MinerU、MonkeyOCR、Dolphin 等。这类框架通常将文档解析分解为检测与识别两个阶段先由检测模型识别文档中的元素类型文本块、表格、公式、图片等再由多个专门的识别算子解析各块内的内容组件之间通过启发式策略如裁剪、矫正进行衔接。近期的演化趋势是保留检测模型、将多个识别模型合并为一个统一的 LLM 解码器或者两次调用同一个 LLM先进行 LLM 检测再执行裁剪策略最后进行 LLM 识别。流水线方法的优点在于模块化程度高、每个组件可以独立优化缺点同样明显错误会在组件之间累积传播整体流程受制于启发式策略的刚性且外部调度逻辑增加了系统的复杂性。端到端密集 OCR 模型如 Nougat、General OCR API、DeepSeek OCR、dots、OlmOCR则将文本检测与识别合并为单一函数一页内容可通过一次前向解析完成。这类方法对模型容量和训练难度要求更高但避免了流水线方法中的累积错误与调度开销。论文认为端到端方法的架构创新对于通用 VLM 的发展更有启发性因为它们本质上属于多模态大语言模型MLLM在密集文档理解任务上的应用。DeepSeek OCR 作为当前端到端 OCR 的代表提出了 DeepEncoder 高压缩编码器通过级联窗口注意力 ViT 与全局注意力 ViT 实现了 16 倍 token 压缩并采用 MoE 架构使推理激活参数仅 500M。然而所有这些端到端模型的解码器都采用标准全注意力因此 KV cache 随解码长度线性增长生成速度和内存占用随序列长度逐渐恶化。面对多页文档它们只能退化为逐页处理模式。Unlimited OCR 与上述所有工作的根本区别在于解码器的注意力机制。与流水线方法相比它是统一的端到端模型无需外部检测-识别模块协调与其他端到端模型相比它在解码器中引入 R-SWA使 KV cache 不随输出长度增长从而支持真正的一遍式长文档解析。与 vanilla SWA 相比R-SWA 将视觉 token 与 prompt 作为固定参考段始终全局可见避免了视觉特征因状态压缩而渐进模糊。与线性注意力linear attention相比R-SWA 不对参考 token 做循环状态更新保留了精确的注意力权重计算——视觉 token 的每个细节都可以在解码的任意位置被准确检索而不依赖于压缩状态中是否保留了相应信息。这一设计使得 R-SWA 在保持常数级计算成本的同时不牺牲视觉信息的精度这是线性注意力方案难以实现的。值得在相关工作的语境中特别指出的是 R-SWA 的通用性定位。论文明确将 R-SWA 定义为一种“通用的解析注意力机制”适用于所有“参考源 目标生成”范式的任务。ASR 中参考源是音频特征、目标是文本转写翻译中参考源是源语言文本、目标是目标语言翻译。这些任务与 OCR 共享相同的结构模型需要持续访问一个固定的参考源同时以滑动窗口的局部上下文维持生成过程。因此R-SWA 的设计理念不仅是解决 OCR 的长序列问题更是为参考类任务的注意力机制提供了一个统一的、高效的解决方案。这种跨任务的视角使其区别于仅为 OCR 定制的专用模块为后续研究开辟了更广阔的空间。六、局限性与展望 / Limitations Future WorkUnlimited OCR 虽然解决了解码过程中 KV cache 无界增长的问题但论文明确指出当前模型仍不能实现真正意义上的无限解析。首要限制来自 prefill 阶段虽然 DeepEncoder 具有很高的图像 token 压缩率每页 256 token但随着输入页数的增加prefill 序列仍会线性增长。在标准最大长度 32K 的约束下模型能够容纳约 100 页以上的视觉 token假设其他文本 token 占用少量空间但无法处理更长的手稿或学术专著。也就是说R-SWA 将生成阶段的计算成本从随输出长度线性增长优化为常数但尚未解决输入阶段随页数增长的问题。第二项限制与编码器的分辨率设置相关。在长时解析40 页场景下模型采用 Base 模式1024×1024 分辨率这导致小字号文本在视觉编码阶段就丢失了细节信息从而出现转录错误。论文通过错误案例分析指出这一问题的根因在于分辨率不足而非 R-SWA 注意力机制在长序列中的失效。将 Gundam 动态分辨率模式应用于多页输入或设计能够根据页面内容自适应调整分辨率的编码器可能是缓解该问题的可行路径但论文中未给出直接可用的解决方案。第三项限制在于实验覆盖范围的完整性。训练数据中单页与多页的比例为 9:1多页数据通过拼接合成而非来自真实的多页文档图像这可能限制了模型对真实长文档中跨页布局变化的适应能力。不过40 页测试结果在一定程度上表明模型已经具备了对长序列的鲁棒性。此外训练数据全部为 PDF 渲染图像未覆盖自然场景照片、手写文档等更广泛的 OCR 任务类型R-SWA 在这些场景下的表现尚不清楚。从训练策略上看DeepEncoder 被完全冻结。论文给出的理由是 DeepSeek OCR 的编码器已经足够优化但这也意味着视觉特征提取的表示能力完全继承自 DeepSeek OCR。如果未来在更长上下文或更高分辨率需求下需要调整编码器例如新增文档类型、适配视频输入R-SWA 是否仍然有效将需要重新验证。另外论文没有报告训练损失的收敛曲线或对窗口宽度n nn的系统性敏感度分析如n 64 n64n64、256 256256、512 512512对学习率、batch size 等超参数也未进行敏感性讨论。这些实验对充分理解 R-SWA 的鲁棒性是必要的但在当前论文中处于空白状态。展望方面论文提出了一条清晰的技术路线。短期目标是在更长上下文窗口上训练模型如 128K以支持更多页面的 prefill长期目标则是构建一个“prefill pool”让模型学会在生成过程中自动获取 prefill KV chunks——这相当于为模型赋予“翻页”的行为使其能够在读取到第 50 页时自动定位并加载第 51 页的视觉信息而无需将所有页面的视觉 token 一次性放入 prefill 序列。这一设想如果实现将真正突破 prefill 长度限制使无限长度解析成为可能。同时论文再次强调 R-SWA 的应用边界不限于 OCRASR、翻译等参考类长程解析任务同样可以使用该机制只需将参考 token 从视觉特征替换为声学特征或源语言文本特征即可。这些方向构成了未来工作的重要组成部分也为参考类任务的高效 MLLM 架构设计提供了新的思路。七、总结 / ConclusionUnlimited OCR 通过提出 Reference Sliding Window AttentionR-SWA成功地将端到端 OCR 模型从“KV cache 随输出长度线性增长”的困境中解放出来实现了长时解析任务中计算成本与内存占用的双重恒定。R-SWA 的核心设计智慧在于它模拟了人类抄写书籍时的认知模式持续访问参考源、仅保留极小数量的最近工作记忆、以软遗忘的方式自然丢弃无关的旧信息。这种设计不仅从机制层面解决了长序列生成的效率瓶颈而且在实验层面展现出令人意外的性能提升——将 DeepSeek OCR 解码器中所有标准注意力替换为 R-SWA 后模型在 OmniDocBench v1.5 上 Overall 从 87.01% 提升至 93.23%在 9 类文档类型上全面超越基线模型并超过所有更大规模的端到端模型。这些结果表明受限的、结构化的注意力模式在密集解析任务中可能优于无约束的全注意力模式因为它强制模型将有限的注意力预算聚焦在真正信息密集的区域。从更宏观的角度来看Unlimited OCR 的意义超出了 OCR 任务本身。它验证了一种新的架构范式对于所有“参考源 目标生成”类任务解码器的注意力机制不应该是无差别地关注全部历史输出而应该是结构化的两段式设计——参考段提供源信息的精确检索滑动窗口维持生成过程的连续性。这种范式不仅适用于 OCR也有望推广到 ASR、翻译、语音转写等场景使长时解析类任务不再受制于注意力机制的二次复杂度。R-SWA 以其简单、有效、通用三个特点为长时解析领域提供了一条具有启发性的研究路径。原文摘要:Recently, end-to-end OCR models, exemplified by DeepSeek OCR, have once again thrust OCR into the spotlight. A widely held view is that employing a large language model (LLM) as the decoder allows the model to leverage the prior distribution of language, leading to improved OCR performance. However, the downside is equally evident: as the output sequence lengthens, the accumulated KV cache drives up memory consumption and progressively slows down generation. This stands in stark contrast to humans, who exhibit no such decline in efficiency during long-horizon copying tasks. In this technical report, we propose Unlimited OCR, a model designed to emulate human parsing working memory. Taking DeepSeek OCR as the baseline, we replace all attention layers in the decoder with our proposed Reference Sliding Window Attention (R-SWA), which reduces attention computation costs while maintaining a constant KV cache throughout the entire decoding process. By combining the high compression rate of DeepSeek OCR’s encoder with our constant KV cache design, Unlimited OCR can transcribe dozens of pages of documents in a single forward pass under a standard maximum length of 32K. More importantly, R-SWA is a general-purpose parsing attention mechanism - beyond OCR, it is equally applicable to tasks such as ASR, translation, etc. Codes and model weights are publicly available at http://github.com/baidu/Unlimited-OCR.PDF链接:https://arxiv.org/pdf/2606.23050v1部分平台可能图片显示异常请以我的博客内容为准