阿里:端到端文档解析模型OvisOCR2
标题OvisOCR2 Technical Report来源arXiv, 2607.13639v1️文章简介研究问题如何在不依赖复杂流水线的情况下利用紧凑的端到端模型实现超越传统方法的文档解析性能主要贡献论文提出了OvisOCR2一个0.8B参数的端到端文档解析模型通过创新的数据引擎和训练策略在OmniDocBench等基准上取得SOTA成绩。重点思路构建混合数据引擎结合真实文档与合成数据。真实数据经专用OCR解析、规则清洗及人工抽检合成数据基于HTML模板生成确保图像与Markdown标注严格对齐覆盖长尾难例。多阶段训练策略首先对Qwen3.5-0.8B和4B模型进行监督微调随后在4B分支上使用GRPO算法进行强化学习引入文本、公式和表格的多组件奖励接着通过在线策略蒸馏将4B教师模型的知识迁移至0.8B学生模型最后进行模型融合。优化强化学习训练设计包含文本编辑距离、公式CDM和表格TEDS的综合奖励函数并采用分层并行和快捷路径优化奖励计算效率解决长序列生成的训练瓶颈。分析总结性能全面领先在OmniDocBench v1.6上获得96.58的最高分超越PaddleOCR-VL-1.6等主流流水线方法在PureDocBench上Avg3得分75.06同样位居第一。鲁棒性与泛化能力强在涵盖手写体和复杂表格的内部基准测试中OvisOCR2在整体得分、文本准确率及表格结构恢复上均表现最佳且表格缺失率显著低于对比方法。小模型潜力巨大证明仅0.8B参数的端到端模型通过高质量数据和精细化训练足以在结构化文档解析任务上击败参数量更大或架构更复杂的流水线系统。个人观点论文打破了端到端模型性能不及流水线的刻板印象成功关键不仅在于模型架构更在于构建了高保真的合成数据闭环以及“大模型RL引导小模型蒸馏”的高效训练范式。