一个 0.7B 的小模型在文档解析上打败了一个 3B 的大模型。而且那个视觉编码器还小了整整 11 倍。这不是什么海外的实验室。是华中科技大学和金山办公一起做的叫 MonkeyOCRv22026 年 7 月刚发出来。论文链接https://arxiv.org/pdf/2607.11562v1还不止这一组。他们还做了一个 110M 的小模型叫 UniMERNet-T在公式识别上打败了 325M 的 UniMERNet-B。在 OmniDocBench 这个综合榜单上0.7B 的 MonkeyOCRv2 超过了 Qwen3-VL-235B也超过了 GPT-5.2。我把这篇论文从头到尾啃了一遍。然后发现这不只是一个「小模型打败大模型」的故事。这背后藏着一个更深的判断文档 AI 一直用错了「眼睛」。现在的 AI为什么看不懂文档要理解 MonkeyOCRv2 为什么这么强得先搞清楚一个问题。现在的 AI为什么看不懂文档你可能觉得奇怪。AI 不是能识别图片吗GPT 都能看图了怎么就看不懂文档差别就在这里。你看一张猫的照片和看一份合同是两种完全不同的任务。猫的照片你只需要认出「这是一只猫」。但合同里一个小数点挪一位金额可能差十倍。一个上下标写错化学式可能变成另一种物质。自然图像关心的是**「这是什么」。文档图像关心的是「每一个字符长什么样」**。这是两种完全不同的视觉感知需求。但问题来了。现在主流的视觉编码器CLIP、SAM、DINO全都是在自然图像上训练的。它们擅长识别物体但不擅长看清每一个字符的笔画。就像一个习惯了看风景的人突然让他去看密密麻麻的小字他会觉得模糊。这就是 MonkeyOCRv2 论文里说的表征不匹配。自然图像的编码器压根不是为文档设计的。说真的我也理解为什么之前大家都这么做。CLIP 这些编码器都是大公司花了大价钱训出来的拿来用多省事何必自己从头训一个呢。而且以前文档 AI 也不像现在这么火大家都觉得「够用就行」。但 MonkeyOCRv2 这篇论文就是在说「够用」和「好用」之间差着一整个范式。它是怎么做到的那 MonkeyOCRv2 怎么解决这个问题的它做了一件很简单但很关键的事给文档 AI 训练一双「专门看文档的眼睛」。具体怎么做呢它用了两个训练目标。一个是文本生成让模型学会理解文字的意思。另一个是像素级重建让模型学会看清每个字符长什么样。这两个目标看起来不一样但配合起来特别有意思。文本生成负责「理解」就像你读完一段话知道这段话在说什么。像素级重建负责「看清」就像你能把这段话里的每一个字一笔一画地还原出来。一个管语义一个管细节。双管齐下。这就是它说的双目标预训练。「看清」和「猜出」的区别为什么要同时用两个目标只用文本生成不行吗论文里做了一个很巧妙的实验来回答这个问题。它把正常文档里的文字顺序打乱变成乱码然后看模型还能不能识别。这叫**「扰乱文本实验」**。这个实验的逻辑特别精彩。如果模型真的在「看」每个字符那文字顺序乱了它应该照样能认出来。但如果模型是在靠语言上下文「猜」答案那文字一乱它就露馅了。结果发现现有的很多视觉模型在文字被打乱后准确率掉得特别厉害。有的掉了将近 30%。这说明什么说明它们根本没在「看」它们在「猜」。靠语言上下文猜答案看起来很聪明但一旦遇到不按常规出牌的文档比如公式、表格、乱码就会翻车。而 MonkeyOCRv2 因为有像素级重建这个目标它真的学会了「看」每个字符。在 448 分辨率下它的语义文本和扰乱文本之间的准确率差距从 29.3% 降到了 15.3%。这个数字听着有点绕你只要记住一件事就行。它比别的模型更接近「真的在看」而不是「在猜」。它真的更可靠吗「看清而非猜出」还有一个特别重要的好处。模型不会「编造」答案。这一点用 CHAOS-Bench 这个幻觉评估测出来了。所谓幻觉就是 AI 一本正经地胡说八道。你给它一份文档它看不懂的地方不承认看不懂而是编一个答案给你。这在文档处理里是很危险的。合同金额看错一个零或者条款识别错了后果很严重。MonkeyOCRv2 在 CHAOS-Bench 上拿了最优超过了 HunyuanOCR-1.5 3.7%。这个数字背后是它的「看清」能力在起作用。因为它真的在看每个字符而不是靠上下文猜所以它不需要编。看不清就看不清不会硬编一个答案出来。不只是文档解析强而且这个能力不是只在文档解析上有用。论文里有一个数字特别能说明问题。把 MonkeyOCRv2 的视觉编码器换到其他模型上7 个任务全面提升。文本识别提升 5.4%公式识别提升 4.6%文本检测提升 3.3%。文档篡改检测提升 7.5%这个数字很猛。重叠文本分割提升 5.3%文档解析提升 2.8%文档理解提升 13.2%。你看文档理解提升 13.2%。这说明它的「看清」能力是通用的。不管你拿它去做什么文档相关的任务它都能帮上忙。因为它解决的是最底层的问题视觉表征。把数字摆出来看光说「打败」可能有点虚我把论文里的两个关键表格拉出来你直接看数字。第一个是 MDPBench一个覆盖 17 种语言的多语言文档解析榜单。这个表里有几个数字值得注意。MonkeyOCRv2-B-Parsing 的 overall 得分是 83.3。之前开源最好的 dots.mocr 是 80.5它是 3B 的模型。MonkeyOCRv2 用一个 0.7B 的小模型把分数提高了 2.8 个点。而且它的视觉编码器只有 dots.mocr 的 1/11 大小。0.9B 的 PaddleOCR-VL-1.6 只有 75.0差得更远。这是开源模型里的对比。再看第二个表OmniDocBench 1.6一个中英文档的综合评估。这个表更有意思。MonkeyOCRv2-Parsing 超过了 Qwen3-VL-235B也超过了 GPT-5.2还有 InternVL3.5-241B 和 Kimi K2.5。这些都是几百亿、上万亿参数的通用大模型。MonkeyOCRv2 用 0.7B 的体量在文档任务上把它们赢了。不过这个表也得说清楚。它超过的是通用 VLM在专项文档模型里GLM-OCR、MinerU2.5-pro、PaddleOCR-VL-1.6、HunyuanOCR-1.5 这些还是比它强。论文也老老实实承认了这一点。这是系统级对比比的不只是视觉编码器还有训练数据、后训练、布局模块、推理流程这些。所以这个对比不能完全归因于编码器但至少说明 MonkeyOCRv2 这个系统整体已经很有竞争力。它的「底子」是什么能有这样的能力离不开它的训练数据。MonkeyOCRv2 用了一个叫 MonkeyDoc v2 的数据集。1.13 亿张文档图像覆盖 17 种语言。这是目前已知最大的文档预训练语料库。这个数据集不是随便凑的。它覆盖了各种类型的文档论文、表格、公式、票据、手写体。让模型在训练阶段就见过足够多的「字符长什么样」。这是它以小博大的底子。没有这个数据集再好的方法也使不上劲。文档 AI 需要自己的眼睛写到这我想把话题拉回最开始那个数字。0.7B 打败 3B。这不是一个偶然的数字胜利。它背后是一个判断文档 AI 不应该借用自然图像编码器。文档 AI需要自己的「眼睛」。过去几年大家都在用 CLIP、SAM、DINO 这些在自然图像上训练的编码器去做文档任务。能用但用得别扭。就像让一个习惯了看风景的人天天去看密密麻麻的小字。他看得见但看不清。MonkeyOCRv2 做的事情是给文档 AI 训练一双专门看文档的眼睛。用文本生成加像素重建让它学会看清每一个字符。结果就是更小的模型更准的结果更少的幻觉。所以这不是又一个更强的 OCR 模型。我突然想到一个事。人类花了几千年才明白看和看见是两回事。一个婴儿生下来就能看但要学会真正「看见」细节得花好几年。AI 也是一样。能识别图片和能看清每一个字符中间差的不只是参数量是认知方式的转变。MonkeyOCRv2 做的就是让文档 AI 完成这一步。从「能看」到「看清」。感谢阅读。点个关注不迷路我们后续会持续跟进文档解析、OCR领域的前沿技术动态第一时间为你解读。