
这项由芬兰阿尔托大学计算机科学系团队完成的研究以预印本形式于2026年7月27日公开发布在arXiv平台编号为arXiv:2607.24651v1归属计算机视觉cs.CV方向。有兴趣深入了解的读者可通过该编号查询完整论文。**一、先讲一个AI答对了但找错地方的故事**假设你手里有一份长达二三十页的技术规格说明书你想知道里面用了什么材料来制作内部接触针。一款先进的AI视觉模型给出了正确答案磷青铜。很好回答准确。但当你追问你从哪里看出来的AI给你画出了一个框——而那个框框在说明书的第二页上完全圈住了一块错误的区域跟实际包含磷青铜字样的那行文字毫无交集。这不是某一款AI偶尔犯的小错误而是目前几乎所有开放视觉语言模型都面临的系统性困境。这种现象有个专门的名字叫做**归因幻觉**——模型回答正确但证据指向错误。这就像一个学生考试答对了但在作答来源那栏随手填了一个不相关的参考书页码。答案正确并不能说明他真的理解了知识来源。阿尔托大学的研究团队深入研究了这个问题并提出了一种完全不同的解决思路与其让AI去画框定位不如让AI用语言引用原文然后再由一个独立的检索系统把引用的文字对应回文档上的具体区域。这个思路听起来简单但它带来的效果差异相当显著——归因幻觉率从最高97%骤降至28%证据召回率从个位数提升到了50%以上。**二、为什么AI总是答对却找错——坐标接口的先天缺陷**要理解这个问题先理解AI在视觉文档中是怎么标注证据位置的。目前主流的做法是让AI直接输出一串数字坐标类似这样的格式。这串数字代表文档第二页上一个矩形区域的左上角和右下角位置。这种方式源自计算机视觉里的目标检测技术——检测一只猫在照片里的位置就是用这种坐标框框来标注的。然而把这种目标检测式的坐标输出用在文档理解上存在一个根本性的问题。打个比方你去图书馆找一本书图书馆员工说那本书在北侧书架第三排从左边数第七本的附近。这个描述很粗糙你大致找对了那片区域但具体是第六本还是第八本你未必能精准找到。坐标输出就面临类似困境——语言模型擅长理解内容和逻辑但要求它精确输出一个像素级别的矩形坐标等于让一个文学学者去做精密的几何测量这不是他的强项。研究团队做了一个关键实验来验证这一点。他们在CiteVQA这个专门评估文档证据归因能力的基准测试集上测试了六款来自四个不同家族的开放视觉语言模型参数规模从80亿到310亿不等。结果显示在坐标输出模式下六款模型的证据方框召回率即模型标出的框框有多少真正覆盖了答案所在的文档元素最高只有8.1%最低只有0.3%。换句话说即便AI答对了问题它画出的那个框有82%到97%的概率是错的。更有意思的是团队还观察到一个细节当要求一款310亿参数级别的模型输出坐标时该模型在三分之二的情况下根本没有给出可以解析的坐标而是用语言描述了证据位置比如第十页第七步的标题下方、补充材料二里写道。这个模型被要求用坐标语言说话却本能地用文字语言来表达位置信息——这恰恰说明模型的内部能力其实并没有缺失缺失的只是一个合适的表达接口。**三、换一种表达方式——引用原文而非画框定位**研究团队提出的替代方案可以用一个日常场景来理解。假设你在读一本厚厚的法律合同律师朋友帮你解读了关键条款并告诉你证据在哪里。有两种方式第一种律师拿起笔在几百页的合同里估摸着某个位置画了个圈第二种律师直接把原文念给你听第十二条第三款写道乙方须在收到通知后三十日内……然后你拿着这段原话去合同里精确定位。显然第二种方式更可靠而且更能体现律师真的读懂了合同。研究团队的语言接口正是基于这个原理。在这种模式下AI不再输出坐标而是输出一个JSON格式的回答包含两部分答案文本以及一组逐字引用verbatim quote——AI从文档中原文摘录出支持答案的关键文字片段可以是一个句子、一个表格行、一条图注或一段说明文字。仅仅输出文字引用还不够还需要把这段引用对应回文档页面上的具体区域。这个任务由一个独立的检索流程完成首先一个文档排版解析工具研究中使用的是MinerU把文档的每一页分割成若干语义块每个语义块对应一个段落、表格、图表或图注然后一个多模态编码器Qwen3-VL-Embedding-2B把AI输出的文字引用和文档里每个语义块的图像截图都转换成高维数字向量可以理解为每段内容的数字指纹最后通过计算引用和语义块之间的相似度用匈牙利算法做一对一的最优匹配找出每条引用最有可能来自的那个语义块该语义块的页码和坐标就成为最终的证据区域。这个流程把精确画框这件难事从AI模型本身的工作中剥离出来交给了更擅长做精确匹配的检索系统。AI只需要做它最擅长的事理解内容并用语言原文引用证据。值得一提的是为什么用图像截图而不是直接用文字来做匹配研究团队发现大约有三成的证据内容是非文字性的比如表格、图表等。对于这类内容AI会通过引用它们的图注caption或附注note来间接引用而将图注文字与语义块截图进行跨模态的图文匹配往往比纯文字匹配更准确因为渲染在页面上的表格外观与纯文字描述在语义空间中差异很大。**四、实验结果证据找对了答案也没变差**研究团队在一个经过人工核实的CiteVQA子集上进行了系统评测这个子集包含719个双语中英文问题覆盖440份PDF文档文档页数中位数为34页最长达182页。对比实验的设计非常干净六款相同的AI模型完全相同的输入文档和问题唯一改变的是证据表达接口——一组用坐标输出一组用语言引用输出。在坐标接口下六款模型的证据方框召回率IoU≥0.5分别是0.3%、1.3%、4.0%、8.1%、0.3%和7.8%归因幻觉率即答对了但证据找错了的比例分别高达97%、92.1%、87.3%、82.1%、95.9%和87.1%。切换到语言接口后同样这六款模型的证据召回率变成了39.9%、34.9%、25.9%、46.9%、29.9%和44.5%归因幻觉率降至41.2%、47%、65.4%、40.5%、48%和38.6%。每款模型的召回率都提升了二三十个百分点归因幻觉率大致砍半。更关键的一点是答案质量几乎没有变化。五款模型在两种接口下的答案质量评分相差不超过2.3分满分100分换算说明换用语言引用方式并没有让AI回答得更差只是让它的证据引用变得更准确了。其中一款80亿参数的小模型因为同时要输出答案和引用输出预算相对紧张答案质量下降了约6分是个例外。不同的IoU阈值分析揭示了两种接口的本质差异。坐标接口下从找到正确页面到框住正确元素准确率急剧衰减——以一款模型为例页面级别的命中率是30.7%但到了IoU≥0.1的元素级别就跌至5.8%到IoU≥0.7则归零。坐标框框能找到大致正确的页面但无法精确覆盖正确的元素。语言接口则截然不同从IoU≥0.1到IoU≥0.7召回率几乎持平约在39%到42%之间——因为一旦通过语义检索找到了正确的语义块这个块的边界就是由排版解析工具精确定义的不存在找对区域却框错边界的问题。**五、到底是哪个环节救了证据归因——拆解实验**语言接口相比坐标接口增加了三个新组件排版解析工具、多模态检索器和匈牙利匹配算法。那么功劳到底归谁研究团队做了一系列拆解实验来回答这个问题。第一个实验叫坐标对齐块边界保留坐标接口的输出但把每个预测出来的坐标框强制对齐到同一页面上重叠面积最大的语义块。这样做之后坐标接口的阈值衰减问题消失了因为现在用的是语义块的边界而非模糊的坐标但整体召回率依然很低六款模型的对齐后召回率在5%到23.5%之间。这说明单纯给坐标接口换上精确的元素边界并不能显著提升效果——真正的问题在于坐标接口根本没有找到正确的页面或区域。第二个实验测试只用问题去检索不用AI输出任何内容直接把问题本身当作查询词用相同的多模态检索器在文档里找对应数量的语义块。结果这种方式的召回率普遍低于语言引用方式差距在13到19个百分点之间。这说明并非检索器本身足够强大而是AI输出的文字引用提供了额外的定位信息。第三个实验更有意思用问题加上AI生成的答案一起去检索。这时候召回率和语言引用方式相近甚至偶尔更高。研究团队认为这是因为答案文字本身也编码了与证据位置相关的信息而引用和答案其实是同一理解能力的两种表达。为了验证两者的互补性研究团队进一步计算了引用检索和问题答案检索在每道题上取最优的联合召回率发现平均可以达到51.9%而引用贡献了其中额外的11.1个百分点覆盖远超只换一个查询词带来的2.4个百分点提升。这意味着引用和答案在不同题目上捕捉到了不同的位置信息两者并不冗余。第四个实验比较了不同的文字匹配方式词符重叠匹配lexical和BM25检索与多模态图文嵌入检索相比前两种方式的召回率低了5到14个百分点。这证明跨模态的图文嵌入检索确实比单纯的字面匹配更有效尤其是在处理AI输出了近义改写而非完全逐字引用的情况下。**六、无需标注区域的强化学习训练——让模型学会更好地引用**语言接口虽然已经大幅改善了证据归因但研究团队进一步思考能不能通过训练让AI主动学会更好地引用证据而不依赖任何人工标注的区域坐标这个问题的实践价值在于收集长文档中每个证据区域的精确坐标标注成本极高。而如果可以只用问答对问题加参考答案来训练就能大幅降低训练数据的获取成本。研究团队设计了一套基于GRPO一种强化学习算法全称为群体相对策略优化的训练方案。具体做法是让模型对同一个问题生成多个不同的回答每个回答都包含答案文字和若干文字引用然后通过前面描述的检索流程把引用对应回文档页面上的具体语义块截图接下来一个独立的裁判AI研究中用的是Qwen3.5-9B同时看到问题、参考答案、模型答案和对应的语义块截图给出三个分数答案正确度、证据相关度、证据覆盖度。奖励函数的设计巧妙地体现了归因幻觉的本质奖励等于答案正确度乘以证据得分的平均值。这个乘法结构意味着只有当答案本身正确时证据质量才会被纳入奖励计算——这精确地针对了答对但引证错这个问题。如果答案就是错的证据再好也没用如果答案正确但引证一塌糊涂奖励也会被大幅压低。这个奖励信号完全不依赖任何区域坐标标注只需要QA数据集里自带的问题和参考答案。裁判AI看的是检索到的语义块截图而不是模型输出的原始文字引用这确保了一个流畅好听但实际对应错误区域的引用无法骗过评分。训练数据使用了从LongDocURL数据集构建的1584个长文档问题在一款80亿参数的基础模型上用LoRA一种低秩适配微调技术可以理解为对模型做局部精调而不改动大部分参数进行了三轮训练共144步。整个训练过程在三块H200 GPU上运行了约28小时花费约85 GPU小时。训练结果相当明显。与未经训练的同款模型相比经过GRPO训练后证据召回率从39.9%提升到51.3%严格归因准确率即答案正确且证据充分的比例从22.4%提升到33.8%归因幻觉率从41.2%降至28.4%。从训练动态来看提升主要来自证据覆盖度这个指标——模型学会了引用更多之前遗漏的证据而不只是让现有引用更精准。研究团队还进一步验证了这些额外引用是否真的有价值还是只是堆砌无关内容来骗取奖励。他们用一个更严格的评估标准要求答案质量和证据相关度都达到4分以上不考虑召回率训练后模型的得分从19.1%提升到27.4%统计检验的p值为6×10??说明额外引用确实指向了有价值的支持内容而非刷分噪声。**七、研究的边界与尚未解决的问题**研究团队在论文中诚实地指出了这套方法的局限性。在方法层面这套流程并没有教会模型独立进行精确的空间定位——模型只负责写引用页面定位的工作依赖排版解析工具和检索器。排版解析工具的上限就是整套系统的上限如果文档是扫描图像、排版解析完全失败整套流程就无从发挥。研究实测的解析工具上限即假设检索完美情况下的最高可达召回率在IoU≥0.5时约为88.2%留有约12%的不可达空间。对于纯图形类证据没有任何文字图注的图表语言引用无法捕捉系统会沉默地忽略这类证据——这是一个真实的盲区。此外每道题的引用分配使用的是一对一的匈牙利匹配这意味着一条幻觉引用引用了文档中根本不存在的内容依然会被强制对应到某个相似度最高的语义块而不是被识别为无效。不过研究团队也展示了相似度本身可以用作可信度信号相似度越高命中率越高通过设置阈值拒绝低相似度的引用可以在召回率和精准度之间做权衡。在评估层面实验使用的是单一文档场景跨多文档的证据归因比如同时检索多份报告中的证据没有覆盖。评估结果也依赖AI裁判的主观打分裁判模型本身的偏差会渗透进评分结果。**八、这件事对你我意味着什么**归根结底这项研究触碰了一个真实而重要的需求。当我们把AI用在需要负责任的场景——比如医院里查阅病历指南、律师事务所检索合同条款、金融机构核对招股说明书——给出正确答案还远远不够必须同时提供答案来自哪里的可验证路径。如果AI指向了错误的证据区域用户无法有效核查AI的回答就依然停留在一个黑盒子里。而这项研究展示的路径在于不需要重新训练模型学会精确画框不需要标注海量的区域坐标只需要让模型做它本就擅长的事——用语言引用原文——然后用一个外部的检索流程完成精确定位。这种分工把问题难度降低到了可解范围之内。进一步地研究提供了一个只用问答数据就能做训练的强化学习方案意味着在任何已有QA数据集的场景下都有可能用这套方法去改善模型的证据引用质量而不需要额外花费大量成本去标注文档的区域坐标。当然这不是终点。模型仍然无法自主处理纯图形证据排版解析的上限依然存在跨文档场景的验证也尚未完成。但从归因幻觉率高达97%到降至28%这个跨度在现实应用中的差距已经足以把一个基本不可用的工具变成一个值得认真考虑的可用工具。有兴趣深入了解技术细节的读者可以通过arXiv编号2607.24651查阅完整论文原文包含所有提示词模板、超参数设置和统计检验结果研究团队也承诺将公开评估代码和训练配置以便复现所有实验结果。---QAQ1归因幻觉是什么意思AI为什么会出现归因幻觉A归因幻觉是指AI回答了正确的答案但它指向的证据区域是错的。出现这个问题是因为现有系统要求AI直接输出坐标数字来定位证据区域但语言模型并不擅长精确生成像素级坐标往往在大致正确的页面附近随机生成一个框而这个框并不真正覆盖答案所在的文字位置。Q2语言接口方案需要重新训练AI模型吗A不需要重新训练就能大幅提升效果。语言接口的核心改变是让现有模型输出文字引用而非坐标然后由外部的排版解析工具和检索系统完成精确定位。研究中测试的六款模型在不做任何训练的情况下证据召回率就从个位数提升到了25%至47%。额外的GRPO强化学习训练可以进一步提升效果但并非必要前提。Q3这套方法对扫描版PDF文档有效吗A效果会大打折扣。该方法依赖排版解析工具将文档分割成可检索的语义块而扫描版PDF通常没有可提取的文字层解析工具难以正常工作。研究团队也在论文中明确指出这是当前方法的一个重要局限对扫描型文档的处理效果尚未经过系统验证。