
超越Top-K用可解释智能体操作替代黑盒检索论文原链接https://arxiv.org/html/2608.06305v1摘要当前检索增强生成RAG主流范式为「文档分块→嵌入编码→召回Top-K相似片段」。本文针对财报、审计报告、监管申报这类高度表格化文档论证该架构存在结构性缺陷并提供可量化实证。以780页印度古吉拉特政府财政报告为测试载体文档86.8%内容为表格行存在上万组近似数值数值对应的单位、财年表头平均距离该行13行固定分块极易将数字与单位拆分造成百倍量级计算偏差。本文构建最优分块基线表格感知分块器即便遍历所有分块尺寸仍有27%~30%数值分块无法匹配对应财年表头。为此提出Read无嵌入智能体检索框架基于Model Context Protocol暴露三类确定性文档操作标准化词法检索、文档结构导航、有界区间读取。智能体可迭代组合工具完成查询完整执行轨迹可复现、可审计。在51道经过人工核验的财务问答任务上Read准确率58.8%稠密Top-K检索仅15.7%Holm校正p2×10−5p2\times10^{-5}p2×10−5即便调优稠密检索至最优参数最高仅35.3%Read仍领先23.5个百分点KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲p0.017\)。同等智能循环、仅将检索工具替换为向量Top-K的对比系统仅27.5%证明性能差距来源于检索接口本身而非多轮迭代能力。额外对比BM25稀疏检索二者准确率无统计学差异本文结论可区分嵌入类检索与纯词法无嵌入检索而非智能检索与传统检索的优劣。关键词检索增强生成、智能体工具调用、可解释检索、长结构化文档、财务文档问答目录1 引言2 相关工作2.1 RAG系统完整组件梳理2.2 长文档与结构化文档检索2.3 智能体检索与工具使用2.4 直接文档交互vs稠密向量检索3 两类检索接口形式化定义3.1 接口A嵌入介导Top-K检索3.2 接口B可解释智能体Read操作集3.3 确定性与可审计性说明4 实验载体量化分析4.1 测试文档基础信息4.2 文档结构与数值分布特征4.3 分块机制带来的信息丢失量化5 Read框架实现细节5.1 MCP服务四大核心工具5.2 标准化匹配解决PDF转换失真5.3 PDF转换性能天花板固有信息损耗6 评测实验方案6.1 对比系统完整清单6.2 财务问答基准数据集构成6.3 三重独立评测指标7 预实验现象观测8 完整实验结果8.1 主实验整体准确率对比8.2 无显著结论的对比项说明8.3 性能差距来源拆解8.4 无答案任务系统表现8.5 各方案调用成本、时延对比9 研究局限性10 结论1 引言检索增强生成RAG是大模型外接外部知识的标准方案。行业标准流程语料预分割文本块、通过双编码器生成稠密向量查询时返回余弦相似度最高的Top-K片段拼接进提示词。十年来分块策略、嵌入模型、重排算法持续迭代但底层范式从未改变检索基于离线固定分块模型无法干预、校验检索逻辑只能被动接收不可解释的相似文本。该范式在财报、审计、法定报表类文档存在结构性失效。此类文档三大核心特征内容以表格为主占比超85%海量近似数值嵌入空间大量数值向量高度重叠数值单位、财年定义存储在上方远处表头分块极易割裂数值与释义。典型示例查询2024-25财年财政赤字与财政盈余差值两个数值相隔47行任意固定2000字符Top-K分块都无法同时召回两行稠密检索直接返回缺失单条片段模型无法计算差值更危险场景召回数值缺失单位表头lakh十万与crore千万相差百倍模型输出完全失真且无任何提示。本文三步完成论证量化结构化文档的数值、表头距离特征测算分块造成的信息丢失比例构建表格感知强化分块器作为最优稠密基线消除分块优化带来的变量干扰设计Read无嵌入智能体检索框架与稠密、稀疏、混合检索、智能向量检索做完整对照实验。核心贡献对政府财政长表格文档做结构化量化分析首次量化数值与单位表头行间距离、分块信息丢失比例实现表格感知最优稠密检索基线证明分块调优仅能解决单位缺失问题无法消除财年表头丢失固有缺陷提出Read MCP无嵌入检索服务提供完整可审计迭代检索流程全部代码开源标准化三重独立评测指标精确数值匹配、LLM人工打分、证据可溯源校验设计成对统计检验方案完备对照实验控制变量证明性能优势来自检索接口而非多轮迭代能力区分嵌入检索/词法检索两类体系的性能差异。2 相关工作2.1 RAG系统完整组件稠密段落检索DPR奠定双编码器嵌入检索路线后续ColBERT晚交互、稀疏SPLADE、重排算法持续优化但均依赖离线固定分块。BEIR基准证明BM25词法检索零样本性能远超轻量稠密模型。现有RAG系统高度依赖分块尺寸、嵌入版本线上服务向量模型迭代会造成检索效果静默漂移Self-RAG引入检索自省但底层仍使用固定向量索引。长文本上下文「中间遗忘」缺陷进一步放大Top-K检索短板。2.2 长结构化文档检索表格类文档专用方案如SpreadsheetLLM、FRTR需构建多层表格嵌入定制化索引成本极高超长全文上下文方案无需检索但token成本极高且存在位置衰减。本文反向思路不预分割文档让智能体按需定位、读取任意文本区间避免离线分块固有缺陷。2.3 智能体检索与工具调用ReAct、多跳检索等方案将检索融入推理循环但底层仍依赖向量检索工具SWE-Agent、Agentless证明基础文本查找工具可媲美复杂智能框架Model Context ProtocolMCP标准化工具调用接口Read是面向单份长文档专用MCP检索服务区别于代码仓库工具链。2.4 直接文档交互vs稠密检索Grep类原生文本检索相关工作证明原始词法检索在对话日志、代码库场景优于向量检索但现有研究针对多文件检索本文聚焦单份超长表格PDF解决PDF转换单元格拆分、数字千分位失真独有问题同时新增可审计性、结构化表头导航设计。3 两类检索接口形式化定义设文档D(ℓ1,ℓ2...ℓL)D(\ell_1,\ell_2...\ell_L)D(ℓ1,ℓ2...ℓL)有序行序列KaTeX parse error: Cant use function \( in math mode at position 1: \̲(̲S(D)\)为文档结构映射u(ℓ)u(\ell)u(ℓ)为每行数值单位映射函数。3.1 接口A嵌入介导Top-K检索离线阶段预分割文档为固定文本块cjc_jcj嵌入模型EEE生成向量vj\mathbf{v}_jvj查询时计算查询向量与块向量余弦相似度返回前K个块Rk(q)argtop-kjE(q)⋅vj∥E(q)∥∥vj∥R_{k}(q)\operatorname{argtop-k}_{j}\frac{E(q)\cdot \mathbf{v}_{j}}{\lVert E(q)\rVert\lVert\mathbf{v}_{j}\rVert}Rk(q)argtop-kj∥E(q)∥∥vj∥E(q)⋅vj三大固有缺陷有损压缩文本信息压缩至低维向量细微数值、表头差异丢失固定预算无论需要几行文本强制返回K块黑盒不可解释仅提供相似度分数无法溯源文本未召回原因结构化文档特有缺陷分块预先划定边界无法保证数值行携带上方单位/财年表头。3.2 接口B可解释智能体Read操作集Read不构建任何向量索引直接操作原始Markdown文档暴露四大MCP只读工具memory_grep(p)标准化词法匹配返回匹配行号、原文、页面位置memory_outline()输出全文标题层级、每行起止页码memory_list()目录文件枚举多文档场景memory_read(start,end)读取指定起止连续文本行单次读取上限400行。智能体循环组合工具先检索关键词、查看文档大纲、按需读取对应区间每一步操作可完整记录形成可回放检索轨迹。核心优势读取区间在查询后动态确定可向上扩展读取表头行离线分块无法实现该逻辑。3.3 确定性与可审计性Read所有工具输入输出为纯文本确定性映射同一文档同一参数永远返回相同结果每条答案可追溯检索轨迹内全部原文行可机械校验答案数字是否存在读取文本中。Top-K系统仅能证明答案存在召回块无法证明关键证据为何未被检索审计存在盲区。4 实验载体量化分析4.1 测试文档基础测试文档《古吉拉特2024-25财政账目第一卷》官方审计PDF780页3.97MB转换后Markdown共19198非空行。转换工具筛选对比pymupdf4llm/cloudconvert/markitdown/docling仅pymupdf4llm可保留表格行列对应关系。4.2 文档核心量化特征指标数值有效非空文本行19198表格行占比86.8%总数字token58791独立不同数值15960数值重复倍率3.68倍单位表头中位数距离数值行13行90分位26行文档海量近似数字向量检索极易混淆数值单位定义普遍在十几行上方固定分块极易割裂数字与释义。4.3 分块机制信息丢失量化设计表格感知智能分块器分块时自动向上回溯最多200行携带单位、财年表头。测试800~4000字符多档分块尺寸普通固定分块800字符时67.4%数值块无单位表格感知分块同尺寸仅0.3%无单位固有缺陷无论分块多大27%~30%数值块无法匹配财年表头该比例不随尺寸变化。本质原因财年表头跨多页表格离线分块无法预判查询需要的财年上下文。5 Read框架实现细节5.1 MCP四大工具完整逻辑全部工具沙盒锁定文档根目录禁止跨文件读取单次读取行数做硬上限防止上下文溢出无嵌入模型、无训练参数仅基于原始文本操作。5.2 标准化匹配解决PDF转换失真PDF转表格会产生三大失真千分位逗号、单元格分割单词、小数点拆分至下一行。Read对每行构建双重标准化镜像清除表格竖线、加粗标记删除数字千分分隔符检索同时匹配原始文本、标准化文本解决数字反向查询失效问题 ablation实验证明标准化匹配直接提升10%问答准确率。5.3 PDF转换性能天花板PDF转换存在固有信息损耗数字、小数点拆分至不同单元格任何检索系统都无法复原原始数值该问题与检索架构无关因此实验单独划分「转换受限题目」不计入检索性能对比。全文档共483处转换缺陷仅0.09%数值行存在百倍量级数字失真。6 评测实验方案6.1 全部对比系统Read完整四工具智能检索Read-lit消融关闭标准化匹配Read-out消融移除大纲导航工具Dense表格感知分块BGE稠密Top-KBM25稀疏词法检索基线Hybrid稠密BM25互反融合重排AgenticVec同智能循环底层替换为向量检索工具LongCtx全文一次性塞入上下文Oracle完美分块黄金基准。AgenticVec为核心对照控制智能循环完全一致仅更换检索接口分离迭代收益与检索接口收益。6.2 基准数据集构成共51道人工核验财务问答六类题型单数值查找24题多行聚合计算5题跨表算术差值9题文档结构导航6题转换受限题目2题PDF失真无解无答案虚假前提5题。标准答案全部机械校验算术题答案原文不存在仅可通过多行数字计算得到每道题标注证据原文行号。6.3 三重独立评测指标精确数值准确率标准化数字相对误差0.5%内判定正确LLM结构化打分固定评审模型统一输出评判证据可溯源校验答案所有数字必须出现在读取文本机械判定是否幻觉额外指标幻觉率、单题token消耗、调用成本、平均时延统计采用麦克内马尔成对检验、Holm多重校正。7 预实验观测预实验采用目标算术题测试稠密Top-K单次召回无法同时获取两个相隔47行数值直接放弃作答Read通过多轮grepread读取两段区间正确计算差值。代价Read输入token量是稠密6~8倍算力成本显著更高。同时发现代码解析漏洞会错误归因文档段落证明仅靠准确率无法发现底层轨迹缺陷必须完整检索轨迹审计。8 完整实验结果8.1 主实验整体准确率系统准确率95%置信区间证据可溯源占比无答案幻觉率单题成本美元Read58.8%[45.2,71.2]58.0%40%0.058Read-lit66.7%[53.0,78.0]60.4%0%0.043Read-out66.7%[53.0,78.0]66.7%40%0.040BM2551.0%[37.7,64.1]67.3%40%0.020Hybrid29.4%[18.7,43.0]72.0%60%0.022AgenticVec27.5%[17.1,40.9]42.6%0%0.050Dense(最优35.3%)15.7%[8.2,28.0]47.9%80%0.023成对对比Read相对最优稠密检索提升23.5个百分点pHolm0.017p_{\text{Holm}}0.017pHolm0.017AgenticVec仅27.5%证明多轮迭代无法弥补向量检索固有缺陷。8.2 无显著结论对比Read与BM25差值仅7.8个百分点置信区间跨0无统计学显著差异说明本文结论区分嵌入检索vs词法检索而非智能检索一定优于所有传统检索。Read两组消融版本略高于原版但无显著差异文档表格拆分严重时大纲、标准化工具增益不明显。8.3 性能差距来源拆解按题型拆分准确率核心差距集中在单数值查找类题目稠密仅12.5%Read70.8%该类题目海量近似数值向量高度重叠稠密检索极易匹配错误数字结构导航类各系统性能接近。故障统计稠密检索13道题目完全未召回关键证据Read仅4道稠密因缺失证据大量直接放弃作答。8.4 无答案任务表现稠密检索80%编造答案幻觉风险极高AgenticVec、Read-lit完全拒绝作答但前者大量可答题目也放弃属于保守过度。8.5 成本时延Read单题成本、时延约稠密2.5倍优势为审计可追溯、高风险财务场景准确率大幅提升低成本大批量场景BM25更具性价比。9 研究局限性仅单份印度政府财政表格文档结论不一定通用通用网页、小说、多文件知识库评测基准仅51道题目样本量小7~8个百分点差异无法区分显著性基准由作者构建存在数据集偏向Read框架风险仅机械标准答案降低偏差Read证据可溯源指标低于BM25多轮读取更容易引入无关数字仅适配单份超长结构化文档多文件跨库检索场景稠密检索仍具备优势PDF转换工具单一转换失真天花板仅适用于pymupdf4llm7 Read算力开销更高大批量低成本业务不适用。10 结论针对表格占比极高的长财务文档传统「离线分块稠密Top-K」RAG存在结构性缺陷数值单位、财年表头与数字行间距离较远任何固定分块策略都无法完全规避信息割裂。本文构建Read无嵌入智能体检索MCP服务允许模型查询后动态选取文档读取区间完整检索轨迹可审计复现。51道标准化财务问答评测中Read 58.8%准确率显著优于调优至最优的稠密检索35.3%控制智能循环变量的AgenticVec仅27.5%证明性能优势来源于检索接口本身而非多轮迭代能力。稀疏BM25与Read无显著性能差距本文核心区分嵌入类检索、纯词法检索两条技术路线优劣而非智能检索优于全部传统方案。在金融、审计等高可信要求场景可解释、可溯源的迭代文档读取方案可大幅降低数值幻觉与证据缺失风险大批量低成本场景稀疏词法检索仍是更均衡选择。附录A PDF转换器对比测试四款PDF转Markdown工具从表格行列完整性、数字拆分失真维度评测仅pymupdf4llm满足实验需求cloudconvert、markitdown会割裂表格数字与标签docling内存溢出无法完整解析780页文档。附录B Read完整工具实现Python MCP服务核心代码frommcp.serverimportServerimportre,os# 初始化MCP服务serverServer(read-doc-agent)DOC_ROOT./finance_doc.md# 全局双重标准化处理函数defnormalize_line(raw:str)-tuple[str,str]:# 版本1清除表格标记、加粗basere.sub(r[|*_], ,raw)basere.sub(r\s, ,base).strip()# 版本2删除数字千分位逗号squashre.sub(r,,,base)returnbase,squashserver.tool()defmemory_grep(query:str,context_lines:int2):标准化全文行检索返回匹配行号与原文res[]withopen(DOC_ROOT,r,encodingutf-8)asf:linesf.readlines()foridx,lineinenumerate(lines,start1):b,snormalize_line(line)q_base,q_squashnormalize_line(query)ifq_baseinborq_squashins:res.append({line_no:idx,text:line.strip()})returnresserver.tool()defmemory_read(start:int,end:int):读取指定连续行限制单次最大400行ifend-start400:returnError: single read limit 400 lineswithopen(DOC_ROOT,r,encodingutf-8)asf:linesf.readlines()returnlines[start-1:end]server.tool()defmemory_outline():提取所有#标题行与对应行号outline[]withopen(DOC_ROOT,r,encodingutf-8)asf:linesf.readlines()foridx,lineinenumerate(lines,start1):ifline.lstrip().startswith(#):outline.append({line:idx,title:line.strip()})returnoutline附录C 基准数据集标注规范算术类题目答案不得在原文直接出现校验全文无匹配数字单数值题目校验该行表头单位、财年与查询一致转换受限题目PDF单元格拆分数字任何检索系统无法修复单独分类不计对比无答案题目文档不存在对应统计口径用于幻觉检测。附录D 稠密检索参数消融扫描遍历2000/4000字符分块、top-k4/8/16组合最优配置为2000字符top-k16准确率35.3分块尺寸提升对性能增益极小增加召回数量是唯一优化手段算力开销提升41%。附录E 两类系统完整执行轨迹示例E1 稠密Top-K轨迹单次调用放弃作答查询2024-25财年财政赤字与财政盈余差值调用dense_retrieve(k8)仅召回盈余数值行无赤字行输出文档未同时包含两个数值无法计算判定错误。E2 Read完整8轮工具轨迹memory_grep(“Statement of Receipts and Disbursements”)memory_grep(“Fiscal Deficit”)memory_outline()memory_grep(“Fiscal Deficit”)memory_grep(“Revenue Surplus”)memory_grep(“STATEMENT No. 2”)memory_read(365,450)memory_read(1023,1120)读取两行数值计算差值答案正确所有证据行可人工复核。开源资源完整清单论文PDFhttps://arxiv.org/pdf/2608.06305Read MCP完整服务源码项目GitHub仓库PDF转换脚本converter/pymupdf_convert.py评测自动化调度代码eval/run_bench.py51道财务基准数据集benchmark/questions.json稠密检索消融扫描配置sweep_configs.yamlMCP协议完整规范文档mcp_spec.md实验轨迹回放、指标统计绘图脚本analysis/