尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

百万字长文怎么交给 AI 审:document_chunks 分块剧本

百万字长文怎么交给 AI 审:document_chunks 分块剧本 编辑朋友丢来一部三百多页的汇编书稿WPS 打开都要转好几秒圈。诉求很朴素出版前把错别字、体例、数字前后不一致过一遍。人眼肯定啃不动丢给 AI——第一次尝试直接翻车。翻车点DOCUMENT_TOO_LARGE我让 AI 用 document_get_text 拉全文返回的是 DOCUMENT_TOO_LARGE。察元AI文档助手对单次取文设了约 80k 的阈值超过就拒收。这个拒绝其实是在保护你百万字硬塞进上下文一是 Token 成本扛不住二是超长上下文中间部分容易被模型看丢审了等于没审——长文场景的 Token 优化不只是省钱更是准确率问题。这个阈值的存在意义就是把怎么读长文从一个隐藏决策变成一个显式流程。正确姿势是换 document_chunks按分页分块读取配 cursor 和 limit 两个参数像翻书一样一页一页往后走。这套打法配哪家支持 MCP 的客户端都成立工具名不变。分块剧本四幕第一幕先看体检报告。让 AI 调 document_meta拿到总字数、段数以及一个关键字段是否建议分块。这个字段等于服务端替你做了预判显示建议分块就老老实实走分块流程别头铁硬拉全文。顺手也让它记下文档名和结构后面汇总报告要用。这一幕还有个隐性收益字数和段落数给了 AI 估算工作量的依据它会把分块计划先报出来节奏透明不用提心吊胆干等。第二幕分块巡检。AI 从起点开始每次拉一块逐块跑校对只记录问题、不动正文cursor 记录进度、limit 控制每块体量翻页节奏由参数说了算不会重复也不会漏页。给 AI 的指令要明确节奏和产出格式我是这么写的这份文档很长请用 document_chunks 分块通读每块检查错别字、序号体例、数字前后一致性每块输出块序号、发现的问题、位置锚点先不要修改正文每块的产出格式提前约定好后面汇总就不乱块序号负责定位、问题描述负责定性、锚点负责落点三件套齐全。第三幕汇总去重。跨块的问题比如同一个术语前后译法不一在这一步合并按严重、一般、建议分级每条附上锚点。要外发的书稿再把敏感信息扫一遍加进来查找疑似身份证号、手机号、银行卡号并批注第四幕确认后写回。人工过一遍汇总清单砍掉误报再让 AI 用 document_apply_ops 把批注批量钉回原文一次最多 200 条超过就拆批。到这里审读成果才真正落到文档上最后 document_save 收尾。剧本外的三条心得一是别让 AI凭印象报位置必须带锚点否则批注钉不上——LOCATE_NOT_FOUND 这个错误码就是锚点没找着的信号让它重新定位就好。二是分块审读天然防漏每一块的注意力预算是独立的比一次性吞全文靠谱得多Token 花销也更平稳可控长文项目的成本就是这么压下来的。三是长文场景 AI 的幻觉概率会抬头坚持宁缺毋滥拿不准的问题标存疑留给人工别让 AI 硬给结论书稿这种要出版的东西更是如此。锚点校验失败也不必慌LOCATE_MISMATCH 就是提醒它重新定位重来一次的成本很低。另外可以要求 AI 每块只报确定的问题、疑似项单独列汇总表的信噪比会高很多。适用与边界这套剧本适合图书编校、标书合册、论文集、年报汇编——凡是长到人啃不动的文档。顺带一提分块读取也适合做长文的结构分析先分块提目录、再逐块核对体例两轮下来比人肉翻页快得多。边界也要说透AI 审读是初筛加速器能把人从机械劳动里捞出来但出版物的最终质量责任仍在编辑和既定的审校流程手里AI 的分级清单只是给专业判断腾出手。编辑朋友那部书稿走完四幕他只需要对着分级清单做取舍——机械的部分交给分块剧本判断的部分留给自己这才是长文协作该有的分工。百万字不可怕可怕的是没有分块策略就开审。
返回列表