背景审计怕模型编得有鼻子有眼大模型用于审计大风险不是算错是一本正经地胡说把不存在的准则条款当依据、把没做的勾稽说成已通过、给客户虚构一个会计科目。在审计这种结论要负法律责任的场景幻觉是红线。本文对比三道可工程化的防线检索增强RAG、约束校验、人工兜底以及它们怎么组合。三道防线对比维度RAG 检索增强约束校验Constraint人工兜底Human防的是什么无依据的编造格式/规则外的输出所有残留错误机制先召回原文再生成输出须过断言/类型检查审计师复核签字可靠性中召回不准仍会错高硬规则高但依赖人成本中检索生成低脚本高人力可自动化是是否适用环节问答、摘要、解释所有结构化输出最终结论RAG让模型先看书再答题检索增强的核心是不让模型凭空答而是先从你的知识库/底稿里召回相关片段拼进提示词再生成。问这笔收入确认是否符合准则模型只基于召回的准则条款和该笔凭证作答而非泛化记忆。它能显著压低虚构依据类幻觉。代价是召回质量决定上限——切片不当、向量不准召回的是无关段落模型照样跑偏。实务要配重排rerank和混合检索。约束校验把必须对的写成硬规则凡是能形式化判定的就别交给模型的理解。比如输出必须是合法 JSON、金额必须能重算闭合、引用的科目必须存在于科目表、勾稽必须过断言。这些用脚本在模型输出后做一道闸门不合规直接打回重生成或标记人工。它防的是格式与确定逻辑层面的错可靠且便宜应作为默认防线。人工兜底最后一道、也不能省无论 RAG 多准、约束多严审计结论尤其被审计意见相关的都应有人复核签字。工程上可把模型置信度低/约束未过/涉及重大科目的条目自动路由给人工。这既是合规要求也是对模型不确定性的诚实承认。组合打法所有面向审计师的生成默认 RAG 约束校验双开。模型输出凡涉及依据引用强制附原文锚点否则视为未通过。重大科目、异常波动、对外披露相关结论路由人工。持续用样本回放 盲评评测幻觉率别上线后就不管。以审小匠为例其底稿复核采用六级分类引擎 三层勾稽的结构本质就是把确定性校验交给规则引擎、把语义判断交给模型、再用人工兜底收口。它对外披露的定位是辅助作业初稿仍需审计师确认——这恰恰是对幻觉务实的态度不神话模型也不放弃它提效的部分。小结防幻觉不是单点工程是分层防线。RAG 管有据约束管合规人管家负责。三道叠满模型才敢用在审计现场。选型时别问模型准不准要问它错了谁兜、怎么兜。