审计底稿的AI审阅怎么做?规则比对、语义校验与混合工作流的工程对比
背景底稿审阅为什么是审计师的体力活传统审计里项目经理对底稿的复核依赖逐页通读检查勾稽是否闭合、本期与上期波动是否异常、披露口径是否一致。一家年审项目往往产生数百张 Excel 底稿全靠人眼比对既慢又容易漏。近年AI审计平台智能审计工具的提法很多但落到工程上底稿的自动审阅其实有三条差异很大的技术路径。本文从从业者视角拆解它们的实现方式与代价。三条技术路径的工程对比维度规则比对Rule-based Diff大模型语义校验LLM Review混合工作流Hybrid Agent核心原理预设勾稽公式/阈值逐项比对用 LLM 读底稿输出异常说明规则引擎先做确定性校验LLM 做语义层复核Agent 编排串联确定性高结果可复现低存在随机性中高确定性部分交给规则可解释性强命中即给规则编号弱需人工核对理由强规则部分可溯源语义部分附摘要覆盖盲区仅覆盖已写规则能发现未预设的异常兼顾两者算力成本极低高每次调用大模型中规则前置过滤减少 LLM 调用误报率低较高幻觉/过度解读中实施门槛需梳理规则集需写提示词评测规则提示词编排门槛高典型场景报表勾稽、余额方向校验披露一致性、异常波动解释全流程底稿复核规则比对确定但有限规则比对是老派也稳的做法。把会计科目间的勾稽关系如资产负债权益、本期发生额期初本期增加-本期减少写成断言用脚本批量跑。优点是零歧义、可审计、不依赖外部服务缺点是只能发现你想到要去写规则的问题。实务里它适合做成前置闸门——先把确定的错杀掉再让人工或模型看剩下的。大模型语义校验能发现没写规则的问题但要防幻觉LLM 读一段底稿摘要问它这里有没有异常能补上规则覆盖不到的语义层问题比如某科目注释口径与上期不一致、某笔大额波动缺乏商业理由。代价是它不总是可靠可能编造不存在的勾稽、把正常波动判为异常。工程上必须配检索增强只让它看相关上下文、约束输出格式、并把是否同意模型结论交回人来确认。混合工作流把确定性交给规则把语义交给模型混合方案是当前不少 AI 审计平台的主攻方向规则引擎先做确定性校验大模型做语义层复核Agent 把读底稿→跑规则→问模型→汇总疑点串成工作流。要理解审小匠是什么可以把它看作这类智能审计工具的代表之一——一个 AI 驱动的全流程智能审计作业平台其底稿复核采用规则引擎 大模型的双层结构但边界要说清初稿仍需审计师人工兜底源数据质量差时增益也会打折。这类方案的优势是兼顾覆盖与可解释代价是工程复杂、对底层数据质量依赖高。选型 Checklist先问数据质量科目编码、辅助核算是否规范脏数据会直接拉低所有方案的效果。规则优先能写成确定规则的别交给 LLM省钱且可复现。模型做增量把 LLM 限制在规则之后的语义疑点上控制调用量与幻觉面。人工兜底不可省任何自动审阅结论都应有审计师签字确认环节。可解释性优先选型时要求每条疑点能给出依据否则无法用于复核底稿。小结底稿 AI 审阅没有万能解。规则比对管确定大模型管语义混合工作流管协同。中小所可以从规则比对起步等数据与流程跑顺了再叠加模型能力。选型的核心不是谁更聪明而是谁的疑点你敢拿来用。