产品手册智能对话银行也可以有自己的 AI 知识库机器人客户问金葵花理财起购金额是多少客户经理不用翻手册AI 秒回答案并标注出处。这就是产品手册智能对话的力量。场景痛点银行的客户经理每天要面对几十个产品、数百条规则。金葵花理财的申购起点是多少平安白金卡年费多少建行惠懂你 310 模式是什么——这些问题客户随时可能问。传统解决方案是翻手册慢容易错找不到问同事打断别人工作信息可能不准打客服客户觉得你不够专业三个选择都不好。已有方案 vs 我们的方案我们先看看同业的做法银行方案优点缺点招行 智谱投顾对话机器人对话自然需要大量标注数据成本高平安 知鸟企业级知识库功能全面需要平台 API 授权工行 工小智客服机器人已承接大量流量主要处理账户类问题产品类不够细我们的方案BM25TF-IDF RAG零 API 费用Hit1100%2.5ms 响应不支持语义推理v1.1 解决技术选型为什么是 BM25 TF-IDF 双路检索很多人一谈 RAG 就想到 embedding 向量数据库。但实际业务中产品手册的 FAQ 类问题有一个很关键的特性问题中的关键词与答案所在的章节标题高度相关。例如用户问起购金额是多少手册中申购起点与持有门槛章节下就有单只理财产品起购金额人民币产品 1 万元起的原文。这不是一个语义相似问题而是一个关键词匹配段落定位问题。所以我们选择了BM25Okapi经典的词袋检索模型对生僻词idf高区分度TF-IDF 余弦相似度弥补 BM25 在短文本下的稳定性RRF (Reciprocal Rank Fusion)两路结果融合章节标题加权查询词与章节标题的重叠 token 给予额外分数产品自动识别从建行惠懂你最高额度自动推断产品名结果如何性能数据在 3 个产品手册、25 个 chunk、15 个测试用例上指标数值Hit1100%Hit3100%MRR1.000平均检索耗时2.5 ms内存占用 5 MB外部依赖零纯标准库关键设计章节标题加权的魔力纯靠 BM25TF-IDF 的效果本来只有 Hit126.7%我们做了两项关键优化后升至 100%1. 产品自动识别_infer_product查询建行惠懂你 310 是什么 → 自动推断产品名建行惠懂你小微贷 → product_filter 限制在该手册内检索 → 排除其他手册的干扰。关键实现从产品名中通过 sliding window 抽取所有 2-4 字的候选词以最长命中字数打分。_infer_product(建行惠懂你最高额度是多少)正确返回 建行惠懂你小微贷。2. 章节标题 token 加权在 BM25/TF-IDF 索引构建时将章节标题的 token 复制 3 倍后加入文档向量。这使得起购金额在二、申购起点与持有门槛章节中的权属显著高于其他含数字的章节。同时在 RRF 融合后的 rerank 阶段计算查询词与章节标题的重叠 token给予0.005 × len(overlap)的额外分数。这个 bonus 虽然微小但在短文本场景下足以让正确的章节排到第一。文档切分的教训初期实现中1. xxx 格式的列表项被 HEADING 正则误识别为标题因为含有\d\.\s.模式导致申购起点与持有门槛含 1. 金葵花客户准入门槛和申购与赎回规则含 1. 申购时间...等章节被覆盖丢失。修复正则只匹配中文数字章节号[一二三四五六七八九十]、和 markdown 标题## xxx排除\d.\s.模式。修正后 chunk 数从 17 增加到 25缺失的章节内容全部召回。企微端体验在企微端我们设计了四个入口 直接提问输入自然语言问题 语音提问长按说出问题自动转写为文字 浏览产品列出已加载的产品手册 我的提问历史记录历史问答答案卡片包含出处产品名 → 章节、置信度评分、/ 反馈按钮。下一步v1.1接入 embedding 向量化可选支持 PDF/Word/Excel 直接导入v1.2LLM Re-Rank 精排 答案合成改写知识图谱融合产品-条款-费率三元组代码获取git clone https://github.com/yuzhaopeng-up/financial-ai-skills.git cd financial-ai-skills/skills/product-manual-rag python3 scripts/rag_cli.py ask 金葵花理财起购金额是多少三行命令零外部依赖秒级体验 AI 知识库问答。作者AlphaAgent · Financial AI Community