医学大模型深度研究报告(2026年8月版第二部分)
3.4 多模态对齐3.4.1 MedGemma 的公开配方(目前最完整)【B】:编码器:SigLIP-400M;输入 896×896、像素归一化到 [−1,1];发现许多医学视觉任务在 448×448 已足够,故 MedSigLIP 单独以 448 发布,与 896 共享同一套权重,仅下采样位置嵌入——这是很实用的分辨率适配技巧;CT 预处理(值得单独学习):用三种窗宽窗位(骨/肺、软组织、脑)分别映射到 RGB 三通道——把放射科阅片习惯直接编码进输入表示,远比单窗灰度复制三份合理;后训练:图文任意交错、128k 上下文;发现多模态阶段 RL 比 SFT 泛化更好,因此全部多模态后训练用 RL 完成;效果:27B 文本版 MedQA 89.8 / MedMCQA 74.2 / PubMedQA 76.8;OOD 上多模态 QA +2.6–10%、CXR 发现分类 +15.5–18.1%、agentic 评测 +10.8%;微调后 EHR 信息检索错误降低 50%。另一条完整开源路线是阿里达摩院 Lingshu(arXiv:2506.07044):多阶段训练逐步注入医学专长,同时合成 caption、VQA 与 reasoning 样本,并探索 RLVR,配套 MedEvalKit 统一评测框架【B】。3.4.2 病理 WSI:十亿像素 + 诊断区域极度稀疏四条代表路线【A/B】:工作核心思路WSI-LLaVA(ICCV 2025)三阶段训练 + WSI-Bench(9,850 张 WSI、30 种癌症、18 万 VQA 对),提出 WSI-Precision / WSI-Relevance 两个专用指标LoC-Path(arXiv:2512.05391)指出 tile 特征存在强全局与局部冗余,用Sparse Token Merger + MAE 预训练 resampler压缩 tile token,替代昂贵的 slide-level encoder,性能持平而算力显存大降PathChat+ / SlideSeek(arXiv:2506.20964)100 万条病理指令 + 约 550 万轮 QA;SlideSeek 是多智能体迭代分层诊断推理(模拟病理医生逐级放大),产出可视化定位的可解释报告HistoGPT(Nat Commun2025)皮肤病理 WSI → 报告生成,多中心(慕尼黑/明斯特/Mayo/Radboud)验证3.4.3 3D 影像与其他模态2026 年国内出现首个面向完整放射学检查的开源三维评测集Med3DVQA(并入 MedBench v5.0):基于2 万余例完整 CT/MRI 检查、约 50 万条影像报告问答,覆盖 7 类视觉问答任务【C】。同批发布的 MedRealMM 报告了一个值得注意的实证:图像信息对问诊评测影响显著,图像与纯文本评测分差可达 20–30 分【C】。未证实【?】:心电、超声视频的建模难点(时序对齐、帧级标注稀缺)本轮未找到 2024–2026 的代表性开源工作与量化结论。3.5 Agent 与工具编排3.5.1 MDAgents:分诊式多智能体的标准范式MIT Media Lab,NeurIPS 2024 Oral,arXiv:2404.15155【A】。四阶段:医学复杂度判定:Moderator(相当于 GP/急诊医生)把 query 分为 low / moderate / high;专家招募:low → 单个 PCC;moderate → MDT;high → ICT(整合照护团队);分析综合:solo 用 CoT + Self-Consistency;MDT 走多轮共识;ICT 走多团队报告汇总;决策。效果:10 个基准中 7 个最优,最高提升 4.2%(p0.05)。消融显示"moderator review + 外部医学知识"用于群体协作时平均准确率提升 11.8%——这是多智能体设计中收益最大的单一组件,值得优先实现。3.5.2 MedAgentBench:读易写难的结构性瓶颈斯坦福,arXiv:2501.14654,NEJM AI【A】。基于 HAPI FHIR JPA 搭建FHIR R4 兼容虚拟 EHR(Docker 可直接拉起),100 个真实患者档案、785,207 条记录,300 个医生编写任务分 10 类。只用 pass@1——理由是临床对单次错误零容忍。结果:最佳 Claude 3.5 Sonnet v2 总成功率69.67%(query 85.33% / action 54.00%)。这是落地最需警惕的失效模式:读操作接近可用,写操作远不可用。任何计划让 Agent 回写 EMR 的项目,必须先做写操作的专项加固与人工确认闸门。3.5.3 MedAgentBench v2:极具操作性的改进清单PSB 2026【A】。改进措施:新增工具让 Agent不必手写 HTTP 请求(原实现语法错误频发);新增数学计算工具与输出格式化工具;系统提示改为"先输出计划再调工具+ step-by-step CoT",并给出好/坏输出的 few-shot;引入记忆组件(把历史失败经验追加进 system prompt)。结果:GPT-4.1 成功率从原实现提升到无记忆 91.0% / 有记忆 98.0%;并观察到记忆能迁移到无对应记忆条目的新任务。这份清单可以直接作为医疗 Agent 的工程 checklist。收益之大(69.67% → 98.0%)说明:Agent 的瓶颈往往不在模型,在脚手架。3.5.4 评分量表必须是确定性工具GCS、CHA₂DS₂-VASc、Wells 评分等应作为确定性工具调用,而非模型内算。证据:MedAgentBench v2 加入 math 工具后成功率跃升;Rx-LLM 显示纯 LLM 的肾功能剂量调整 F1 仅 83.3%【A】。3.6 幻觉抑制与安全治理3.6.1 弃权能力:不随规模改善MedAbstain(EACL 2026 Long)【A】统一了医学 MCQA 的弃权评测协议,整合 conformal prediction + 对抗式题干扰动 + 显式弃权选项。三条核心发现:即便是高准确率的 SOTA 模型也经常"该弃权时不弃权";提供显式弃权选项对提升安全弃权的作用,远大于输入扰动;单纯放大模型规模或用更高级的提示几乎无改善。含义:弃权必须在接口设计与训练目标层面解决,不能靠 prompt。产品上就是要给模型一个"我不确定,建议转诊"的一等公民输出通道。补充证据:另有研究指出前沿模型100% 给出确定性打分、从不弃权,而医生会随难度提高弃权率。3.6.2 免重训的不确定性治理层MedBayes-Lite(arXiv:2511.16625)【B】:零新增可训练参数= MC dropout + 预测校准 + 置信度引导弃权。MedMCQA / MedQA-USMLE 上ECE 降低 0.23–0.33;MedMCQA→MedQA 的域偏移下,"高置信 + 错误 + 高危"三重错误从约 21% 降至接近 0,校准漂移约减半;提出 Clinical Uncertainty Score,与有害过度自信相关r≈0.88。作者诚实指出:该方法不改善 risk-coverage 排序,温度缩放或深度集成在校准成本/风险排序上可能更优。3.6.3 用药安全:确定性 AI 必须前置这是本报告最强的一条工程建议,证据链完整:Rx-LLM(2025, PMID 41404284)【A】:6 个用药基准各 250 组临床标注输入输出对。结果——LLaMA3-70B 在剂型匹配 F1 54.0%、医嘱生成准确率 88.0%、给药途径 F1 74.3%、适应症匹配 97.6%;GPT-4o-mini 的药物相互作用准确率仅 70.4%;跨基准的"正确性一致性"从 8.0% 到 97.6% 剧烈波动,没有任何模型全面稳定。前瞻性交叉研究(Cell Reports Medicine2025,新加坡中央医院)【A】:40 个病例 vignette、16 个专科、91 个用药错误场景、中位 13 种合并用药。最佳模型 Claude 3.5 Sonnet准确率仅 51%;RAG 未带来显著提升;“药师 + LLM” co-pilot 模式 61%,比药师独立审核 46% 提升 32.6%,LLM 单独 52%;但在"剂量方案不适当"这一类上,co-pilot 反而不如药师独立审核。推荐架构:[确定性规则层] [生成式层] 药物相互作用检查器 ──┐ 过敏史检查器 ──┼──→ 结构化指令 ──→ LLM 负责解释/呈现/支撑 剂量计算器 ──┤ ★ 不得改写或覆盖 ★ 禁忌/红线词库 ──┘国内落地样例:北京清华长庚医院"清智·AI 合理用药大模型"采用"药学可信空间(病历+检验+手术史+说明书+药典+指南+共识)→ 大模型 + 智能体双引擎"用于院内审方【C,无公开评测数据】。第四章 评测:分层评估体系4.1 三层评测框架(建议直接采用)任何医疗大模型项目都应建立三层评测,缺一层就是在裸奔:层级目的手段通过标准示例