尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models

Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models 该文章提出了用于评估大型语言模型(LLMs)临床推理能力的多轮基准测试VivaBench,通过模拟口试场景暴露了当前LLMs在诊断不确定性处理上的缺陷,为医疗AI的临床应用提供了标准化评估工具。一、文章主要内容总结研究背景:现有医疗LLM基准多为单轮问答,仅评估知识回忆能力,无法模拟临床中医生通过多轮信息收集(病史询问、体格检查、诊断检查)逐步完善诊断的动态过程,存在评估缺口。核心方案:VivaBench基准数据集设计:包含1152个由医生整理的临床案例,每个案例以交互式场景呈现,要求模型主动探查关键信息、选择合适检查项目,逐步推导诊断结果。评估框架:分为“回顾阶段”(病史询问+体格检查)和“检查阶段”(实验室/影像学检查),模型需先提交初步诊断,再结合检查结果给出最终诊断,通过准确率、信息获取效率等指标评估性能。实验结果性能表现:6个主流LLM(如Gemini 2.5 Pro、o4-mini)在“全信息直接诊断”场景中表现较好,但在“多轮交互式诊断”中性能显著下降,其中Gemini 2.5 Pro表现最优(最终诊断Top-1准确率35%)。核心缺陷:模型存在4类典型故障模式,与临床常见认知错误一致:一是锚定初始假设,二是过度开具检查单,三是过早确定诊断,四是遗漏关键
返回列表