尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-Wo...

Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-Wo... 一、文章主要内容总结本文围绕“大型语言模型(LLMs)能否在真实临床场景中胜任儿科医生工作”这一核心问题,构建了PEDIASBench(儿科动态智能、适应性与安全性评估基准),从“基础医学知识应用”“动态诊疗能力”“儿科医疗安全与伦理”三个维度,对过去两年发布的12款代表性LLMs(含GPT-4o、Qwen3-235B-A22B、DeepSeek-V3等)进行了系统性评估。评估覆盖19个儿科亚专科、211种典型疾病,采用选择题(单/多选)、简答题等多种题型,结合真实临床病例与标准化考试资源设计任务。核心发现包括:顶尖模型在基础医学知识任务中表现优异(如Qwen3-235B-A22B在执照级问题上准确率超90%),但任务复杂度提升后性能下降约15%,复杂推理能力不足;动态诊疗场景中,DeepSeek-R1的病例推理得分最高(均值0.58),但多数模型难以适应患者实时病情变化;医疗伦理与安全维度,Qwen2.5-72B准确率达92.05%,但所有模型的人文关怀敏感性均有限;模型性能受亚专科复杂度影响显著,在肿瘤外科、心血管疾病等需动态推理的领域表现较差,而在儿童保健、呼吸内科等基础领域表现较好。研究结论指出,当前LLMs无法独立开展儿科诊疗,但可作为决策支持、医学教育、医患沟通的辅助工具;未来需通过多模态融合(文本、影像、生理信号)、临床反馈-模型迭代循环等方式,提升其安全性、可解释性与人文协作能力。二、文章创新点构建专属评估框架
返回列表