尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

The Alignment Paradox of Medical Large Language Models in Infertility Care: Decoupling Algorithmi...

The Alignment Paradox of Medical Large Language Models in Infertility Care: Decoupling Algorithmi... 文章核心总结与创新点一、主要内容本文聚焦生殖医学领域,针对不孕症治疗场景,系统探究了四种大语言模型(LLM)对齐策略(监督微调SFT、直接偏好优化DPO、组相对策略优化GRPO、上下文学习ICL)在临床决策中的表现。通过8000余条不孕症治疗电子健康记录构建"金字塔"数据集(涵盖通用、混淆、专家优化三类病例),并采用"自动指标评估+三盲医生介入评估"的双层框架,揭示了医疗LLM的"对齐悖论"——算法层面的性能提升未必转化为临床信任。自动指标结果:GRPO在不孕症类型、辅助生殖技术(ART)策略等核心决策维度的平均准确率(77.14%)和宏F1值(50.64%)最优,显著优于SFT、DPO和ICL,验证了强化学习在结构化预测任务中的价值;但DPO在初始诊断任务中表现不稳定,ICL则在多维度临床决策中鲁棒性不足。临床评估结果:医生盲评中,SFT模型因推理过程更清晰(p=0.035)、治疗方案可行性更高(p=0.019),获得51.2%的最高胜率,远超GRPO(26.2%)和医生原始决策(22.7%);GRPO虽幻觉率更低(15.0% vs SFT的18.6%),但临床实用性评分更低。亚组分析:GRPO在复杂/长尾病例(如PGT-M、短方案IVF)中性能提升显著,但在ICSI等临床边界模糊的亚型中表现下降,反映了强化学习对齐对数据分布和奖励粒度的敏感性。二、创新点首次揭示生殖医学LLM
返回列表