尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

AAAI 2026 | AgentMental:可解释、自适应的心理健康评估多智能体框架

AAAI 2026 | AgentMental:可解释、自适应的心理健康评估多智能体框架 研究问题从被动判别到主动补充证据传统自动化路线通常把社交媒体文本或完整访谈转录输入分类器输出抑郁、焦虑等标签较新的大模型路线也多是零样本、少样本或思维链提示。共同短板是如果回答只有“我失眠”或“是的”模型只能在缺失频率、持续时间和生活影响的条件下猜测无法像临床访谈那样主动补问。AgentMental将问题重新定义为受心理量表约束的序贯决策每个条目先覆盖核心问题再根据当前证据的充分程度决定继续追问还是转入下一条目。真正的新角度不是又增加一个分类器而是允许系统改变后续可观察信息。论文实际要解决的两个瓶颈•回答不充分。用户可能因为认知负担、抵触或表达困难只给出模糊回答需要系统判断缺什么并生成易回答的澄清问题。•跨主题信息碎片化。量表包含多个相关症状若只按条目独立处理既会重复提问也难以利用“睡眠问题影响工作、低自我价值又与功能下降相连”一类跨主题依赖。标题中的“心理健康评估”容易被读成通用临床能力但实验实际只覆盖以PHQ-8为核心的抑郁评分与二分类。论文没有验证诊断访谈、治疗建议质量、危机干预或其他精神障碍的临床决策。数据与任务定义数据来源与标签实验使用DAIC-WOZ189 名参与者与虚拟访谈员对话原始语料包含转录、音频和视频。本文只使用英文转录文本。每位参与者在访谈后完成PHQ-8八个条目分数相加得到总分总分不低于 10 记为抑郁类低于 10 记为对照类。论文沿用既有固定划分但评测止于开发集独立测试集与外部数据集均不在实验范围内。这一点直接限制了结论强度开发集结果适合方法比较却不足以证明泛化。实际评测协议这不是让真实参与者与系统在线对话。作者把DAIC-WOZ转录文本作为先验提示DeepSeek-R1-Distill-Qwen-32B扮演具有或不具有心理障碍的用户再让AgentMental与该模拟用户展开新一轮多轮访谈。标签来自真实量表但可交互回答由另一个大模型生成。因此系统测到的是“在历史转录本条件化的大模型模拟环境中能否通过追问恢复量表标签”而不是“真实患者是否愿意、能够并安全地向系统披露信息”。模拟器与评估器共享大模型语言先验也可能让结构清晰的追问比现实中更容易获得理想回答。两种任务设置与指标作者为提示方法设置两条路线•bc把完整访谈直接映射为抑郁或对照二分类。•sl先预测八个量表条目分数求和后再按阈值映射为类别。条目分数误差用平均绝对误差衡量越低越好分类用一致性系数、对照类与抑郁类的F1以及宏平均F1衡量越高越好。sl通常优于bc说明量表结构本身就是重要先验不能把所有提升都归于多智能体协作。复现所需设置系统由AutoGen组织核心模型使用Qwen2.5-14B-Instruct或Qwen2.5-72B-Instruct生成温度为 0。作者在一张NVIDIA A6000上运行实验并用vLLM加速推理。追问上限参数为 充分性阈值为 。论文没有训练新的端到端模型核心贡献属于提示驱动的推理编排与外部状态设计。方法主线机制流程输入量表条目并发起初问。输入当前主题 、既有对话历史和记忆状态提问智能体生成一个覆盖该症状标准的核心问题用户回答被送到信息抽取步骤。判断充分性并控制追问。评估智能体读取当前主题下的问答输出 0 至 2 的必要性分数若分数高于阈值且未达到上限提问智能体针对缺失的频率、持续时间、严重程度或功能影响生成下一问输出重新进入同一主题循环。写入树状记忆并完成条目评分。每轮回答被压缩为陈述节点主题结束后评分智能体结合全部主题内问答与量表标准输出条目分数 、摘要及评分依据 再写入主题节点并更新相关旧节点。全局修正并生成报告。所有主题完成后更新智能体联合完整对话与主题记忆输出修正后的分数向量 、理由和总结条目求和后映射为量表类别报告生成模块再给出摘要与建议。论文原图编号Figure 2。完整框架图展示四类智能体、深入追问、主题评分、树状记忆和全局更新之间的信息流。四类智能体的职责边界• 提问智能体 负责初始问题和定向追问目标是获得能映射到量表标准的可评分信息。• 评估智能体 不直接给诊断而是判断当前回答是否足以评分相当于对信息缺口进行门控。• 评分智能体 只在主题结束后根据该主题问答与评分标准给出分数和证据摘要。• 更新智能体 读取跨主题历史修正条目分数并生成理由、总结和建议。这种拆分有利于审计但四个角色仍可能由同一类基础模型通过不同提示实现因此“多智能体”不等于独立专家意见。论文也没有给出角色提示、调用失败处理或角色间分歧解决的完整细节。树状记忆如何承载证据记忆包含三层用户根节点保存职业、性别和年龄等基本属性主题节点 保存主题 、分数 与摘要 陈述节点 保存第 轮回答中的情绪、频率、持续时间、症状和影响。完成主题后系统把相关陈述连接到主题节点并更新先前主题的摘要。该设计的工程意义是把“稳定用户属性”“条目级结论”和“逐轮证据”分开存储。后续提问既能过滤不合适的问题也能复用早先证据但论文没有描述节点冲突、错误信息撤回、记忆容量上限或长期对话中的压缩误差。追问、停止与评分公式当前主题的下一条追问写为这里的 是当前主题已有问答 同时包含此前主题摘要和当前主题的逐轮证据。实现上它对应一次带显式状态的提问调用而不是只把整段聊天记录无差别拼接进提示。停止策略可写成其他情况也就是说信息仍不足且调用预算尚未耗尽时继续追问否则转到下一主题。正文称 为追问上限但算法循环看起来把初问也计入最多三次调用等于阈值时的行为在公式与伪代码之间也不够明确复现时应固定这两个边界。主题评分与全局更新分别为第一式把主题内证据映射为分数和依据第二式允许跨主题修正并生成理由 。这些理由提高了可检查性但论文没有做解释忠实性验证因此不能默认理由就是模型真实决策过程的可靠因果说明。关键结果主结果与强基线在Qwen2.5-72B-Instruct条件下论文最关键的同模型比较如下。所有提示与通用多智能体基线的数值都取条目级设置方法MAE ↓Kappa ↑Macro F1 ↑Zero-Shot3.28656.877.65-Shot3.02966.383.0CoT3.02964.881.9Debate2.80068.984.4MDAgents2.80073.686.7AgentMental2.51479.889.8相对表内最强通用多智能体对照MDAgentsAgentMental的平均绝对误差降低 0.286Kappa提高 6.2 个百分点宏平均F1提高 3.1 个百分点。论文对 、 和宏平均 标注了单尾非配对检验下 但没有充分说明重复次数、统计单位、多重比较处理以及具体参照行因此显著性只能按论文报告理解。与任务专用学习方法相比SEGA的宏平均F1为 87.8。使用较小的Qwen2.5-14B-Instruct时AgentMental只有 86.0仍低于该基线换成 72B 模型后才达到 89.8。这说明框架优势依赖基础模型能力并非每种模型规模都刷新最佳结果。论文原图编号Table 1。完整主结果包含两种模型规模、静态提示、通用多智能体方法和任务专用方法。条目级结果不是全面领先PHQ-8 条目CoTMDAgentsAgentMental兴趣丧失37.845.838.7情绪低落55.857.155.7睡眠问题49.660.763.6疲劳或精力不足45.756.667.0食欲或体重变化13.319.128.1低自我价值36.835.255.2注意力困难25.628.538.1精神运动变化20.527.328.9收益集中在能通过追问补齐频率、持续时间和功能影响的条目例如睡眠、疲劳和低自我价值但兴趣丧失与情绪低落没有超过MDAgents。食欲或体重变化、精神运动变化即使相对基线提高绝对F1仍只有 28.1 和 28.9说明文本交互难以可靠捕捉需要细微信号或非文本观察的症状。论文原图编号Table 2。八个量表条目的细粒度 F1 结果揭示了收益集中位置和仍然困难的症状。消融到底说明了什么深入追问树状记忆MAE ↓Kappa ↑Macro F1 ↑✓✓2.51479.889.8✓✗3.00058.779.0✗✓3.31460.480.1✗✗3.40047.273.5移除记忆后宏平均F1下降 10.8 个百分点移除深入追问后下降 9.7 个百分点两者均移除时下降 16.3 个百分点。结果与“追问增加有效信息、记忆保留跨主题证据”的机制叙述一致但单张消融表没有给出随机种子方差、模块交互显著性或等调用预算因此还不能量化两个模块的稳定独立效应。论文原图编号Table 3。四种模块组合显示完整系统最优任一模块缺失都会使三项指标退化。交互质量评估的证据较弱作者另取 5 个不同严重程度案例以未使用追问和记忆的变体为基线。5 名研究生分别评分GPT-4o则对每例独立评分 3 次维度包括理解、同理、连贯、一致、真实感和满意度。正文只说明AgentMental在多数维度更优尤其是连贯性和满意度没有给出足以判断效应大小和不确定性的完整数值这更像探索性可用性信号而不是临床效用证据。深度分析为什么这个设计可能有效第一层收益来自信息增益模型不再从一句模糊回答直接猜分而是把缺失维度转化为下一问。条目级结果中睡眠、疲劳和低自我价值的提升与这一机制吻合因为这些症状能通过频率、持续时间和生活影响逐步操作化。第二层收益来自量表先验按PHQ-8条目分解后再聚合总分显式缩小了每次推断的语义空间。sl通常优于bc说明任务结构本身已经贡献了相当一部分提升若只比较最终系统与静态二分类就会高估多智能体编排的独特作用。第三层收益来自状态保持陈述节点保存局部证据主题节点保存条目结论用户节点提供人口属性过滤。消融中移除记忆后宏平均F1从 89.8 降至 79.0支持跨主题状态确有作用但论文未分析究竟是减少重复、引入额外上下文还是更新智能体重新评分带来的收益。案例解释了什么也没有解释什么两组案例展示了可理解的局部机制单问只能知道“难以入睡”或“兴趣降低”追问进一步得到发生频率与工作影响最终把条目分数从 2 或 1 修正到标注分数 3。这说明主动补采可以改变评分所需的证据集合。论文原图编号Figure 4。睡眠问题与兴趣丧失案例展示追问如何补齐频率和功能影响并改变评分依据。但案例是从成功例中挑选的不能证明追问普遍导致正确修正。系统也可能提出诱导性问题、把模拟用户推向量表答案、过度解释短暂状态或在已有证据足够时继续增加披露负担论文没有提供错误追问和错误改分案例。“可解释”更接近可追溯不等于忠实解释主题节点保留分数、摘要和证据最终报告又生成改分理由这比只输出标签更便于人工检查。不过这些理由仍由大模型生成论文没有通过证据删除、反事实、人工一致性或忠实性指标验证“理由中的证据确实导致了该分数”。因此更准确的表述是流程和证据链可追溯而不是内部决策已经得到严格解释。最关键的缺失对照是等预算单智能体AgentMental相对单次提示的优势可能同时来自更多令牌、更多模型调用、量表分解、显式状态和角色提示。最能隔离多智能体价值的对照应是同一基础模型、相同总令牌和最多三次追问由单智能体配合结构化状态机完成全部步骤。论文没有这类等预算对照因此尚不能判断性能提升主要来自角色分工还是来自额外计算与更强的任务脚手架。复杂度、延迟与临床工作流PHQ-8有 8 个主题若每个主题最多触发三次提问并在每轮调用充分性判断和信息抽取再叠加主题评分与全局更新推理成本会显著高于单次分类。正文缺少平均轮数、令牌量、端到端延迟、显存峰值和提前停止比例因而无法判断性能增益是否值得实际部署成本。更重要的是真实临床系统需要知情同意、最小化采集、危机升级、拒答处理、专业人员复核和审计留痕。当前框架把评分与建议生成放进同一自动化链却没有把这些安全边界建模为不可绕过的硬约束。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表