
PsychoAgent面向冲突感知的情感敏感大模型智能体认知架构论文原网页https://arxiv.org/html/2608.07438v1摘要人类认知调取过往记忆时不只是依靠文本主题相似度情感显著性与未解决冲突同样决定记忆可访问性。本文提出PsychoAgent认知架构分离事实记忆与情感记忆存储并通过冲突感知执行控制器完成两类记忆融合检索。情感记忆先通过语义相关性粗筛再依据情感显著性重排序在保留主题匹配度的前提下优先调取冲突相关关键记忆。在三组标准化冲突场景对照实验中完整PsychoAgent架构冲突关键记忆召回率0.933纯语义消融基线0.500、单记忆RAG基线0.667仅损失极小语义相似度代价。5名盲审标注人员对27组生成结果打分经打分者内部标准化后完整架构综合均值领先0.22标准差但成对校正后差异无统计显著性。配套3天长时序仿真轨迹验证架构三大核心能力长期情感状态持续留存、离线记忆重组、记忆显著性动态调整。实验证明情感敏感检索是可观测、可量化机制可用于模拟大模型智能体类人冲突决策行为。关键词LLM智能体、认知架构、情感记忆、冲突感知检索、RAG、双记忆库、显著性排序目录1 引言2 相关工作2.1 大模型智能体认知架构与记忆体系2.2 情感显著性、注意力与记忆调控2.3 冲突监测与反思控制机制2.4 精神分析启发计算模型现存缺口3 Psycho架构整体设计3.1 智能体状态与各模块计算职责3.2 双记忆库检索流程3.3 记忆读写与离线重组模块4 实验评测方案4.1 三组受控对照消融实验4.1.1 完整PsychoAgent架构4.1.2 语义-情感双记忆消融基线4.1.3 单记忆融合RAG基线4.2 量化指标与统计检验方法4.3 五人盲审人工评估流程4.4 3天长时序仿真演示案例5 实验结果5.1 检索召回量化结果5.2 人工行为打分结果5.3 长时序动态仿真结果6 实验结论与消融实验解读7 局限性与伦理边界8 总结8.1 数据与代码开源说明8.2 利益冲突声明参考文献附录A 完整场景数据集、提示词模板附录B 统计检验完整Python代码附录C 3天模拟轨迹生成脚本1 引言具备社交交互能力的大模型智能体不仅需要流畅语言生成更要完成历史经验筛选、状态维护、多目标冲突下决策。现有智能体记忆检索仅依靠相似度、新鲜度、通用重要性打分完全忽略一类关键场景文本表述差异大但情感矛盾深刻的历史记忆。人类记忆并非纯文本检索系统情绪唤醒度会改变记忆固化与可访问性情感显著性独立于语义相似度直接争夺注意力资源。现有RAG检索范式只匹配文本字面无法捕捉未化解冲突带来的长期行为影响。本文不修复LLM固有缺陷而是解决建模问题如何设计可计算智能体架构模拟情感记忆、多重目标冲突对决策的共同作用。认知科学提供完整理论支撑双加工理论、执行功能抑制/更新/切换机制、前扣带回ACC冲突监测、主动遗忘抑制理论。本文设计PsychoAgent采用冲突感知执行控制器融合外部上下文、人物设定、关系约束、当前情感、双记忆流。架构命名源自精神分析隐喻但全部模块基于认知科学、计算逻辑实现无心理诊疗假设。三大核心贡献提出可拆解、可观测的情感敏感认知架构分离事实/情感双记忆增加语义粗筛显著性重排序双层检索设计严格变量匹配对照消融实验固定输入上下文长度对比两套主流基线量化召回提升提供长时序可解释仿真轨迹完整展示情感留存、离线记忆重组、显著性动态更新全流程。2 相关工作2.1 大模型认知架构与记忆系统CoALA、Generative Agents、MemoryBank等经典智能体架构引入长期记忆、反思机制但检索排序仅依赖相似度、新鲜度、单一重要性得分。RAG仅从文本匹配维度筛选上下文无法区分“主题相关”与“情感冲突相关”历史记录。现有情感支持类基准证明传统检索存在明显短板语义匹配会遗漏改变角色信任度的冲突记忆导致智能体行为失真。2.2 情感显著性、注意力与记忆调控情感计算将情绪视作独立信息维度而非文本附属修饰。认知神经科学证实高唤醒事件记忆固化更强情感显著性可独立于任务相关性调控注意力Think/No-Think实验证明大脑存在主动抑制不需要记忆的执行控制机制。PsychoAgent不模拟神经网络但将“事实可访问性”“情感显著性”“记忆抑制”全部拆分为可打印日志变量方便调试观测。2.3 冲突监测与反思控制双加工理论区分快直觉1类、慢反思2类处理流程执行功能分为抑制、更新、切换三大独立操作冲突监测理论认为不相容响应会触发控制增强信号类比前扣带回ACC功能。本文控制器仅借鉴功能逻辑不做脑区神经仿真通过LLM实现多约束融合反思决策。2.4 精神分析启发计算模型现存缺口现有基于精神分析概念的算法仅做概念类比缺少受控消融实验验证单一模块增益。本文仅借用本我/自我/超我作为通俗隐喻核心模块全部定义可量化计算规则通过消融实验隔离“语义粗筛显著性重排序”这一核心创新机制。3 PsychoAgent整体架构单步决策循环双记忆存储两大核心组件每轮流程读取环境与内部状态→分别检索事实、情感记忆→生成语言与动作→更新记忆、情感状态。所有冲突约束完整写入提示词控制器显式处理多重矛盾无隐藏思维链。3.1 模块职责与智能体状态核心控制器冲突感知执行模块唯一决策LLM承担2类慢反思处理融合外部上下文、检索记忆、人格规范、多重情感倾向。类比ACC仅为功能隐喻不仿真生物神经。自动情感压力类本我当前情感向量高显著性记忆提供快速直觉式响应倾向。规范自我约束类超我固定人格、长期信念、加权人际关系权重约束行为边界。单步完整状态定义st(A,xt,pt,Rt,MtC,MtA)s_{t}\left(A,x_{t},p_{t},R_{t},M_{t}^{C},M_{t}^{A}\right)st(A,xt,pt,Rt,MtC,MtA)AAA固定人格与长期信念xtx_txt当前外部观测上下文ptp_tpt动态情感向量取值0~10RtR_tRt人际关系权重图取值[-10,10]MtCM_t^CMtC事实记忆库MtAM_t^AMtA情感记忆库情感状态更新公式pt1clip[0,10](ptηpg(xt,at,ΔMt))p_{t1}\operatorname{clip}_{[0,10]}\left(p_{t}\eta_{p}g(x_{t},a_{t},\Delta M_{t})\right)pt1clip[0,10](ptηpg(xt,at,ΔMt))ηp0.1\eta_p0.1ηp0.1g(⋅)g(\cdot)g(⋅)为LLM计算情感变化量。3.2 双记忆库检索流程每一次交互生成两条绑定记忆客观事实记录、附带情感权重的解读情感显著性wj∈[0,1]w_j\in[0,1]wj∈[0,1]。事实记忆检索直接取语义相似度Top10NtCTopK10(sim(φ(qtC),φ(ki)))\mathcal{N}_{t}^{C}\operatorname{TopK}_{10}\left(\operatorname{sim}(\varphi(q_{t}^{C}),\varphi(k_{i}))\right)NtCTopK10(sim(φ(qtC),φ(ki)))情感记忆双层检索第一步语义粗筛30条候选NtpreTopK30(sim(φ(qtA),φ(kj)))\mathcal{N}_{t}^{\mathrm{pre}}\operatorname{TopK}_{30}\left(\operatorname{sim}(\varphi(q_{t}^{A}),\varphi(k_{j}))\right)NtpreTopK30(sim(φ(qtA),φ(kj)))第二步按情感显著性降序重排保留Top10NtATopK10(sort↓{wj:kj∈Ntpre})\mathcal{N}_{t}^{A}\operatorname{TopK}_{10}\left(\operatorname{sort}_{\downarrow}\{w_{j}:k_{j}\in\mathcal{N}_{t}^{\mathrm{pre}}\}\right)NtATopK10(sort↓{wj:kj∈Ntpre})设计优势先过滤完全无关情感记录再优先调取冲突高权重记忆兼顾文本匹配与情感逻辑。最终输入上下文固定10条事实10条情感所有基线上下文长度严格对齐。3.3 记忆读写与离线重组控制器日志记录四类操作新建记忆、短期抑制、长期固化、显著性权重修正对应认知科学“主动遗忘”机制。每模拟日执行一次离线重组整合全天事件、情感、人格、人际关系生成一段象征性文本临时记忆次日参与检索后自动删除类比睡眠记忆重组。4 实验评测方案4.1 三组受控冲突场景全部场景内置固定人格、关系、15条事实记忆、36条情感记忆、10条预标注冲突关键记忆三组场景家庭财务冲突拖欠电费、家务分配不均冲突记忆关键词经济不稳定、愧疚职场侵占创意被同事无视盗用冲突记忆关键词能力抹杀、恐惧报复友情背叛私密信息被外泄冲突记忆关键词信任破裂、害怕决裂三套对照架构上下文总量均为20条完整PsychoAgent双记忆库语义粗筛显著性重排序语义消融基线双记忆库但仅依靠语义相似度排序移除显著性模块单记忆RAG基线事实情感合并单库仅语义Top20检索实验模型Gemini 2.5 Flash温度0.7嵌入使用Gemini Embedding 2768维每个场景3个随机种子101/202/303总计27组生成样本。4.2 量化指标与统计检验核心指标冲突关键召回率CRRCRR(s,v)∣Cs∩Rs,vA∣∣Cs∣\operatorname{CRR}(s,v)\frac{|C_{s}\cap R_{s,v}^{A}|}{|C_{s}|}CRR(s,v)∣Cs∣∣Cs∩Rs,vA∣CsC_sCs场景内10条标准冲突记忆Rs,vAR_{s,v}^ARs,vA架构v检索到的情感记忆。统计方案检索指标精确弗里德曼置换检验216种排列计算p值事后霍尔姆校正成对威尔科克森符号秩检验人工打分先对每位标注者所有分数做z标准化消除打分松紧差异再统计均值一致性使用有序Krippendorff α4.3 五人盲审人工评估5名独立标注者打乱样本顺序完全不知道架构组别5项打分维度1~5分人格一致性、记忆贴合度、冲突敏感度、自然度、行为合理性。4.4 3天长时序仿真家庭财务连续模拟按模拟日划分三轮离线重组记录全天情感向量变化、重组前后记忆显著性波动仅做演示无标准化量化指标。5 实验结果5.1 检索召回量化结果架构冲突关键召回率平均情感显著性平均语义相似度完整PsychoAgent0.933 ± 0.0580.902 ± 0.0040.718 ± 0.025语义消融基线0.500 ± 0.1000.789 ± 0.0270.729 ± 0.026单记忆RAG基线0.667 ± 0.1150.792 ± 0.0380.734 ± 0.028弗里德曼检验p0.0278完整架构三组场景召回全部最高仅牺牲0.011平均语义相似度换取0.433召回大幅提升。5.2 标准化人工打分均值±标准差架构人格记忆贴合冲突敏感自然度行为合理综合总分完整PsychoAgent0.15±0.310.26±0.210.11±0.730.36±0.310.23±0.470.22±0.23语义消融基线-0.25±0.430.02±0.40.14±0.88-0.19±0.36-0.17±0.67-0.09±0.17单记忆RAG基线0.10±0.42-0.27±0.52-0.25±0.96-0.18±0.60-0.06±0.76-0.13±0.30全部成对校正后p0.05描述上完整架构综合表现最优但无统计显著差异原始5分制平均分完整4.76、消融4.62、单RAG4.60。5.3 长时序仿真关键观测角色Sara全天负面情感压力、悲伤持续上升情绪曲线连续变化每日离线重组后冲突类记忆显著性大幅下降实现情绪缓释重组生成的临时梦境文本会复用历史冲突元素但弱化对抗倾向。6 消融实验核心结论双记忆库显著性重排序是核心增益模块固定上下文长度下冲突记忆召回提升近一倍双层检索设计先语义粗筛、再情感排序避免完全无关高情绪记忆污染上下文仅靠语义匹配的基线会丢失大量文字不同但冲突根源一致的历史记录人工打分天花板效应明显所有架构生成文本质量均偏高难以拉开显著差距长时序离线重组可动态调节记忆权重模拟人类情绪缓释过程。7 局限性与伦理边界仅3组人工编写冲突场景场景覆盖有限固定预标注冲突记忆真值无法适配开放未知冲突人工打分存在天花板效应统计区分度不足架构仅为计算模拟不代表AI具备真实情绪、潜意识仅用于学术仿真不可作为心理诊疗工具。8 结论本文提出PsychoAgent情感敏感认知架构分离事实与情感记忆采用“语义粗筛情感显著性重排序”双层检索机制。三组受控实验证明相比传统单语义RAG冲突关键记忆召回率大幅提升仅损失极小语义匹配精度。盲审人工评估完整架构综合表现最优长时序仿真验证情感长期留存、离线记忆重组能力。该架构提供可量化、可日志追溯的类人冲突决策仿真工具为情感智能体、对话记忆优化提供标准化基线。8.1 数据与代码开源说明完整匿名实验工件开放包含场景数据集、27组生成输出、检索日志、人工打分原始数据、全套分析Python代码不含标注者个人隐私信息。8.2 利益冲突声明全部作者无相关利益冲突。附录A 核心实验Python代码1 冲突召回率CRR计算defcalc_crr(critical_set,retrieved_set):interlen(set(critical_set)set(retrieved_set))returninter/len(critical_set)2 情感记忆双层检索实现importnumpyasnpfromsentence_transformersimportSentenceTransformer embed_modelSentenceTransformer(gemini-embedding-768)defretrieve_affective(query,all_memories,top_pre30,top_final10):# 1 计算语义相似度q_embembed_model.encode(query)mem_sim[]formeminall_memories:embembed_model.encode(mem[text])simnp.dot(q_emb,emb)/(np.linalg.norm(q_emb)*np.linalg.norm(emb))mem_sim.append({sim:sim,weight:mem[salience],text:mem[text]})# 2 语义粗筛top30pre_candidatessorted(mem_sim,keylambdax:x[sim],reverseTrue)[:top_pre]# 3 按情感显著性重排序取top10finalsorted(pre_candidates,keylambdax:x[weight],reverseTrue)[:top_final]return[item[text]foriteminfinal]3 弗里德曼置换检验统计脚本fromscipy.statsimportwilcoxondeffriedman_permutation(data,n_perm216):# data: [场景数, 架构数] 召回率矩阵pass# 完整置换统计代码见附件analysis/stat_test.py4 3天长时序仿真主脚本# sim_longtrace.pyfrompsycho_agentimportPsychoAgent# 初始化家庭财务场景agentPsychoAgent(scenefamily_finance)# 模拟三日交互循环fordayinrange(3):print(f模拟第{day1}天)# 全天多轮交互forturninagent.daily_dialogs:agent.step(user_inputturn)# 每日离线记忆重组agent.offline_recombination()# 输出当日情感与记忆权重日志agent.dump_trace(f./log_day{day1}.json)完整开源资源清单论文PDFhttps://arxiv.org/pdf/2608.06346全套实验仿真源码附件artifact压缩包三组冲突场景数据集、提示词模板supplementary_material.pdf检索、统计、长时序仿真Python脚本附录完整代码人工打分标准化工具、Krippendorff一致性计算eval_rater.py批量消融实验调度脚本run_ablation.py嵌入模型、Gemini推理配置yaml文件config/所有实验原始日志、打分表格output_logs/文件夹