论文 MentalGPT:Measuring Long-Context Empathy in Large Language Models via Emotional Consistency 被 IEEE Transactions on Affective Computing(CCF-B,中科院1区)接收,恭喜鸿宇!
论文主题内容介绍
研究背景
大语言模型(LLM)在心理健康相关的支持性对话——如压力应对、情绪陪伴与反思性交流——中展现出巨大潜力。与传统的规则式或任务型对话系统相比,LLM 能够生成开放式、上下文感知的回复,其表达常常接近人类的共情水平。在这些情绪敏感的场景中,共情(Empathy)被广泛认为是维持用户信任、降低情绪不适当回复风险的核心要求,因此 LLM 驱动的助手机器人被越来越多地探索为可扩展的支持工具。
然而,现有的共情能力评测主要集中在单轮或短上下文场景,隐式地假设情绪状态可以在局部被评估。在真实的支持性对话中,用户带有情绪的重要自我暴露往往会引入一段「未解决的情绪上下文」,它会持续存在并影响后续多轮交互。具体表现为:模型要么忘记更早的情绪暴露,要么把「情绪掩饰」误判为「情绪已解决」,要么在情绪被隐式回 call 时无法重新对齐。这一「长上下文共情」维度长期未被系统研究,现有的评测范式缺乏检验这些长程失效模式的机制。
为解决上述问题,本文提出长上下文共情(Long-Context Empathy)的概念,将共情定义为一个跨越多个对话轮次、在未解决情绪上下文下的一致性(Consistency)属性,而非单个回复的独立特征。基于这一视角,本文形式化定义了关键情绪事件(Key Emotional Event, KEE),并构建了一个由 3000 个长程对话构成的评测基准,从三个互补的任务设置系统评估 LLM 的长上下文共情能力。
本文的核心贡献包括:
-
提出长上下文共情(Long-Context Empathy)的概念,将共情评测形式化为「未解决情绪上下文下的跨轮一致性」问题,并形式化定义关键情绪事件(Key Emotional Event, KEE),刻画持续存在的情绪背景;
-
设计了一个包含 3000 个长程对话的评测基准,覆盖三种互补的任务设置,分别针对长上下文共情的不同失效模式:关键情绪事件保持(KEER)、情绪掩饰下的一致性(CEM)、隐式回 call 对齐(IRA);
-
提出时间加权的二值 CONSISTENCY 评测指标,聚焦于回复级对齐而非情绪强度打分,并结合 GPT-4.1 自动评测与人工标注(Pearson r = 0.766)验证其可靠性;
-
通过在多个代表性 LLM 上的大规模实验,系统揭示了当前 LLM 在长程共情上的优势与局限:模型普遍具备较强的局部共情表达,但情绪一致性随对话推进显著退化,尤其在情绪被掩饰或隐式回 call 时。
实验结果
实验在 GPT-4.1、Gemini-3-Pro、Claude-3、DeepSeek、Qwen3-235B 和 LLaMA-3-70B 六个代表性 LLM 上展开,采用统一的零样本 prompting 协议,由 GPT-4.1 作为自动评委按任务特定的一致性标准进行二值判定,并辅以 1000 条样本的人工标注进行可靠性验证。
实验结果表明,不同模型的长上下文共情能力差异显著。Claude-3 以 0.7820 的整体 CONSISTENCY 率排名第一,紧随其后的是 DeepSeek(0.6943)和 Qwen3-235B(0.6085);而 GPT-4.1(0.5165)与 Gemini-3-Pro(0.5149)尽管在既有的单轮共情评测中表现较强,在长上下文场景下仅位列第四、第五,LLaMA-3-70B(0.2226)则出现明显退化。进一步的分析显示:情绪一致性随「距 KEE 的距离」增大而衰减;任务难度随情绪相关性变得隐式而递增(IRA > CEM > KEER);受控消融实验则表明隐式回 call 的失效主要源于记忆/检索,而非纯粹的情绪推理。
总体来看,MentalGPT 首次系统评测了长程心理健康对话中的情绪一致性这一被忽视的维度,揭示出「短上下文共情评测」与「真实心理支持需求」之间的关键鸿沟。该基准通过关键情绪事件的形式化、三类互补任务的设定以及一致性导向的评测指标,为情绪敏感场景下 LLM 的安全部署与风险分析提供了评测依据,具有较强的实践意义与研究价值。
赵鸿宇个人介绍
- 研究方向:分布式计算的效率与调度