论文解读

静态特质约束动态偏见:CMTD 用认知建模做多模态对话情绪识别

CMTD 针对纯文本与浅层推理在对话情绪识别中误判复杂思维模式的问题,用多智能体分别提取大五人格特质、四步认知扭曲、表情与语音描述再融合预测,在 MELD 与 IEMOCAP 零样本条件下报告优于同条件基线的准确率,同时以多轮大模型调用带来明显更高的时间与费用开销。

 · 更新于 2026-09-24 · 约 16 分钟 · 7691 字 阅读 →
论文解读

情绪神经元是能关掉也能拨动的开关吗:大音频语言模型的因果验证

该研究以语音情绪识别为探针比较四种神经元选择器,用失活与放大的自对交叉对照验证情绪敏感神经元的存在,其中均值偏离与对比间隔选择器显示约 11–15 个准确率点的自效应而交叉影响接近零,但标签无关的联合放大效果不稳定且存在跨数据集部分迁移的代价与边界。

 · 更新于 2026-09-24 · 约 17 分钟 · 8068 字 阅读 →
论文解读

文本为主、音频为辅:用情绪轮约束距离的多模态对话情绪识别

针对文本与音频信息量不等且离散分类忽略情绪远近的问题,EMART 以文本为主做音频参照融合,并用情绪轮角度约束对比学习,在 IEMOCAP 和 MELD 上报告了可复核的准确率与 F1 提升,但未引入视觉且依赖音频编码器选择。

 · 更新于 2026-09-24 · 约 17 分钟 · 8394 字 阅读 →
论文解读

自然互动与多粒度标注:EmotionTalk 如何让中文情感可训练又可解释

EmotionTalk 用 19 名演员主题即兴的 23.6 小时双人对话同时给出 7 类离散标签、连续强度与四维说话风格描述,并以单模态、多模态融合与生成式描述三类基准验证了跨模态不一致带来的难度与融合的必要性。

 · 更新于 2026-09-24 · 约 19 分钟 · 9210 字 阅读 →
论文解读

冻住大模型做共情对话:用语义情绪解耦把文本共情搬到语音

针对共情语音指令数据稀缺与微调大模型易遗忘问题,论文用冻结大模型加语义适配器与情绪抽取器的解耦编码与三阶段对齐,仅用现有语音指令与情绪识别数据实现共情理解与富有表现力语音生成,在共情对话与情绪识别等任务上报告更强结果,但情绪标签随机指派与韵律监督仍有边界。

 · 更新于 2026-09-24 · 约 20 分钟 · 9741 字 阅读 →
论文解读

回归标签太粗、增强又破坏融合:用潜在情感分组做测试时自监督

针对多模态情感回归在测试时分布偏移下的适配问题,GMEL 用 vMF 混合建模潜在情感分组提供自监督,并用多尺度重 dropout 保持模态完整性,在三数据集五种跨域设置上报告平均 ACC 提升 2.53 个百分点、F1 提升 3.70 个百分点、MAE 降低 0.05,代价是需离线访问全部目标数据并估计分组数。

 · 更新于 2026-09-24 · 约 19 分钟 · 9488 字 阅读 →
论文解读

整句重复又帧内粘连:MelTrim 先按声音粗筛再按梯度细剪做语音分类剪枝

针对语音分类中整句之间与句子内部同时冗余的问题,MelTrim 先用声学特征聚类做整句粗筛,再用冻结判别模型梯度范数做帧级细剪,在极小子集上取得明显精度优势,但选择本身带来一次性开销且当前只验证单一声学模态。

 · 更新于 2026-09-24 · 约 18 分钟 · 8750 字 阅读 →
论文解读

情绪幻觉为何分面而治:从六维评估到记忆引导的生成校正

论文针对开放式情绪推理中多面幻觉难评估、粗粒度缓解顾此失彼的问题,提出六面 EHR 评估与免训练 HMER 框架,在 19 个模型上显示幻觉普遍存在,而 HMER 在多数据集上降低总体幻觉率并保持情绪预测准确率,代价是迭代评估带来额外 token 与延迟。

 · 更新于 2026-09-24 · 约 19 分钟 · 9490 字 阅读 →
论文解读

每秒给出群体氛围单值并标记分歧:连续群体情绪的滑动窗口多模态建模

该研究把三人对话的群体情绪定义为每秒的唤醒与效价连续估计,用混合状态平行标记成员分歧,以冻结编码器加时序 Transformer 的因果滑动窗口建模,最强证据是音视频融合在一致性与误差上超过单模态,而高混合区间更大的误差揭示了单值表示的边界。

 · 更新于 2026-09-24 · 约 22 分钟 · 10579 字 阅读 →
每日研究速递

odyssey-2026 论文深度解读

共收录 52 篇 odyssey-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 108 分钟 · 53865 字 阅读 →
论文解读

合成语音的情感为何听得清却认不准:语音情感识别的合成域失效

论文追问在人类语音上训练的情感理解能否直接用于合成语音,通过跨数据集、跨判别式与生成式模型、跨 TTS 与 S2S 合成的系统评测,显示人类与合成之间存在约 38 个百分点的识别差距,且主要代价来自语音 token 预测阶段的表示偏移与生成式模型的文本主导偏置。

 · 更新于 2026-09-24 · 约 19 分钟 · 9120 字 阅读 →
论文解读

用非言语笑声哭声做监督:韵律如何跨到多语言言语情绪识别

论文把低资源多语言情绪识别重写为有标签非言语发声到无标签言语的无监督迁移,用 NOVA-ARC 在庞加莱球中做韵律离散化、强度校准和原型最优传输,最强证据是 APD 非言语到言语适配下多目标持续领先,而代价是依赖双曲码本与传输超参数的联合稳定。

 · 更新于 2026-09-24 · 约 19 分钟 · 9179 字 阅读 →
论文解读

从离散缺失到连续可靠度:QA-MoE 用质量分数压住不可靠专家的路由

针对文本、音频、视觉在噪声与缺失连续变化时情感分析退化的问题,论文用连续可靠度谱统一三种退化协议并提出以偶然不确定性驱动路由的 QA-MoE,在 CMU-MOSI 等基准上保持领先,代价是需要谱感知的数据增强与双分支不确定性建模。

 · 更新于 2026-09-24 · 约 20 分钟 · 9751 字 阅读 →
论文解读

单句之内,声音比文字多说多少:讽刺、情感与疑问的信息分工

论文把讽刺、情感、是否疑问作为离散目标,用文本模型与语音模型分类器的交叉熵估计互信息,在单句无长上下文条件下报告讽刺和情感的音频信息比文本高出一个量级以上、疑问句仅约 2.4 倍,并以音频增量近似韵律独有信息,代价是韵律无独立模型且结论受标注与模型上界约束。

 · 更新于 2026-09-24 · 约 18 分钟 · 8661 字 阅读 →
论文解读

文本带路、解释搭桥、时间对齐:TEXT 如何让音频视频不再带偏情感判断

针对短视频中文本主导而音视频易误判的问题,TEXT 用多模态大模型生成解释做语义锚点,再做解释对齐与轻量时间对齐并以文本路由稀疏专家融合,在四个数据集上取得最低平均绝对误差,但细粒度分类仍有两项未胜出且依赖外部大模型。

 · 更新于 2026-09-24 · 约 20 分钟 · 9732 字 阅读 →
论文解读

表演性之下听出真情绪:以音频为锚的教师多模态情感分析

针对教师情感的表演性与教学情境依赖问题,该研究构造 14,938 条四模态 T-MED 数据集并提出以音频为中心的非对称注意力模型 AAM-TSA,在 T-MED 上报告加权准确率 86.84% 与加权 F1 值 86.37%,代价是依赖视频转文本描述与教学信息输入且未公开可验证代码数据链接。

 · 更新于 2026-09-24 · 约 19 分钟 · 9376 字 阅读 →
每日研究速递

aistats-2026 论文深度解读

共收录 1 篇 aistats-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 3 分钟 · 1387 字 阅读 →
论文解读

浅融合不够,深融合又乱:跨空间协同如何同时管表示与梯度

针对对话多模态情感识别中高阶跨模态交互不足与多目标梯度冲突问题,论文用模态特异低秩多项式融合做表示、用三目标帕累托梯度协调做优化,在 IEMOCAP 上报告 75.42% 准确率、在 MELD 上报告 68.47% 准确率,代价是每轮训练比单分支基线多约 0.66s 的小规模二次规划开销。

 · 更新于 2026-09-24 · 约 21 分钟 · 10175 字 阅读 →
论文解读

只转写不倾听:用四种词义声学关系测音频大模型的情绪依据

论文用词义中性、对齐、冲突和无词四种条件对照文本、音频和图文三种输入,测六个大音频语言模型,发现中性词下音频分仅三成左右、冲突时塌缩到少数类别、非言语接近猜测,说明模型主要依赖词义而非声学线索。

 · 更新于 2026-09-24 · 约 18 分钟 · 8786 字 阅读 →
每日研究速递

eacl-2026 论文深度解读

共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 75 分钟 · 37568 字 阅读 →