论文解读

多数类准确率会骗人:自然脊柱门诊普通话语音的开源情感识别为何在少数情绪上失效

在 65 条自然脊柱门诊普通话话语上比较 emotion2vec+、SenseVoice 与 FunASR 三套开源语音情感识别,以研究者共识为参照,发现非加权准确率 55.4%-61.5% 掩盖了少数情绪接近零的召回与仅约 24% 的样本加权准确率,代价是标注噪声大与类别极不平衡下无法直接部署。

 · 约 18 分钟 · 8817 字 阅读 →
论文解读

把证据运到情绪空间再验算:BiCFlow-MER 的条件输运识别

针对音频文本情绪证据被说话风格与词汇内容纠缠且两模态可能冲突的问题,BiCFlow-MER 用解耦后的冲突感知条件把样本输运到 64 维情绪端点再做前后向几何打分,在 IEMOCAP 与 MELD 及零样本 CASE 上报告最好值,代价是三阶段流程与多模块超参数。

 · 约 20 分钟 · 9794 字 阅读 →
论文解读

只听一句不够:用前面二十多秒对话为当前语音补上情绪走向

针对单句语音情绪识别忽略对话连续性的问题,论文提出只用前文音频做均值池化增强的 ACERT 模块,在 IEMOCAP 上以 25 秒前文将无上下文基线从 68.38% 提高到 79.08%,代价是情绪快速翻转的多人对话如 MELD 几乎无增益。

 · 约 18 分钟 · 8938 字 阅读 →
论文解读

文字分高不等于还在听波形:一次 Qwen2-Audio 量化的三路核对

论文以 Qwen2-Audio 为案例分离词汇输出、转录不足的波形依赖行为与打包实现测量,显示 6 比特翻译选中分配在冻结重放上 chrF 提升但情绪识别下降,而反例与对照说明文本分不能替代波形使用证据。

 · 约 15 分钟 · 7118 字 阅读 →
论文解读

证据越远越难用:Vox-Infinity 按所需历史时长检验语音长上下文

Vox-Infinity 沿轮数与每轮时长拉长语音历史并以最早证据到提问的跨度分组,在七个语音语言模型上报告随证据变远准确率下降的近因效应,以及文本历史保语义而音频历史保韵律的互补代价。

 · 更新于 2026-09-24 · 约 15 分钟 · 7278 字 阅读 →
论文解读

先分离重叠与特有,再用共识引导融合:三视图语音情感识别

针对同一话语的频谱图、MFCC 与 HuBERT 既重叠又互补而直接融合会淹没弱线索的问题,TriCGF 先分解为公共与特有分量再用全局共识加门控融合,在 IEMOCAP 上取得 74.19% 加权准确率与 75.17% 非加权准确率、在 EmoDB 上取得 94.36% 与 94.28%,代价是三路编码与门控带来更多训练配置与调参负担。

 · 更新于 2026-09-24 · 约 19 分钟 · 9121 字 阅读 →
论文解读

矛盾本身就是信号:用差异建模识别犹豫与矛盾

针对跨通道矛盾定义的犹豫与矛盾识别问题,论文选择显式建模模态差异的 9 token Transformer 路线,在 BAH 标注测试集上报告 0.7408 Macro F1,代价是小数据下额外 token 带来的过拟合风险与多窗口训练成本。

 · 更新于 2026-09-24 · 约 18 分钟 · 8750 字 阅读 →
论文解读

生成式读标签为何不稳:用同一隐状态对比判别式读法

针对语音大模型用自回归解码做四分类情绪识别会产生无效标签并偏向多数类的问题,论文在冻结主干上对比同一最终提示词隐状态的生成式解码与单层线性分类头读出,最强证据是加入对话上下文后宏平均 F1 达到 78.14 且在 ASR 转写下从 74.47 提升到 76.50,代价是只验证了 IEMOCAP 四类设置且可解释关联暴露了预训练的文化偏置。

 · 更新于 2026-09-24 · 约 21 分钟 · 10279 字 阅读 →
论文解读

把情感拆成方向与强度:瓶颈专家分治处理多模态情绪

该文把视频多模态情感分析拆为极性判别与强度回归,用极性与强度瓶颈专家分别压缩各模态信息再做跨模态路由融合,在四个中英文数据集与多种语言模型上报告了路由设置与专家分工证据,但未公开代码与完整训练预算。

 · 更新于 2026-09-24 · 约 8 分钟 · 3732 字 阅读 →
论文解读

从镜像情绪到调节情绪:ER-EDF 把感知与调节拆开做共情回复

针对语音共情对话中只做情绪识别就直接生成的问题,ER-EDF 用感知加规则调节再提示生成的链路组织回复,在 IEMOCAP 与 MELD 构造的两种共情参考上多数情况下提升共情指标,但高强度表演式对话与小模型接地能力仍是代价与边界。

 · 更新于 2026-09-24 · 约 22 分钟 · 10770 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

当脸和声音吵架时,人工耳蜗学龄前儿童为什么更信脸

该研究用 48 段高兴与生气冲突或一致的动态视听短片加眼动追踪,检验 27 名人工耳蜗学龄前儿童与 25 名健听同龄人的线索权重与注视分配,发现人工耳蜗组在冲突时显著偏向面孔且眼口注视更均衡,代价是听觉线索利用不足与注视表现关联缺失。

 · 更新于 2026-09-24 · 约 17 分钟 · 8194 字 阅读 →
论文解读

不识别情绪类别,只跟踪状态漂移:用效价唤醒优势曲线看接警员是否还在状态

该研究把接警员投入度与心理灵活性下降转写为可实时跟踪的声音心理生理状态变化,用预训练模型输出效价唤醒优势三轴曲线先在中性到非中性合成序列上验证再在真实接警录音上试探,合成条件下变化可被标出而真实通话结果混杂因而需要更多通话特征。

 · 更新于 2026-09-24 · 约 20 分钟 · 9996 字 阅读 →
论文解读

强烈负情绪下高度熟练者也会漏出母语韵律:以音高范围为核心的证据

该研究让 19 名高熟练牙买加英语、卡斯蒂利亚西班牙语和南部标准英国英语说话人在中性、积极、消极条件下用英语做自发与半自发表达,测量语调短语时长、停顿时长、语速、发音速率和音高范围,发现只有消极高强度情绪带来可重复的组间交互且以音高范围变窄最突出,而发音速率不受情绪影响。

 · 更新于 2026-09-24 · 约 18 分钟 · 8865 字 阅读 →
论文解读

四到七岁听出喜怒哀惧:语言复杂度、目标情绪与双语经验如何分工

该研究用 40 个法语西班牙语非言语声音做四选一情绪识别,报告年龄越大识别越准、喜悦悲伤优于恐惧、非言语声优于句子、五岁双语儿童优于单语,但样本小且组间不均衡使语言效应只能算探索性发现。

 · 更新于 2026-09-24 · 约 21 分钟 · 10083 字 阅读 →
论文解读

赢球和输球听得出来吗:用赛后采访捕捉自发情感的语音数据集

该工作把网球赛后发布会视频加工成带说话人角色、转写和词级对齐的自发情感语音语料,并用预训练声学与文本模型做维度回归、离散分类和文本情感三组基准,显示胜者效价与优势感更高、败者悲伤主导更集中,但两组文本多呈积极且 arousal 差异小。

 · 更新于 2026-09-24 · 约 19 分钟 · 9424 字 阅读 →
论文解读

音乐家识别言语情绪更快:韵律之外还有语义,冲突调节却未占优

用普通话双音节词的情绪 Stroop 任务比较 23 名音乐家与 20 名非音乐家,报告显示音乐家在韵律和语义任务中反应更快且在韵律准确率探索性分析中占优,但组别与一致性的交互不显著,说明优势在加工速度而非冲突调节,且情绪类别仅限高兴与生气。

 · 更新于 2026-09-24 · 约 18 分钟 · 8758 字 阅读 →
论文解读

惊讶不在一个地方:升调看句尾,降调看重音

该研究用上升与下降两套 4×4 重合成连续体检验核重音与边缘调对惊讶感知的相对权重,发现升调主要由句尾音高驱动、降调主要由重音音高驱动,整体效应得到贝叶斯有序模型的支持,但语境与言语行为混淆仍待验证。

 · 更新于 2026-09-24 · 约 20 分钟 · 10009 字 阅读 →
论文解读

敬畏的声音为何又慢又轻又稳:单字韵律中时长、音高变化与共振峰稳定的分工

该研究用 31 名魁北克法语非演员的/papa/六情绪表演与 5 名专家听辨数据,结合 eGeMAPS 声学分析,报告敬畏表达更长、更轻、音色更暗且元音更稳,而听者把敬畏标签投给更长、基频变异更大、第一共振峰变异更小的声音,其中时长效应最强。

 · 更新于 2026-09-24 · 约 21 分钟 · 10074 字 阅读 →