合成语音的情感为何听得清却认不准:语音情感识别的合成域失效
论文追问在人类语音上训练的情感理解能否直接用于合成语音,通过跨数据集、跨判别式与生成式模型、跨 TTS 与 S2S 合成的系统评测,显示人类与合成之间存在约 38 个百分点的识别差距,且主要代价来自语音 token 预测阶段的表示偏移与生成式模型的文本主导偏置。
论文追问在人类语音上训练的情感理解能否直接用于合成语音,通过跨数据集、跨判别式与生成式模型、跨 TTS 与 S2S 合成的系统评测,显示人类与合成之间存在约 38 个百分点的识别差距,且主要代价来自语音 token 预测阶段的表示偏移与生成式模型的文本主导偏置。
论文指出全局离散符号困惑度把长程语义波动平均进声学判断,提出窗口化与局部化加归一化以及基于真实续写的人评与嵌入裁判评估,并在 SALMon 上以相关性提升与 84.1% 人类差距闭合为证据,代价是依赖转折时刻标注与裁判选择。
论文把可回答性做成输入属性,用语义-声学掩蔽构造配对问答并以不可补偿的 EAR 分数同时考核答题与修复,报告显示多模型答题强但修复弱,而掩蔽加宽能提升修复检出。
针对长程语音角色扮演中崩人设难定位的问题,论文提出把文本路由与音频路由投影到共享情感空间做分路由、按轮次诊断的 PED 框架,并在端到端与级联两种 3B 量级系统上揭示出可分性受限、文本向中性集中、双路由弱耦合等可复述的诊断信号。
论文研究只加音频扰动能否无目标破坏音频视频语言模型的问答,方法是固定视频与文本并用六种损失学习一段可复用的共享扰动,最强证据是组合损失在 AVQA 上达到 96.03% 攻击成功率,代价是跨模型与跨声学域迁移很弱且物理混响下部分目标明显衰减。
论文把多轮语音风格保持定义为首轮指令后的逐轮指令遵循率,用同一话题与同一模拟用户测五类模型,报告首轮尚可但后续迅速退化,并显示显式回忆能部分缓解但需额外轮次代价。
针对无参考语音翻译质量估计中连续分数制造大量文档内微排序噪声的问题,该工作冻结 COMETKiwi-22 只做文本打分再用训练集上搜出的分桶宽度把近似分数压成精确平局,在开发集上把平均段级 Kendall τb 做到 39.4% 而系统级 SPA 维持 88.0% 左右。
该研究在 13 种语言上比较 6 个系统的零样本意图分类,报告混合架构与强级联相当并更能缓解转写错误,而纯端到端明显落后,且多语言效果同时受大语言模型能力与语音编码器识别质量制约。
针对大音频语言模型只看准确率会把猜对误判为真推理的问题,论文提出免人工标注金链的六指标 ARIA-Rubrics 做过程评估,在 9 个模型与 2 个基准上显示准确率与过程质量系统性偏离,而完整 ARIA 与人评 Spearman 达 0.671,代价是仍需冻结的轻量打分模型与外部对齐模型。
该研究用 10982 词、84932 条语义维度标注检验多模态大模型能否从发音形式推断意义,发现模型在多数维度上超过 0.50 基线并在深层更关注标志性音素,但与人类的维度分布仍有明显差距。
论文针对边听边说的全双工语音模型,用固定无关语音研究有害请求后的打断能否抬高整轮有害率,以固定延迟与拒答触发两种可执行时机在四个开源模型和 720 条请求上验证,PersonaPlex 系最高上升约 39 个百分点,但效果随模型、措辞和时机剧烈变化且 BayLing 出现下降。
共收录 36 篇 eacl-2026 会议论文的 Reader 深度解读
针对生成式输出分散在文本、规划序列、时序与图像音频且缺乏可复现比较流程的问题,GAICo 选择事后基于参考的统一比较框架与可扩展指标库,在三管线旅行助手案例中分离编排与执行故障,但仍不覆盖公平性与延迟等维度。
针对语音到语音评价只看文字会漏掉语气、直接听音频又贵又不透明的问题,论文用先分内容音质副语言三维标注再把廉价声学信号写成文字蓝图交给大语言模型推理并按确定性规则融合的方法,在两个公开偏好集上提高了与人的一致性并把音频评测成本降到约三分之一。
针对码切换话语中带矩阵语言口音的英语检出接近零的问题,论文用 80 条口音匹配英语做 LoRA 微调 MMS-LID 并引入 LangRank 排序评估,在印地-英语等四对语言上提升英语检出同时保持单语性能,代价是仍与 Oracle 有差距且依赖已知矩阵语言选口音。
针对改乐器风格情绪时旋律节奏易丢失的问题,Melodia 在冻结的 AudioLDM 2 上做部分逆向并只替换 8 到 14 层自注意力图来保结构,探测分类与三数据集主客观实验支持其在文本贴合和结构保持间的平衡,但综合分依赖跨方法归一化且未报告延迟与误改成本。
该研究用男声女声交叉朗读男性刻板、中性、女性刻板长文本检验五款英西汉语音到语音模型,报告输出声音无可靠漂移但说出的性别判断全部跟随内容,错配时集中误判而固定音色审计看不见该偏差。
该文在两个闭集溯源任务上冻结支撑区做前瞻性单阶段编解码压力测量,显示干净 Macro-F1 超 0.97 的表示仍可单点损失超 50 点且损失随条件与表示剧烈变化,而预注册的匹配保真度比较因无共同支撑不可估计。
在文本+ 语音输入上用固定编码-时序-融合流水线对比 Transformer 与 Mamba 时序主干,并用二维高斯软目标训练 9×9 Valence-Arousal 联合分布头,在说话人无关 LOSO 协议下主系统达 73.0%±0.3 UA 且分布质心可跟踪连续效价/唤醒,但延迟优势在该句长下未出现。
针对同传中为控延迟而产生的改写与概括,EviSI 用共享源证据与 Anchor/Event/Logic/Fluency 分工配合调和与确定性扣分来区分可接受变体与事实错误,在英中方向上恢复了人类系统总排序但在逐条输出上仍表现混杂。