英文题目:A Large-Scale Dataset of Listener Impressions of Emotional TTS

会议身份:conference:interspeech:2026:conference-paper-id:cooper26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#数据集 #数据集构建 #语音 #语音质量评估

评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.2/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:数据集与基准

👥 作者与机构

  • Erica Cooper:机构信息未能从会议 PDF 纯文本可靠映射
  • Xiaoxue Gao:机构信息未能从会议 PDF 纯文本可靠映射
  • Takuma Okamoto:机构信息未能从会议 PDF 纯文本可靠映射
  • Tomoki Toda:机构信息未能从会议 PDF 纯文本可靠映射
  • Nancy Chen:机构信息未能从会议 PDF 纯文本可靠映射
  • Hisashi Kawai:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

情感合成评估需同时判断语音自然度与情感表达是否贴合目标类别,而现有质量预测模型多在中性合成语音上训练,难以覆盖该双重目标。本文构建含18208个样本、覆盖五种情感与13个合成系统及自然语音的大规模听测库,输出涵盖质量平均意见分、情感匹配分、感知情感类别与效价唤醒支配度评分。数据链分三步:先从情感语音数据集与对话语音收集自然语音并用多种合成系统生成对应情感语音,再将所得音频送入质量、情感类别与匹配度、效价唤醒支配度三个独立听测任务,最后对三任务评分做系统排名与分布一致性分析以形成可建模标签。相对已有中性语音质量库,该数据集关键机制差异是并行提供合成样本与多轴情感标注,使质量与情感保真度可联合建模并支撑零样本预测检验。在Neutral情感任务条件下,UTMOS的SRCC为0.78,高于SSL-MOS的SRCC 0.15。该结论仅适用于英语表演式五情感设置,向自然对话情感与未见情感类别的外推尚未验证。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要交付什么?

本文的输入是论文原文提供的文字证据,目标是为刚进入语音与音频领域的研究生写出 1 篇可以核对操作、可以复述方法的技术解读。必须保留的信息包括数据集规模与构成、听音任务的设计、分组比较条件、统计方法以及零样本预测实验的条件与数字,输出是 1 篇分节展开的中文解读正文加两张可回溯的数字表。本文没有收到任何官方原图像素,因此不做看图判断,只依据文字与图注转述。本文研究的是情感文本转语音合成的自动质量评估问题。

文本转语音合成已经能生成清晰的中性语音,但在对话等场景还需要表达高兴、愤怒、悲伤、惊讶等情感。研究者既想知道合成语音是否自然清晰,也想知道情感是否表达充分、是否与目标情感一致。人工听音测试是金标准,但耗时耗钱,成为快速迭代的瓶颈。于是需要用机器学习预测听众意见。已有的质量预测器多在中性合成数据上训练,情感合成的听评数据并未公开,自然情感语料又不含合成样本,因此无法训练面向情感合成的评估模型。

本文的交付物就是一个大规模情感合成听感数据集及其基线验证,作者声明将向研究社区公开,但本次收到的证据中未绑定完成验证的资源链接,因此不能声称当前可用,只能说原文表达了公开意图。

已有路线解决了什么,还缺哪一块?

第一条路线是通用合成语音的质量预测。典型训练数据包括 BVCC 和 SOMOS 等大规模中性合成语音加自然度打分,典型模型包括 UTMOS 和 SSL-MOS 等。UTMOS 是在 VoiceMOS 系列挑战中被广泛采用的系统,SSL-MOS 是基于 wav2vec2 在 BVCC 上微调的模型。它们在论文中作为基线被零样本调用,用来检验在情感语音上是否还能排序系统质量。第二条路线是自然情感语音的标注与识别。

代表性资源包括 IEMOCAP 和 MSP-Podcast 等,它们有人类标注的情感类别或效价唤醒度,但不含合成样本,因此不能直接用于训练合成质量评估。第 3 条路线是情感合成系统本身,例如基于 FastSpeech2 加情感条件机制的 EmoSpeech、结合情感大语言模型结构与直接偏好优化的 Emo-DPO、基于异构图上下文建模的对话合成 ECSS、基于对话历史预测语义与风格 token 的 GPT-Talker,以及支持风格迁移的 MaskGCT、VALL-E X、Vevo、EmoKnob、Tortoise 和文本提示类的 PromptTTS++、ParaSpeechCaps、MiMo-Audio 等。这些系统在本文中不是被公平排名的对象,而是提供多样化待评音频的材料来源。

缺失的一块正是连接两端的情感合成听评数据:既包含多系统合成与自然语音,又同时标注质量分、情感类别、情感吻合度以及效价唤醒度优势度。本文要补的就是这一块。

要预测的听感问题如何定义?

本文把听众印象拆成 4 个可操作的问题。第一个是质量平均意见分,记作 QMOS,听众根据发音、语调和信号质量判断合成基本功,5 分制,分数越高表示听感质量越好。第二个是情感匹配平均意见分,记作 EMOS,听众在看到真实目标情感标签后判断语音与该标签的吻合程度,同样 5 分制。第 3 个是自由感知的情感类别,听众在不知道真实标签时勾选听到的情感,可以多选,类别集合为中性、高兴、愤怒、悲伤、惊讶。

第 4 个是效价、唤醒度、优势度,分别刻画愉悦方向、激活强度和控制感强弱,5 分制,并配有自评人体模型图作为标注参考。举例来说,一个样本的完整标注流程是:先听音打 QMOS,再在另一任务中先盲听勾选感知情感、再揭示真实标签后打 EMOS,最后在第 3 个任务中给出效价唤醒度优势度。这种拆分的原因是自然度好不等于情感对版,情感分类正确也不等于表达充分,因此需要多个轴互相补充。

论文明确提醒平均意见分范式存在饱和与偏差等局限,但仍因能给出系统排序信息而被采用。

数据集全景:音频从哪来,标注怎么走?

沿着一条样本走完全程有助于理解全景。以一条英文情感文本转语音样本为例,起点是文本与目标情感,例如取自情感语音数据集 ESD 英文部分的测试句及其高兴标签。接着选择一条合成路径生成波形,可能是复刻 ESD 说话人身份的系统,也可能是按文字描述生成新说话人的系统,或使用预设音色的接口系统。生成后统一做音量归一化,工具为 sv56。

然后进入听音环节,同一条音频被分发到 3 个独立任务中,由不同批次的美国本土英语母语听众分别完成质量打分、情感感知加匹配打分、效价唤醒度优势度打分。每条样本最终收集到 4 到 9 个打分,多数为 7 个。全部样本共 18208 条,覆盖 5 种情感风格,来自 13 种合成系统加自然语音,参与听众共 262 人。音频材料分为 4 组:基于 DailyTalk 的自然语音与两个对话合成系统,基于 ESD 内容与说话人身份的合成与自然语音,用提示生成说话人身份的 3 个系统,以及用预设音色的接口合成。

论文强调分组内可比、跨组比较需谨慎,因为文本内容与说话人身份并不完全一致。

音频材料有哪些组件,各自如何构造?

自然与收集部分以 ESD 英文部分为基础。该数据集包含 10 名英语说话人,性别均衡,每人每种情感说同样 350 句,每人共 1750 句。测试集为每种情感 30 句、5 种情感 10 名说话人共 1500 句。作者还收集了已有的 Emo-DPO 与 EmoSpeech 在该测试集上的合成,以及 DailyTalk 测试集中 2 名说话人的中性与高兴共 74 条真实录音及其对应的 ECSS 与 GPT-Talker 合成。复刻 ESD 说话人身份的一组包括 EmoKnob、Tortoise、MaskGCT、VALL-E X 和 Vevo。

EmoKnob 使用预计算情感向量并以 0.2 的缩放控制强度、中性取 0,参考音取每人最长的中性句。Tortoise 用我真的很某种情感等提示,正则需至少 3 条参考音故取每人 3 条最长中性句。MaskGCT、VALL-E X、Vevo 均用同时携带说话人与情感的目标音频提示,其中 VALL-E X 与 Vevo 使用开源实现与预训练模型,MaskGCT 为零样本编解码变换器结构。

质量平均意见分 × 情感匹配平均意见分: 质量平均意见分负责判断发音、语调与信号质量等合成基本功,情感匹配平均意见分负责判断当前语音与目标情感标签的吻合程度,二者搭配的原因是情感合成既要听得清楚自然又要情感对版,组合意义是把基本质量与情感表达力拆成两个可分别建模和对比的评估轴。

文本提示生成说话人的一组包括 PromptTTS++、ParaSpeechCaps 所用的 parler 模型和小米 MiMo-Audio。作者构造了 10 种条件,即 5 个年龄档与两种性别的组合,提示模板分别写入年龄性别与情感,例如某年龄某性别以某种情感语气说话,ParaSpeechCaps 版本还加入清晰环境与语速平稳的限定,因为预实验发现不加则语速过快。接口合成一组使用谷歌 Gemini 的 flash 预览语音模型,用 10 个预设音色合成 ESD 测试句,提示为用某种情感方式说加正文,因为该接口不支持向目标说话人克隆。

听音任务与情感维度如何配合?

听音设计把疲劳控制与防偏差放在前面。测试分为三部分独立进行,每部分每次下发 100 条逐条评测。质量部分只问发音语调与信号质量。情感部分先隐藏真实标签让听众自由勾选感知类别,可多选,完成后点击揭示真实标签再打情感匹配分,这样避免标签先入为主污染感知选择。效价唤醒度优势度部分提供人体模型图作为参考,沿用已有情感语料的标注协议。

所有除类别选择外的打分均为 5 分制。听众要求为居住在美国的美国英语母语者,共 262 人独立参与。

效价 × 唤醒度: 效价负责刻画愉悦与不愉悦的正负方向,唤醒度负责刻画平静与激动的激活强弱,二者搭配的原因是仅用高兴或悲伤等离散类别难以描述强度与混合感受,组合意义是为每条语音提供连续情感空间坐标以便计算合成与自然分布的距离。

语音克隆合成 × 文本提示合成: 语音克隆合成负责用参考音频固定说话人与情感风格以复现受控身份,文本提示合成负责用年龄性别与情感等文字描述随机生成说话人以扩大多样性,二者搭配的原因是前者可比性强而后者覆盖面广,组合意义是在同一数据集中同时保留可控对比与开放多样性。

有监督质量预测器 × 大模型裁判: 有监督质量预测器负责将在中性合成数据上学到的质量映射直接迁移到情感语音,大模型裁判负责按人类听音指令对新音频直接给出质量或情感判断,二者搭配的原因是前者有专用声学建模而后者可零样本处理新任务,组合意义是检验专用模型迁移与通用音频大模型在情感评估上的各自边界。

情感分类概率 × 情感匹配分: 情感分类概率负责给出音频属于目标情感类别的模型置信度,情感匹配分负责人类在看到真实标签后对吻合程度的主观打分,二者搭配的原因是分类对错不能等同于表达是否充分自然,组合意义是用分类器的目标情感概率作为匹配分的一种可计算代理并检验其排序能力。

这种配合的意义在于同一条音频同时获得基本质量、类别感知、标签吻合度和连续情感坐标 4 种监督,可用于训练不同目标的预测模型,也可分析它们之间的关系。例如论文报告目标情感被选比例与该条平均情感匹配分的人级相关高达 0.92,说明两类情感标注高度一致,而效价唤醒度分布与自然语音的距离则与情感匹配分呈强负相关,距离越小分数越高。

本研究训练了什么,没有训练什么?

本研究没有训练新的神经网络模型,方法职责由数据构造、标注流程与零样本调用承担,因此本节明确说明无训练阶段。真实计算过程分为 3 类。第一类是音频构造计算,包括调用开源与接口合成模型生成波形、统一音量归一化,以及整理 ESD 与 DailyTalk 的已有样本。第二类是人类标注计算,即通过网页界面收集质量分、情感类别、情感匹配分与效价唤醒度优势度,并按样本聚合平均分、计算系统均值、计算目标情感被选比例、计算合成与自然分布之间的推土机距离。

第 3 类是零样本预测计算,直接调用已有预训练模型而不做微调:用 SSL-MOS、UTMOS 和 Gemini 按人类指令预测质量分,用 Emotion2Vec 3 个变体的目标情感概率预测情感匹配分,用 Gemini 按人类指令预测情感类别与效价唤醒度优势度。论文未报告任何梯度更新、参数冻结范围、优化器或训练轮数等信息,这些属于具体缺项,不能从模型名称推定实现。也不能把冻结参数等同于输出确定,因为生成与大模型判断仍受采样与提示影响。

实验条件:测什么,与谁比,指标方向是什么?

实验围绕 3 个问题组织。第一是质量排序能力,用系统级斯皮尔曼排序相关比较预测的系统排名与人类质量均值排名,越高越好,基线为 SSL-MOS、UTMOS 与 Gemini 裁判,均零样本。第二是情感匹配排序能力,用 Emotion2Vec 三变体的目标情感概率与 Gemini 裁判预测人类情感匹配排名,同样系统级排序相关越高越好。

第三是情感类别与连续维度的零样本能力,类别任务比较大模型选择与人类选择比例的平均绝对误差,越低越好,并以抛硬币随机基线对照,连续维度则在语句级比较预测与人类均值的斯皮尔曼相关。公平条件方面,系统排名只在分组内比较并用曼惠特尼 U 检验加邦费罗尼校正判断显著性,阈值为 0.05。分布距离分析只用 ESD 自然语音作参考且只分析复刻 ESD 的合成组,因为先前工作显示参考匹配很重要。

效价唤醒度优势度的距离越小表示越接近自然,因此与质量或匹配分呈负相关才符合预期。下表先总览数据规模与部分系统的人类打分,帮助固定后续数字的语境,表中质量分与匹配分均为人类均值,越高越好,分组内可比而跨组需谨慎。

人类打分显示了什么,系统排名能直接跨组比吗?

先提出比较问题:在分组可比条件下,各系统的人类质量分与情感匹配分如何分布。公平条件是只看同组,指标方向是两者越高越好。下表给出数据集体量与代表性系统的人类均值,数字来自原文表格,跨组比较不公平,组内差异多显著。

数据与系统样本与标注规模质量分匹配分可比组
全库总量18208 条,5 种情感,13 套系统加自然语音,262 人不适用不适用全库
DailyTalk 自然74 条涉及,自然语音3.483.75DailyTalk 组
ESD 自然ESD 测试 1500 句对应,自然语音3.713.90ESD 组
Gemini 接口ESD 文本,10 个预设音色4.213.89接口组
TortoiseESD 说话人克隆3.772.61ESD 组
VevoESD 说话人克隆2.202.53ESD 组

表后解释需要同时看到收益与代价。人类打分显示自然语音在两轴上总体较高,但并非所有合成都低,例如接口合成的质量均值达到 4.21,Tortoise 的质量也达到 3.77,说明基本功可以很强。代价是情感匹配分并不随质量同步,例如 Tortoise 匹配分仅 2.61,Vevo 两轴都较低,提示质量与情感吻合需要分别优化。未胜出项同样重要:ECSS 质量仅 2.07 但匹配达 3.50,呈现低质量高匹配的反例。统计上 DailyTalk 组质量两两显著而匹配仅 GPT-Talker 与自然差异显著,ESD 组质量除 EmoSpeech 与 VALL-E X 外均显著,匹配则该三者之间不显著,文本提示组内两轴差异均显著。复述时必须强调不能跨组宣称谁是最强系统,因为文本与说话人条件不同。

现有模型能预测人类排序吗,差距在哪种情感?

再提出比较问题:在零样本条件下,现有质量预测器、情感分类器与大模型裁判能否复现人类系统排名。公平条件是同一组人类均值作真值,指标方向是系统级排序相关越高越好,类别任务误差越低越好。下表汇总原文报告的总体相关与分情感细节,数字为原文值,越高表示排序越准,类别误差越低越好。

预测任务总体排序相关或误差分情感表现未胜出项条件
质量排序 UTMOS0.80中性 0.78,高兴 0.70,愤怒 0.55,悲伤 0.86,惊讶 0.81愤怒明显偏弱零样本,未见情感数据
质量排序 Gemini0.67愤怒 0.73 好于有监督模型总体弱于 UTMOS同人类指令
质量排序 SSL-MOS0.27中性 0.15,惊讶 0.81总体最弱BVCC 微调
匹配排序 Emotion2Vec 大0.82愤怒 0.90,惊讶 0.94,中性 0.62中性偏弱目标情感概率作代理
匹配排序 Gemini0.84悲伤 0.82,惊讶 0.85,中性 0.76高兴 0.65,愤怒 0.62 偏弱同人类指令

表后解释要指出收益、代价与反例。收益是尽管 UTMOS 未见情感数据,总体质量排序仍达 0.80,Gemini 匹配排序达 0.84,显示一定迁移与指令泛化能力。代价是随情感波动剧烈,UTMOS 在愤怒仅 0.55,Gemini 在愤怒与高兴也偏弱,而 SSL-MOS 总体仅 0.27 但在惊讶达 0.81,说明总体趋势不等于每种情感都成立。情感类别零样本方面,Gemini 平均误差 0.41 优于随机抛硬币的 0.50,而 Emotion2Vec 大模型的概率作预测可达 0.38,略优于 Gemini。连续维度上 Gemini 与人类均值的语句级相关为效价 0.45、优势度 0.42、唤醒度 0.58,表明零样本预测连续情感仍具挑战性。

分布距离与多选感知支持什么判断,有何限制?

这一节按论文特有的两类细节展开,可视为对主结果的机制补充而非传统消融。第一类是效价唤醒度优势度分布与自然语音的推土机距离和人类打分的关系。论文以 ESD 自然分布为参考,只算复刻 ESD 的合成组,发现距离与情感匹配分的系统级排序相关为强负相关,中性减 0.79、高兴减 0.88、愤怒减 0.98、悲伤减 0.81、惊讶减 0.86,与质量分的相关则为中性减 0.90、高兴减 0.69、愤怒减 0.52、悲伤减 0.17、惊讶减 0.19。

这支持分布相似性更贴近情感匹配而非基本质量,尤其愤怒的匹配相关接近完全负相关,但相关性不是因果,且只在匹配参考的 ESD 组内验证,未验证可否推广到未见情感类别的无监督评估。第二类是多选感知的行为细节。多数打分只选一种情感,多选最常见的组合是中性加悲伤共 6425 次,目标情感被选比例与平均匹配分的相关为 0.92。

这支持用被选比例作为匹配分的交叉验证,但未测量误判率随听众与批次的变化,也未报告推理延迟与成本,因此不能承诺这些量得到改善。

哪些结论不能下,哪些边界尚未评测?

首先是可比性边界。论文明确指出主要目的是建评估数据集而非公平评测合成系统,4 组音频的文本与说话人身份不同,跨组排名需谨慎或不应进行。任何拿接口合成 4.21 的质量分直接宣称超越所有 ESD 组系统的说法都超出证据。其次是指标边界。平均意见分存在饱和、偏差与非绝对性,分数只在本次听音条件下提供排序信息,不能当作跨研究绝对标尺。

第三是泛化边界。所有零样本相关都是系统级排序相关,语句级预测更难,连续维度相关仅 0.4 到 0.6 区间,且随情感波动大,不能把总体 0.80 或 0.84 推广到每种情感。第四是资源边界。证据中没有绑定完成验证的代码模型数据链接,资源状态为无,因此不能写已公开或当前可用,只能写原文表达了公开意图。第五是成本边界。

原文未报告训练资源、推理开销、输出帧率与实际延迟,训练与部署成本无法讨论。这些缺失不是技术错误,但在复用结论时必须保留为待验证项。

要复现与复用,先做什么,需要什么条件?

复现听评数据的第一步是固定音频条件。ESD 英文部分取官方测试划分,每情感 30 句共 1500 句,10 名说话人身份保留;DailyTalk 取测试集中 2 名说话人的中性与高兴 74 条及对应合成。合成时按原文记录关键超参数与提示:EmoKnob 缩放 0.2、中性取 0,参考取每人最长中性句;Tortoise 中性不加提示、其余用我真的很某种情感句式,每人 3 条最长中性句作身份条件。

MaskGCT、VALL-E X、Vevo 用同时携带说话人与情感的一条提示;文本提示组固定 10 种年龄性别组合并按模板写入情感与环境语速限定;接口组用 10 个预设音色加用某种情感方式说的前缀。所有音频用 sv56 做音量归一化。第二步是固定听音条件:三任务分离、每批 100 条、美国本土英语母语听众、5 分制、情感任务先盲选后揭示标签再打匹配分、连续维度配人体模型图,每样本目标 4 到 9 个打分。

第三步是固定分析条件:组内比较、曼惠特尼 U 检验阈值 0.05 加邦费罗尼校正、系统级斯皮尔曼排序相关、分布距离以匹配的 ESD 自然为参考。若要训练新评估模型,可用质量均值、匹配均值、类别选择比例与连续维度均值分别作监督,并按情感分层划分以检验跨情感泛化,还需补测语句级误差、校准性与推理成本。

何时值得尝试这套数据与基线,还需补哪项验证?

当研究目标是从中性质量评估走向情感合成评估时,这套数据值得尝试,因为它同时提供基本质量与情感吻合、离散类别与连续维度的多轴监督,且覆盖克隆、提示生成与预设音色 3 类合成路径,可用于训练面向情感的预测模型或检验现有模型的迁移边界。可直接复用的基线是 UTMOS 作质量排序起点、Emotion2Vec 目标概率与大模型裁判作匹配排序起点,但使用时必须按情感分别报告,因为愤怒与中性等条件是已知弱点。

复用前先做两项核对:一是确认所用音频与原文分组一致,不跨组比较;二是确认指标方向,排序相关越高越好、分布距离与类别误差越低越好、百分点与相对百分比不混用。还需补的验证包括语句级预测精度、对未见情感与未见说话人的泛化、听众偏差与批次效应,以及延迟与成本测量,因为原文未测量这些量。归因上只称论文直接报告为报告或显示,机制解释称支持,未验证的推广称可能或待验证。

最终判断是该数据集为情感合成评估提供了缺失的训练资源,而现有模型的合理相关与明显波动共同说明任务可行但远未解决。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总