英文题目:Is Natural Always Appropriate? Investigating Naturalness and Appropriateness Across Different Domains for TTS Evaluation
会议身份:
conference:interspeech:2026:conference-paper-id:woszczyk26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#主观评测 #模型评估 #语音 #文本到语音
评分:6.7/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 1.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Dominika Woszczyk:机构信息未能从会议 PDF 纯文本可靠映射
- Andreas Triantafyllopoulos:机构信息未能从会议 PDF 纯文本可靠映射
- Jura Miniota:机构信息未能从会议 PDF 纯文本可靠映射
- Éva Székely:机构信息未能从会议 PDF 纯文本可靠映射
- Bjoern Schuller:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文输入为同一文本在不同下游用途下的合成语音,输出是对人类相似度与领域恰当性的双维感知评分,难点在于一对多的韵律实现与听者期望随场景漂移。方法链分4步:先按朗读、情感对话、动画角色、自发会话与AI助手5类用途精选30句文本与真值音频,再用5个风格迥异的SOTA系统合成全矩阵刺激,接着通过Prolific上150名母语者的拉丁方听测收集双维度5级评分,最后将评分与韵律声学特征及UTMOSv2、DNSMOS、AudioBox等自动指标做句子级Spearman相关。与已有自然度基准相比,关键差异是将评价锚定为是否适合特定角色而非是否像人,从而揭示助手域人类相似度与恰当性呈负相关。在句子级恰当性相关的评测条件下,助手场景的UTMOS相关为0.33,高于演员场景的UTMOS相关-0.59*。结论仅适用于英语女性音色孤立句评测,未验证多轮对话、男性与老年音色及社会身份偏置的外推。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 代码相关资源:https://github.com/domiwk/domain-aware-tts-eval — 链接可访问(HTTP 200)
- 演示资源:https://researcht81.github.io/unconvincing-human → https://researcht81.github.io/unconvincing-human/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
为什么好听不等于好用?
输入是同一句话,目标是把它讲出来,初学者容易以为只要像真人就够了。论文的起点恰好相反:文本转语音是一个 1 对多问题,同一句字面内容可以用无数种重音、停顿和语速讲出来,而且每种讲法只在特定场合成立。给有声书朗读的沉稳声音,放到急救热线、闲聊助手或动画角色身上可能完全不对味。也就是说,评价不能只问信号质量,还要问交付是否对得起任务。长期以来领域用自然度当主目标,最常用的是平均意见分。
论文提醒,平均意见分既不稳定也不绝对,它会随评测设置和听众期望漂移,换一种使用 framing 就可能改变系统排名。当系统整体变强、分数都挤在高位时,一个单一的自然度分数更难反映真实应用中在意的差别。于是研究把焦点从像不像人转向配不配场景,也就是合适度。本文的目标就是让研究生能复述这套转向:不是再刷高一个总分,而是在 5 个明确的下游用途下同时测人类相似度和合适度,看二者何时一致、何时脱钩。
输出不是一句营销式结论,而是一组可核对的条件、数字和反例。后续各节按学习依赖展开,先讲相关路线,再讲本研究的取样、系统、评分和分析动作。
已有评价在测什么,为什么还缺场景?
先把输入、目标和监督对齐,才能理解本文的位置。同输入的客观路线包括基于识别的可懂度、频谱保真度和韵律分布相似度,表情丰富的合成还常用情绪嵌入距离或基频相关去对照目标风格。近期基于角色的基准测指令跟随和角色一致性,有的用大模型当评委。论文指出这些方法只给了局部视图:很多测的是全局相似或重建精度,而不是在具体语境里合不合适;大模型当评委的可靠性本身存疑。
现有基准更偏爱语言学压力测试,例如难读词,而对自发和表情丰富的域覆盖不足。关键是这些与任务无关的分数会忽略情境需求,一个精度很高的模型仍可能在真实用途里被认为不合适。同目标的另一条线是把自然度换成合适度,即生成回复是否配得上交际目的。
已有工作比较过朗读与自发、口音或障碍语音对自然度的影响,也在风格迁移和角色扮演里部分触及合适度,但没有系统地研究当目标任务变化、需要不同的表现力操作时,同一句话会被如何评判。本文的缺口正是这里:固定文本和声音,只改变告知的用途,看期望、容忍度和人类相似度能否预测合适度。后文的方法就是为这个缺口服务的:不是提出新声码器,而是构造一个跨域感知实验,把场景当作自变量。
要回答的具体问题是什么?
问题可以写成可执行的形式。给定同一批句子和同一批合成系统,当告知听众的用途在朗读、演员表演、动画角色、对话助手和自发交谈之间切换时,合适度评分如何变化;人类相似度评分又如何变化;二者的句级相关在每个域是正是负;哪些声学特征与合适度同向或反向。
常用自动指标在每个域是正相关还是负相关。输入是文本加系统加场景标签,输出是两个 5 分量表分数以及后续的相关分析。论文明确列出三点贡献:跨域感知分析,系统测量自然度和合适度如何随设定变化;人类相似度悖论探索,分析二者何时一致、何时脱钩;面向域的评价与指标画像,说明系统在不同域表现不同、常用指标并非普遍有效。
理解这三点,就能抓住全文的因果链:场景改变期望,期望改变打分,现有指标跟不上期望的变化。教学上举一个例子帮助记忆,但例子不携带论文数值:同一句你的会议 30 分钟后开始,用平稳播报讲适合助手,用大起大落讲可能适合动画角色,评价必须先锁定用途再打分。
整个研究如何从句子走到结论?
先沿一个样本走完全程。取一句文本,例如信息类的会议提醒,先确定它属于 4 个任务家族中的哪一类,再用 5 个系统分别合成,得到同一文本的多个版本。然后把每个版本放进 5 个角色设定里请听众打分:这个讲法作为朗读者合适吗,作为助手合适吗,作为演员、自发说话人和动画角色合适吗,同时再打一个人类相似度。最后在句级把合适度与人类相似度做相关,把合适度与声学特征和自动指标做相关,得到每个域的偏好画像。展开全景时,研究做了 4 组动作。
第一是刺激覆盖,手工整理语音文本对,覆盖叙述、自发口语、情感对话和信息 4 类,例子包括会议提醒、感叹句、带迟疑的口语和引文式叙述。第二是系统选型,从榜单中挑低词错率且有一定胜率、风格不同的高质量系统,并统一选女声且音色接近以减少音色偏好偏差。第三是评分设计,用网页界面在众包平台施测,把合适度换成更易懂的说服力措辞,把自然度换成更明确的人类相似度。第四是分析设计,用分布比较、句级相关和显著性标记回答域差异。
为了固定术语,后文把人类相似度简称为人似度,把合适度简称为合适度。
表现力 × 自发性: 表现力分工是刻画情绪和风格的幅度,如演员和动画角色需要的夸张起伏;自发性分工是刻画口语痕迹的多少,如填充词、迟疑和随意衔接;搭配理由是选系统时要同时覆盖这两个轴才能看到窄轮廓与宽轮廓的差异,组合意义是用 2 维选型解释 Kokoro 稳而窄、Kyutai 生而宽的分野。
本节只讲全景,具体取样数量、系统名单和指标清单在训练节与实验条件节交代,分布与相关结果在结果节展开。
场景、句子和系统是如何搭配的?
组件的第一块是 5 个域。朗读对应长篇叙述的稳定交付,助手对应信息清晰且不过度情绪化,演员对应情感对话的表现力,自发说话人对应闲聊中的随意和迟疑,动画角色对应风格化的夸张节奏。5 个域不是随意命名,而是对应不同的韵律和音质期望,这正是后文相关符号会翻转的原因。第二块是 4 类语音任务与真值来源。叙述取自引文式朗读语料的子集,考描述性语句。
自发口语取自播客口语语料,考非正式措辞、迟疑和真实录音条件下的口语韵律;情感对话取自表演对话与动画配音语料,考情绪表现力并同时作为演员和动画角色的真值;信息类是新写的提示性语句,覆盖陈述与疑问、不同长度,并用一个商用声音生成助手域的代理真值。为了避免内容合适与交付合适混淆,并保证情绪覆盖,研究先用大模型按文本标注 plausible 情绪和每个角色的合适性,再人工挑选跨域不太顺口、情绪覆盖 anger、fear、sadness、disgust、neutral、joy 的句子。
第三块是 5 个一线系统,覆盖表现力和自发性两轴的不同原型:轻量但韵律稳的、旗舰多模态且风格化强的、从原始对话数据训练而自发性高的、均衡商用系统、面向专业交付的商用系统。选型时控制了榜单胜率与词错率门槛,并统一女声。
自然度 × 合适度: 自然度在本研究中被操作为人类相似度,分工是回答听起来像不像人;合适度被操作为说服力,分工是回答这种讲法对不对得起当前角色和任务;二者搭配的理由是同一段声学信号在不同期望下会被打出不同分,组合意义是把能不能以假乱真和该不该这样讲分开,避免用一个平均意见分掩盖场景错配。
第四块是评分动作。每位参与者对人类相似度和每个角色的合适度打 5 分量表,试点后把措辞固定为说服力和人类相似度以减少理解偏差。
朗读语音 × 自发对话: 朗读语音分工是提供稳定、可控、信息清晰的基线,节奏起伏小更受偏爱;自发对话分工是考验口语化、迟疑和能量起伏的容忍度,抖动和气息类不完美反而被期待;搭配理由是二者对节奏和音质的要求几乎相反,组合意义是解释为何同一系统会在朗读拿高分而在自发对话失分。
这样搭配的理由是:固定文本和声音、只换场景,才能把期望的效果分离出来;若同时换文本和声音,就说不清是内容还是交付在起作用。
本研究训练了什么,没有训练什么?
本研究没有训练任何声学模型或声码器,也没有更新任何合成系统的参数,不存在梯度路径、冻结与解冻或重置时机的报告。这是必须先说清的缺项,不能从系统名字推定实现。真实的计算过程是 4 类非训练动作。第一是构造与检索:按任务家族检索已有语料的样例,人工核对文本与音频的对应,信息类句子用大模型生成初稿再人工检查,助手域代理真值用指定商用声音合成。
第二是调用:把整理好的三十句文本分别送入 5 个现成系统合成,得到可比的平行刺激;没有搜索解码超参数,也没有用 oracle 重排代替可部署策略。第三是标注与施测:用拉丁方把样本分配到多个施测场次,每人评全套句子且不重复听同一句的同一系统,加入注意力检查过滤不认真作答。第四是分析计算:用开源语音工具提取节奏、表现力和音质特征,用已有质量估计、韵律距离、风格、可懂度和多样性指标打分,再在句级做相关并做配对显著性检验。
复现时不需要准备训练算力,需要准备的是合成调用配额、众包流程和特征与指标的运行环境。缺失的是训练资源与推理延迟的测量,论文未报告误判率、延迟或成本,因此不能承诺这些量得到改善。
听测和指标在什么条件下运行?
数据与协议按原文交代。听众是众包平台招募的英语母语者,共 150 人,按高通过率筛选,分成 6 个场次、每场 25 人。刺激是 30 句文本配真值,再经 5 个系统合成,用拉丁方把 180 个样本分散到 6 个场次,每位参与者评全部 30 句且覆盖全部系统但不重复,跨系统形成锚定。评分是两个 5 分量表,分别对应人类相似度和每个角色的合适度,另有两道注意力检查。聚合口径是按参与者、按句子先平均再看分布,真值只在数据集匹配的句子上报告作为上锚。
统计方法是配对检验加校正,显著性阈值为 0.05,不显著的配对在图中标出。一致性用系数量化,报告显示合成样本的一致性较低,真值较高,说明合适度主观性强、受个人期望影响大。声学特征覆盖节奏、表现力和音质 3 组,包括发音速率起伏、语速、成对变异指数、基频范围与分位、能量起伏、唤醒与效价、抖动、闪烁、谐波差、频谱倾斜和谐波噪声比类指标。
自动指标覆盖质量估计、韵律距离、风格、可懂度和多样性,包括两种平均意见预测器、参考无关质量估计、感知质量、频谱距离、可懂度、基频相关、韵律相似、音频生成质量 3 维、词错率和韵律多样性。硬件预算原文未报告,这是复现前要补的缺项。代码与演示页当前可用,仓库地址与演示地址在证据中给出,状态码均为 200,可按其说明重放界面与分析脚本。
同一批声音换个用途,分数发生了什么?
先看跨域合适度的分布问题:在公平的平行刺激下,是否为朗读和助手打高分的系统,也能在自发、演员和动画角色上拿高分,指标方向是分数越高越合适。表前需要明确比较对象是 6 个来源在 5 个域的合适度与人似度,条件是同一批句子、同一批听众结构、同一量表,方向是越高越好。图 1 的导读如下:横轴是 6 个系统,纵轴是平均分,每个系统一组 6 个箱体分别对应人似度和 5 个域,顶部连线标出不显著的配对。
看图路径: 1. 先按横轴六个系统逐组看六个箱体的中线高低,区分朗读与助手的高分组和动画与自发的低分组;2. 再看 Kokoro 组中助手箱体明显高于动画箱体的分离幅度;3. 接着看 Kyutai 组中自发箱体与助手箱体的相对位置是否反转;4. 最后核对顶部 ns 连线,只把无显著差异的配对视为打平
论文图 1。原论文 Figure 1:“Appropriatness and human-likeness score for each TTS across the 5 personas across all speech tasks, averaged across sentences per participant per session.”。
图后解释针对可见内容:真值整体最高但在动画域离散更大;朗读与助手箱体在多数系统中位置偏高,而自发、演员和动画角色更具挑战;窄轮廓系统的助手箱体明显高于其动画箱体,宽自发系统的自发箱体与助手箱体出现反转;不显著标记只说明那些配对打平,不能推广为全部系统无差异。第二个问题是任务对人似度的影响。图 2 把人似度按 4 个任务来源拆开,每个系统一张小图。
看图路径: 1. 先按六个子图找到每个系统的四条任务条带,对齐横轴人类相似度均值;2. 再比较真人基线在 MELD 和 MSP Podcast 条带是否高于 LibriQuote 和 Animevox;3. 接着看 Kyutai 在口语任务条带是否反而高于朗读条带;4. 最后观察 Kokoro 整体条带位置是否系统性偏左
论文图 2。原论文 Figure 2:“Human-likeness mean scores for systems across differ- ent speech tasks.”。
图后解释是:即使真值也会随来源变化,口语来源的真值人似度高于朗读引文和动画配音,论文把朗读真值的偏低归因于口音或更成熟的嗓音,把动画配音的偏低归因于风格化交付被惩罚;合成侧更有趣,叙述并不总是更容易,偏自发的系统在口语任务上的人似度反而高于朗读,而按合适度平均则跨任务差异不大,说明人似度反映的是系统处理特定风格的能力,而非任务本身的绝对难度。第三个问题是人似度能否预测合适度。
比较问题是句级相关在 5 个域是否为正,公平条件是同一句的两个人评分直接配对,方向是正值表示越像人越合适。表后解释见下表:演员、自发和朗读为正相关,动画角色接近零,助手为负,支持的判断是二者在部分语境一致、在另一些语境脱钩,限制是相关不是因果,且一致性系数偏低意味着个体差异大。
| 域 | 自发对话 | 演员 | 朗读 | 动画角色 | 助手 |
|---|---|---|---|---|---|
| 人似度与合适度的 Spearman 相关 | 0.4021 | 0.4705 | 0.3757 | 0.0821 | -0.4438 |
表后需要补代价与反例:窄而稳的系统在助手域合适度高但人似度低,偏生的系统人似度高却在助手和动画域不合适;未胜出项是动画角色域,几乎所有合成在该域都难拿高分;边界是孤立句评测,没有对话上下文和情绪推进,不能推广到多轮交互。
哪些声学偏好和指标盲区支撑了脱钩?
把合适度拆到特征与指标,才能看到机制。先看声学偏好问题:在每个域,什么样的节奏和音质更合适,方向是正相关表示特征越大越合适。表前比较的是同一批句子的合适度与 12 个声学特征的句级相关,条件是跨全部任务混合但按域分组,方向按符号解读。
| 域 | 动画角色偏好 | 助手偏好 | 朗读偏好 | 演员偏好 | 自发偏好 |
|---|---|---|---|---|---|
| 节奏与表现力相关 | 0.43 | -0.35 | -0.30 | 0.35 | 0.34 |
| 效价与音质相关 | -0.01 | -0.32 | 0.28 | -0.20 | 0.29 |
表后解释要给出具体代价:动画角色最吃节奏起伏,发音速率标准差与成对变异指数均为约四成的正相关;朗读对同一组特征约为负 30%,偏爱平稳可控;助手不喜欢过大基频范围和过高情感效价,呈负相关;演员与自发喜欢能量起伏,自发还唯一地对抖动和谐波差呈正相关,说明闲聊里的人味小瑕疵是被期待的;频谱倾斜在助手略正、在自发与演员略负。论文的有限解释是节奏可以在给定文本时调整,但音质更难在测试时改变,因此声音设计与系统选型必须先锁定目标风格。
声学特征 × 自动指标: 声学特征分工是描述信号本身的节奏、表现力和音质,如发音速率起伏和基频范围;自动指标分工是预测人评或衡量距离,如 UTMOS 和 AudioBox;搭配理由是前者能指出哪个域喜欢稳、哪个域喜欢放,后者检验现有工具是否跟得上这种偏好,组合意义是揭示质量估计器在助手域有效、在演员和自发域反向的盲区。
再看自动指标画像。图 3 导读如下:热图的横轴是 5 个域,纵轴是声学特征,颜色深浅表示相关的正负与大小,数值直接写在格内。
看图路径: 1. 先沿横轴五域找到动画角色列,读出发音速率标准差和 nPVI 两格的深色正值;2. 再移到朗读列同一两行,确认颜色是否翻转为负值;3. 接着看助手列基频范围和效价两格的负值;4. 最后看自发列抖动和 H1-H2 两格是否为唯一的明显正值
论文图 3。原论文 Figure 3:“Appropriateness-acoustic features correlation on sen- tence level across all speech tasks.”。
图后解释针对可见格:动画列顶部两格为深色正值,朗读列同一两格翻蓝,助手列基频与效价格为蓝色,自发列抖动与谐波差格为橙色,其余格多为浅色弱相关,不能把总体趋势推广到每一格。图 4 导读如下:横轴是 5 个域加人似度,纵轴是十余个自动指标,星号表示显著,蓝色为负、橙色为正。
看图路径: 1. 先找到 UTMOS 和 DNSMOS 两行,看演员和自发列是否为蓝色负值而助手列为橙色正值;2. 再看 AudioBox 三行在助手和朗读列的正值与在人类相似度列的负值反转;3. 接着核对 WavLM 行在助手列的大负值;4. 最后只把带星号的格子当作显著相关去解读
论文图 4。原论文 Figure 4:“Appropriateness-automatic metrics correlations on sentence level across all speech tasks. 一个星号 indicates significance.”。
图后解释是:质量估计器在演员和自发列呈显著负相关,在助手列呈正相关,支持的判断是它们会惩罚表情丰富的自然迟疑和高动态,只在传统高质量音频上仍是合适度的有效代理;嵌入类指标在助手和朗读有效但在人似度列反转;距离类指标在助手域大负而在人似度侧转正,说明其更代表中性语音;多样性指标相对更稳健,而感知质量与基频相关对合适度基本无信息量。未胜出项是后两者,明确记为反例。
哪些结论不能推广?
第一是语境局限。全部刺激是孤立句子,没有对话历史和情绪推进,真实应用的多轮上下文可能改变期望与容忍度,论文把扩展到多轮作为自然的下一步。第二是社会身份未测。说话人被感知的性别、年龄和社会经济背景如何塑造评价,本研究没有探索,这是重要的未来方向。第三是主观性本身。
合成样本的一致性系数偏低,说明合适度高度依赖个人期望,任何单点均值都不应被当作绝对真理。第四是指标相关的边界。所有相关都是句级相关,不代表因果,也不代表换一个特征就能直接提升合适度;未测量误判率、延迟和成本,不能承诺效率收益。第五是真值锚的口径。
真值只在数据集匹配的句子上报告,跨任务比较人似度时要先确认对象、条件和时间范围,不能把单任务末步结果推广全程。第六是资源缺项。硬件预算、推理开销与输出帧率未报告,训练与部署成本无法核算。这些缺失不是技术错误,但复现和选型时必须补上,否则会把相关趋势误读为每组必成立。
要复现这套评价,先做什么?
先锁定信息条件:同一批文本、同一批系统、5 个域的措辞、两个 5 分量表、拉丁方分配和注意力检查,任一改变都会动摇可比性。第一步是取数与合成。按 4 类任务准备三十句,叙述取引文朗读子集,自发取播客口语,情感对话取表演与动画语料,信息类新写并人工检查;助手域代理真值用指定商用声音合成;再把三十句送入 5 个现成系统,保持女声与相近音色。
第二步是施测。用网页界面在众包平台招募英语母语者,设通过率门槛,分六场、每场 25 人,每人评全套句子且不重复,记录人似度和 5 个域合适度。第三步是分析。用指定工具提取节奏、表现力和音质特征,运行质量、韵律、风格、可懂度和多样性指标,计算句级相关并做配对检验与校正。先跑最小闭环:只复现分布图与人似度与合适度相关表,确认朗读与助手偏高、自发与动画偏低、助手域负相关的符号。
再扩展到声学热图与指标热图。代码仓库与演示页当前可用,可对照界面措辞和脚本参数;若链接本次不可达,就写本次未能确认可达,不要写已公开之外的断言。还需补的验证是换一批句子、换一批听众、加入多轮上下文,看符号是否稳定;同时记录合成调用成本与分析运行时间,补上原文缺失的预算信息。
何时值得用场景评价替代单一自然度?
当你的下游用途明确且对交付有不同要求时,值得尝试。做朗读或助手,平稳、中性、清晰优先,传统质量估计仍有参考价值;做演员、动画或自发对话,节奏起伏、能量动态和适度的人味瑕疵优先,此时若只看总分会选错系统。论文直接报告的是分布分离与相关符号翻转,有限解释是系统偏好来自训练数据与优化目标因而非一刀切,未验证的推测是调某个特征就能线性提升合适度,后者只能表述为可能、待验证。常见的误解有三。
其一,自然即合适是错的,助手域的负相关就是反证,太像人、太生反而可能不合适。其二,叙述最容易是错的,至少对偏自发的系统不成立,难度取决于系统与风格的匹配而非任务标签。其三,客观分高即合适是错的,质量估计在表情丰富的域显著为负,嵌入距离在人似度列反转,必须按域选指标。收束成一句可执行的话:先写清你要服务的域,再问这句话这样讲对不对,而不是先问它像不像人。
用多维、带场景的评价去选声音和系统,并为每个域保留未胜出项与失败条件,未来的工作是把这套做法搬到多轮对话和更多社会身份条件下检验。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses



