英文题目:No-Shot Text-to-Speech: Limitations of Zero-Shot TTS and its Evaluation Methods in Representing Queer and Transgender Voices

会议身份:conference:interspeech:2026:conference-paper-id:francis26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#主观评测 #模型评估 #公平性 #零样本 #文本到语音

评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:后50% | 文档类型:应用研究

👥 作者与机构

  • Juliana Francis:机构信息未能从会议 PDF 纯文本可靠映射
  • Robin Netzorg:机构信息未能从会议 PDF 纯文本可靠映射
  • Joakim Gustafson:机构信息未能从会议 PDF 纯文本可靠映射
  • Éva Székely:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

该研究处理零样本语音克隆任务,输入为约10秒参考语音与待合成文本,输出为保留目标音色的语音,难点在于性别expansive音色在训练与评测数据中稀缺且感知相似度难被自动指标刻画。方法链分四步推进:从MAGES与GLOBE构建GE与N-GE参考集并做拼接归一化,用6个零样本TTS模型合成Harvard语句,组织类MUSHRA人听相似度评测,并行计算说话人相似度、自动平均意见分与词错误率并做组间检验。与已有合成偏置研究相比,该工作把模型偏置与评测指标偏置放在同一框架下对照,揭示自动评测自身的盲区。在MAGES与GLOBE对照评测设置下,LinaSpeech在GE语音上的词错误率(WER)为.141,高于其在N-GE语音上的词错误率(WER).072。结论仅适用于美式英语朗读类短句与所测 6 模型,无法外推至自发对话、跨语言或性别肯定嗓音训练场景。该结论的跨语言与自发对话外推尚未验证,受限于美式英语朗读场景。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 第三方资源:https://github.com/Zyphra/Zonos — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:要为谁克隆声音,为何代表性优先于修辞?

本文输入是两类语音合成评估任务的对比证据,目标是让刚入门的研究生能复述方法并核对条件。必须保留的信息包括模型名单、数据集来源与划分、参考音频构造、人工与自动指标的具体实现,以及显著性标记的含义。输出是 1 篇可核对的技术解读,不做营销式判断。论文把研究对象定义为性别延展嗓音,白话就是自我认同为非顺性别者的说话人的声音,英文为 Gender-Expansive,缩写为 GE;与之对照的是非性别延展嗓音,即顺性别者声音,英文为 Non Gender-Expansive,缩写为 N-GE。

后文统一用 GE 与 N-GE 简称。研究动机是性别延展嗓音在语音数据集中长期缺席,Common Voice 等数据集中跨性别者参与接近零,而零样本语音合成依赖大规模训练数据的多样性。若训练与评测都偏向多数人群,少数嗓音可能被合成得不像本人,甚至被抹去身份特征。论文因此提出两个可检验问题:零样本系统在 GE 嗓音上是否如人耳所判存在性能差异;常用的机器评测算法与人耳相比是否存在偏差。

理解这一点是后续所有方法选择的前提,因为它决定了为何要用两套数据集、为何要同时跑人工与自动 3 类指标。

相关路线在比什么:数据偏差、系统失效与社会规范如何分工?

论文把相关工作按同输入、同目标、同运行阶段组织成 3 条线。第一条是数据偏差与多样性训练集的必要性。白话是模型能克隆得多像,很大程度上取决于见过多少种人。Globe 语料工作显示多样数据有助于泛化到未见说话人,多语言模型也在跨语言特征适应上有效。但采样偏斜与聚合扭曲会损害代表性,自然语言处理中曾有大规模文本数据不成比例地删除酷儿与跨性别相关文本,使酷儿数据被没有生活经验者定义。

语音侧的例子是自动语音识别中的种族差异与视频字幕中的性别方言偏差。第二条是语音机器学习系统的失效模式。白话是偏差不只影响合成,还影响检测与验证。深度伪造音频检测在分布外数据上失效,可能使边缘群体克隆语音更难被发现;说话人验证在跨性别者使用性别肯定嗓音调整技术时会把同一人判成不同人,损害技术可靠性并强化排斥感。

第 3 条是继承的社会规范对语音生成设备用户的影响。白话是模型倾向继承主流性别规范,而依赖合成嗓音沟通的人最需要贴合身份的个性化声音,否则影响尊严与有效沟通。有研究参与者因此主张用性别中立嗓音缓解偏差。3 条线分工不同:第一条解释训练从哪里偏,第二条说明偏了会在哪些任务上错,第 3 条说明错了对谁伤害最大。本文只做零样本合成与评测偏差,不直接解决检测或验证,但引用它们是为了说明代表性不足是跨任务的共同风险。

问题如何界定:零样本克隆与评测偏差各测什么?

论文把零样本语音合成定义为只用几秒钟语音样本、无需额外微调就能为未见说话人生成语音的系统。教学例子是:给你一段陌生人约 10 秒的拼接参考音,再给你 15 句哈佛语句文本,模型要读出这 15 句且听起来像同一个人。这与需要为每人微调的传统多说话人合成不同,考验的是对未见音色的即时泛化。第一个研究问题是声音克隆偏差,白话是 GE 嗓音被克隆得像不像,与 N-GE 相比差多少,由人耳相似度裁定。

第二个是比较性偏差分析,白话是机器评测算法是否与人耳不一致,具体看说话人相似度嵌入余弦、自动平均意见分预测器、词错误率 3 类自动指标是否与主观感知同向。关键区分是:前者问模型行不行,后者问尺子准不准。论文明确术语 GE 指基于自我认同的标签,在 Mid-Atlantic Gender Expansive Speech 数据集中保持原标签;而 N-GE 侧的 Globe 数据集多数为假定的顺性别样本,且原文指出其创建者对未提供性别者用分类器补标性别,这类分类器在嗓音模糊区间常失效,可能误标。

因此两组对照不是生理男女对照,而是身份代表性对照,复述时不能写成男女对比。

方法全景:一个样本如何走完输入到输出与评分?

沿一个样本走完全程有助于建立依赖顺序。输入是某说话人的拼接参考音频,目标约 10 秒,由该说话人多个 3 到 4 秒片段拼接而成;另有待合成的哈佛语句文本。表示阶段是模型内部将参考音转为说话人条件表示,不同模型实现不同,但对外接口一致:参考波形加文本进,合成波形出。组件阶段是 6 个被测零样本模型并行生成:CosyVoice2、E2TTS、F5TTS、XTTS、Zonos、LinaSpeech。

原文说明选择理由是前四者为大規模多语言、可能更多样的数据训练的例子,Zonos 为当前工业界模型例子,LinaSpeech 为较小零样本模型例子。目标阶段是评估合成波形与参考波形的关系,分为人工相似度与机器三指标。输出是每说话人每模型 15 条合成,每条 16 千赫兹、负 20 分贝标准化后进入评测。标准化动作保证响度与采样率 1 致,使相似度差异更可能来自音色与韵律而非音量。样本量是每侧 14 位说话人,共 28 位参考,每位做 15 句乘 6 个模型。

人工听辨只用其中每侧 4 位共 8 位说话人做 MUSHRA 类评估,这是成本与代表性的折中,复述时必须说明人工子集小于合成全集。

说话人嵌入 × 余弦相似度: 说话人嵌入是 ECAPA-TDNN、TitaNet-L、ReDimNet-M 等说话人验证模型把一段语音压缩成的身份向量,解决的是可比表示问题;余弦相似度是计算参考嵌入与合成嵌入夹角余弦,解决的是量化接近程度问题;搭配理由是向量本身不可直接读作分数,需用角度度量归一化比较,组合意义是形成自动说话人相似度,但本研究显示同一合成语音换嵌入模型结论会反转,说明该组合依赖训练数据的代表性。

组件与计算:人工打分与三类自动指标各自算什么?

人工评估采用 MUSHRA 类范式,白话是同时呈现参考与多个待评样本的并排打分法,英文为 MUSHRA-like。操作是招募 16 名参与者,每人先听从拼接参考中截取的 3 到 4 秒原声,再对每个模型随机抽的 6 个样本中的每个评与参考的相似度,量程 0 到 100。每位参考说话人做 3 轮,每轮 6 个模型各 1 条,共 24 轮 144 次评分。顺序随机以抵消顺序效应。自动指标有 3 类。

第一类是说话人相似度,白话是机器判断是否为同一人的分数。用 ECAPA-TDNN、TitaNet-L 和 ReDimNet-M 3 种说话人嵌入模型分别提取参考与合成的向量,再算余弦相似度,范围 0 到 1,越大越像。3 种并用是为了看结论是否依赖嵌入模型,并用组内相关系数评估一致性。第二类是自动平均意见分,白话是机器猜人会给几分。用 UTMOS 与微调 wav2vec2 两种预测器输出 1 到 5 分,越大预测质量越高,同样算一致性。

第 3 类是词错误率,白话是内容读错多少。用 Whisper 把合成音频转写成文本,再与合成用句比对错误,范围 0 到 1,越小越好。需要区分的是:说话人相似度测身份,自动平均意见分测整体质量,词错误率测可懂度,三者不能互换。

零样本语音合成 × 说话人相似度: 零样本语音合成负责只用约 10 秒参考音频、无需微调就生成新文本语音,解决的是对未见说话人的泛化生成问题;说话人相似度负责度量合成语音与参考语音是否为同一人,解决的是身份保持的度量问题;两者搭配的理由是仅有可懂、自然还不够,还需身份一致,而组合意义在于把生成能力转化为可比较的克隆保真度,本研究正是用人工相似度与嵌入余弦相似度双路检验这一转化是否对性别延展嗓音成立。

主观平均意见分 × 自动平均意见分: 主观平均意见分是让人直接打分得到的质量与自然度感受,解决的是人类真实偏好问题;自动平均意见分是用 UTMOS 或微调 wav2vec2 等模型预测人类会打多少分,解决的是低成本可扩展评测问题;搭配理由是人工评测贵而自动评测快,组合意义在于检验预测器能否代替人,本研究发现 UTMOS 系统性给非性别延展组更高分而与人工相似度趋势冲突,说明替代关系在此人群上不成立。

有无训练:本研究训练了什么,又调用了哪些现成模型?

本研究没有训练任何零样本合成模型,也没有训练任何评测器,属于评估型论文。6 个合成模型与 5 个评测模型均为直接调用已有权重做推理。原文未报告对这些模型的冻结、解冻、梯度路径、监督来源或重置时机,因为不存在本研究的优化循环,复述时应明确标注该缺项,而不是从模型名称推定其训练细节。真实计算过程是推理与评分流水线:对 28 位说话人每位生成 15 句乘 6 个模型,统一重采样到 16 千赫兹并归一到负 20 分贝;人工侧对 8 位子集抽样送听辨。

机器侧对全部合成跑 3 种嵌入余弦、两种平均意见分预测、一种 Whisper 转写算词错误率,再按 GE 与 N-GE 分组做 t 检验并报告效应量 d 与显著性标记。显著性标记按原文为星号 p 小于 0.05,方块 p 小于 0.005,三角 p 小于 0.001。代码与文本经生成式人工智能做小幅修订但经作者核查,方法本身无学习更新。第三方资源状态方面,本次收到的官方资源 Zonos 的链接状态为可用,状态码 200,因此可写当前可用与已公开;若为不可用则须写不可用,本次不适用。

复现者无需准备训练算力,但需准备推理环境与听辨组织成本。

实验条件:数据、划分、采样与指标方向是否一致?

数据侧用 2 个数据集。N-GE 侧用 Globe 数据集,原文称为包含假定多数 N-GE 样本的高质量英语语料。筛选条件是口音标签为美国英语,并在男女标签间均衡取样,共选 14 位。性别与口音来自数据集元数据,但对缺性别者为分类器补标,存在误标风险。GE 侧用 Mid-Atlantic Gender Expansive Speech 数据集,简称为 MAGES,含基于自我认同的 GE 嗓音,取全部 14 位。

参考音频构造一致:每人拼接至约 10 秒。合成文本一致:每人 15 句哈佛语句。后处理一致:16 千赫兹、负 20 分贝。模型侧 6 模型同条件生成,保证文本与参考配对可比。人工协议是 8 位子集每侧 4 人,每人 3 轮每轮 6 模型样本,量程 0 到 100,越大越像。

机器协议是全量合成跑 3 类指标,说话人相似度 0 到 1 越大越好,自动平均意见分 1 到 5 越大越好,词错误率 0 到 1 越小越好。统计是分组 t 检验加效应量 d,正负号方向需结合均值看哪组更高,不能只看绝对值。聚合对象是先按条目算分再按 GE 与 N-GE 组聚合,人工还受听者间差异影响。硬件预算原文未报告具体机型与耗时,这是缺项,复述时应指出未测量延迟与成本,不承诺效率结论。

MUSHRA 类听辨 × 词错误率: MUSHRA 类听辨是同时呈现参考音频与多个模型样本让人评 0 到 100 相似度,解决的是并排可比的主观判别问题;词错误率是用 Whisper 转写合成语音再与原文本比对错误,解决的是内容可懂度问题;搭配理由是相似度差可能来自音色失真也可能来自内容错,组合意义是把身份问题与可懂度问题分离,本研究中 LinaSpeech 两项同时变差而其他模型词错误率无显著差异,支持其相似度下降不只是听不清。

主结果:人耳听到什么差异,自动指标为何冲突?

先看人工相似度的比较问题:在公平的参考与文本配对下,GE 与 N-GE 哪组被克隆得更像,方向与幅度如何。下表整理人耳评分均值与标准差、t 与效应量 d,分数越高越像本人。表前需要明确公平条件是同文本、同参考时长、同后处理,指标方向是分高为好。

模型GE 均值N-GE 均值t 值效应量 d
F5TTS74.70 (19.58)67.80 (24.45)-3.01-.31
E2TTS72.13 (22.39)65.19 (26.42)-2.74-.28
CosyVoice262.57 (27.68)56.06 (29.81)-2.19-.23
ZONOS46.78 (28.69)50.07 (28.95)1.11.11
XTTS42.85 (30.29)55.01 (27.71)4.07.42
LinaSpeech39.92 (27.94)58.90 (26.00)6.82.70

表后解释主要收益与代价:E2TTS、F5TTS、CosyVoice2 三者 GE 显著更像,N-GE 反而更差;XTTS 与 LinaSpeech 则 GE 显著更不像,其中 LinaSpeech 差距最大,效应量 0.70,XTTS 为 0.42。

Zonos 无显著差异。值得注意的是效应量不对称:GE 更差时的幅度大于 GE 更好时的幅度,说明劣势更突出。未胜出项是 Zonos 在人耳上未分胜负,不能写成对 GE 友好,只能写无显著差异。 以下导读针对本次实际收到像素的原图,该图展示 3 个人工评分分布的对称小提琴,左绿为 GLOBE 即 N-GE,右橙为 MAGES 即 GE,纵向为分数分布,需要先确认图例再比较重心。

看图路径: 1. 先看横轴三个模型分组 ZONOS、XTTS、LINA_SPEECH 的左右对称小提琴;2. 再对比每组内左侧绿色 GLOBE 与右侧橙色 MAGES 的宽度重心高低;3. 最后观察散点分布是否集中在中低分区以判断低分聚集

原论文 Figure 1:Human ratings for each model, split by dataset

论文图 1。原论文 Figure 1:“Human ratings for each model, split by dataset”。

从可见像素看,ZONOS 左右两侧分布都宽且散点贯穿全量程,与其均值接近且无显著差异一致;XTTS 右侧橙色在中低分区更宽更厚,与其 GE 均值 42.85 低于 N-GE 的 55.01 一致;LINA_SPEECH 右侧橙色在低分区明显膨大而左侧绿色重心偏上,与其 GE 显著更差、差距近 19 分一致。该图不能读出精确均值,只能定性支撑表格的方向判断,且仅含 3 个模型,不含 F5TTS 等三者,因此不能推广到全部 6 个模型。

反证与交叉:换嵌入、换预测器结论还成立吗?

论文没有做传统消融去掉某模块,而是用换评测器做交叉验证,这承担了反证职责。说话人相似度侧,LinaSpeech 在 3 种嵌入下一致显示 GE 更差且效应量中到大,支持人耳结论;E2TTS 在 3 种嵌入下一致显示 GE 更好,也与人耳同向。但 F5TTS 与 CosyVoice2 在 ECAPA 与 ReDimNet 上 GE 更好而 TitaNet 上无差异,XTTS 仅在 ReDimNet 上 GE 略好,Zonos 三者互相打架:ECAPA 判 GE 更好,TitaNet 判 N-GE 更好,ReDimNet 判无差异。组内相关系数除 XTTS 外 GE 侧高于 N-GE,提示自动指标在 GE 上更一致但未必更准。

自动平均意见分侧分歧更大:微调 wav2vec2 只在 CosyVoice2 与 LinaSpeech 判 GE 更好,其余无差异;而 UTMOS 对 6 模型一致判 N-GE 更好,效应量小到中等。这与人耳中 3 个模型 GE 更好的方向直接冲突,说明 UTMOS 不能替代相似度判断。词错误率侧比较问题是内容是否读错,方向是越小越好。下表整理词错误率均值、t 与 d。

模型GE 词错误率N-GE 词错误率t 值效应量 d
E2TTS.040 (.121).021 (.057)-2.167-.205
CosyVoice2.088 (.123).087 (.131)-.028-.003
ZONOS.052 (.087).060 (.098).917.087
XTTS.039 (.187).020 (.077)-1.389-.132
LinaSpeech.141 (.263).072 (.112)-3.600-.342

表后解释是仅 LinaSpeech 的 GE 词错误率显著更高,达 0.141 对 0.072,支持其相似度差部分伴随可懂度下降;F5TTS 接近显著但按阈值仍为不显著,不能写成显著;其余模型无显著差异,说明多数模型的相似度分歧不是由读错字导致。未评测边界是韵律、音色 queer 特征是否被抹去未被词错误率捕获,需人耳补充。

限制与伦理:数据稀缺、训练推测与隐私代价是什么?

论文明确报告数据稀缺是首要限制:仅找到两个明确含酷儿数据的语音数据集,其中仅 MAGES 适合评估零样本在多位酷儿嗓音上的表现,且仅 14 位可用。小样本使泛化结论受限,不能推广到所有性别延展嗓音。第二个限制是训练归因仅为有限解释而非验证:作者推测在主观上更差的 XTTS 与 LinaSpeech 用了朗读式训练数据,而表现更好的 F5TTS 与 E2TTS 用了 EMILIA 这类野外自发语音数据,自发语音更多样故可能含更多样个体。

但原文同时说明其他模型训练信息未提供,且各数据集均未标注说话人酷儿身份,因此这只能表述为可能与待验证,不能写成已证明的因果。第 3 个限制是自动指标的训练偏差推测:差异可能源于评测器自身训练数据欠代表,但原文未公开评测器训练构成,故同样是可能解释。伦理代价是 naive 扩大数据集会增加滥用风险,若高质量标注的酷儿嗓音公开,可能被用于冒充或暴露身份。

论文主张遵循无我们不决策原则,让跨性别与酷儿社群全程参与,配合匿名化、受控访问与安全仓库,并制定严格的数据使用、隐私与知情同意规范。技术增益不能置于群体安全之前,这是复述时必须保留的价值约束。

复现先做什么:按原文重走需要哪些动作与核对点?

复现应先做三件事。第一是取数与筛选:获取 Globe 中美国英语子集并均衡男女取 14 位,获取 MAGES 全部 14 位,保留 GE 的自我认同标签,不用分类器重标;记录 Globe 补标风险。第二是构造参考与合成:每人拼接约 10 秒参考,截 3 到 4 秒片段供听辨用;每人用 15 句哈佛语句在 6 模型下生成,统一到 16 千赫兹、负 20 分贝。

Zonos 当前可用,链接状态 200,可按官方仓库获取权重,其余模型按原文引用版本获取。第三是跑评测:组织 16 人 MUSHRA 类听辨,对 8 位子集每人 24 轮每轮 6 条随机排序评 0 到 100;机器侧跑 ECAPA-TDNN、TitaNet-L、ReDimNet-M 余弦,UTMOS 与微调 wav2vec2 预测 1 到 5 分,Whisper 转写算词错误率,再分组做 t 检验并报告均值标准差、t、d 与显著性阈值。核对点包括量程方向、聚合对象是条目先算再分组、人工子集小于全集、百分点与相对百分比不混用。自动平均意见分的具体数字可参考下表,方向是分高为预测质量高,但需记住它与相似度不是同一指标。

模型FT-Wav2Vec2 GEFT-Wav2Vec2 N-GEUTMOS GEUTMOS N-GE
F5TTS4.576 (.242)4.563 (.170)4.192 (.260)4.284 (.201)
E2TTS4.236 (.426)4.229 (.296)3.978 (.331)4.065 (.280)
CosyVoice24.691 (.199)4.586 (.186)4.366 (.151)4.405 (.120)
ZONOS4.253 (.476)4.196 (.349)4.081 (.281)4.143 (.211)
XTTS4.466 (.483)4.497 (.276)4.052 (.382)4.155 (.259)
LinaSpeech4.484 (.310)4.415 (.260)4.206 (.234)4.265 (.161)

表后提醒:FT-Wav2Vec2 仅 CosyVoice2 与 LinaSpeech 显示 GE 更高,而 UTMOS 六项全判 N-GE 更高,复现时若只跑其一会得出相反结论,必须双跑并与人耳对照。还需补的验证是扩大 GE 样本、报告听者背景、公开划分名单与随机种子,以及测量推理延迟与成本,原文未报告这些,复现时应如实标注缺项。

何时值得尝试:给新生的行动清单与误解澄清?

当你的任务涉及未见说话人克隆且用户包含性别延展群体时,本文值得尝试:用双数据集对照、人工相似度为主、多种自动指标为辅的流程先做偏差体检,再谈优化。行动清单是先复现小规模听辨确认方向,再检查自动指标是否与人耳同向,若出现 Zonos 式三嵌入打架或 UTMOS 与人耳反向,则不单独用自动指标做选型。常见误解有三。其一是把 GE 与 N-GE 误读为男女对比,实际是代表性对照,Globe 侧还有分类器补标噪声。

其二是把自动分高误认为更像本人,实际自动平均意见分测整体质量,说话人嵌入余弦才测身份,且都可能欠代表。其三是把无训练误认为确定性求解,实际本研究只是调用冻结权重的推理评估,输出仍受采样与数据影响。论文的最终判断是报告显示 2 个模型 GE 更差、3 个模型 GE 更好、效应量在劣势侧更大,且自动评测与人耳多处不一致,支持需要更具代表性的数据与更贴近感知的指标,但大规模酷儿数据集的建设必须以社群参与、隐私与同意为前提。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总