英文题目:Iterate to Differentiate: Enhancing Discriminability and Reliability in Zero-Shot TTS Evaluation

会议身份:conference:interspeech:2026:conference-paper-id:shen26d_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#评测协议 #模型评估 #零样本 #文本到语音

评分:6.8/10 | 创新 1.5/2 | 技术严谨 1.0/1.5 | 实验充分 1.2/1.5 | 清晰度 0.7/1 | 影响力 0.9/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Shengfan Shen:机构信息未能从会议 PDF 纯文本可靠映射
  • Di Wu:机构信息未能从会议 PDF 纯文本可靠映射
  • Xingchen Song:机构信息未能从会议 PDF 纯文本可靠映射
  • Dinghao Zhou:机构信息未能从会议 PDF 纯文本可靠映射
  • Liumeng Xue:机构信息未能从会议 PDF 纯文本可靠映射
  • Meng Meng:机构信息未能从会议 PDF 纯文本可靠映射
  • Jian Luan:机构信息未能从会议 PDF 纯文本可靠映射
  • Shuai Wang:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

零样本语音合成评测输入为参考音频加参考文本加目标文本,输出为系统质量排序,难点是顶尖系统首轮词错率(Word Error Rate,WER)、说话人相似度(Speaker Similarity,SIM)与预测型平均意见分(Mean Opinion Score,MOS)高度饱和且与人评错位。本文提出迭代区分框架(Iterate to Differentiate,I2D),将模型本轮合成语音作为下一轮参考音频、目标文本作为下一轮参考文本固定目标文本重合成至10轮,再逐轮计算WER/字错率(Character Error Rate,CER)、SIM、DNSMOS、UTMOSv2与情感F1(Emotion F1),最后经均值聚合形成轨迹分数。人评在首轮与末轮语音上按内容准确性、说话人一致性与整体自然度打分,为轨迹聚合提供对齐目标。与单轮直接打分不同,该框架将失配累积转化为鲁棒性探针,使隐性稳定性差异显性化并提升人评相关性。均值、线性加权、指数加权与曲线下面积共同刻画退化轨迹,兼顾早期保真与后期分化趋势。I2D利用弱模型在文本音频失配下更快崩溃的差异化退化恢复区分度,在中文Seed-TTS-Eval人评子集100句上UTMOSv2系统级Spearman秩相关系数(Spearman Rank Correlation Coefficient,SRCC)从0.1182提升至0.4636。该结论限于11个开源模型与Seed-TTS-Eval中文、LibriTTS英文及CV3-Eval情感克隆场景,未验证商用闭源系统与长文本外推,原文未披露训练与推理算力成本。

🔗 开源与复现资源

  • 演示资源:https://ssf-1103.github.io/I2D-Bench/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么:要给研究生讲清的任务与产出

本文输入是零样本语音合成评估任务,目标读者是刚进入语音合成领域、需要复述评估流程的研究生。输入包括三部分:待评的零样本合成模型、固定的目标文本、以及首轮参考音频和参考文本。输出不是音频本身,而是对模型的排序和鲁棒性判断。必须保留的信息有数据集构成、迭代轮数、客观指标与主观维度的配对关系、聚合方式和相关系数。最终产出是 1 篇可核对的方法复述,读者照着做能重走从首轮合成到 10 轮聚合的完整链路。

零样本语音合成,白话说就是只听几秒陌生人的声音就能模仿其音色朗读任意新句子,英文名是 zero-shot text-to-speech。常规做法是把参考音频作为音色条件,把目标文本作为内容条件,1 次合成得到目标音频。论文研究的对象不是如何合成得更好,而是如何评价已经很强的合成器。当所有强模型首轮听起来都不错时,1 次打分分不出高下,这就是后文反复出现的分数饱和。

为避免误解,先界定本文不做什么。本文不训练新的合成模型,不提出新的声学结构,也不声称降低合成延迟。本文做的是一套评估流程:固定被评模型,反复调用它,用它自己的输出作为下 1 次的输入条件,记录每一轮的客观分数,再聚合成一个更能对应人耳排序的总分。理解这一点,才能明白后文所有表格比较的都是同一模型在不同轮次或不同聚合下的表现,而不是不同训练方法之间的胜负。

术语速查:首字母缩写背后的真实计算

为方便回查,这里收拢关键术语的白话与英文。词错误率是识别转写后的错词比例,字错误率是中文按字计的同类比例。说话人相似度是两段音频说话人向量余弦相似的百分比口径。DNSMOS 是非侵入式感知质量预测,UTMOSv2 是面向合成语音自然度的 MOS 预测器。情绪 F1 是情绪分类的调和平均,加权平均按样本量综合多类。系统级相关是对模型排名算相关,话语级相关是对每条样本算相关,前者回答谁更强,后者回答每句是否准。

平均聚合、线性加权、指数加权与曲线下面积都是把多轮分数压成一个数的不同加权假设,复述时应说明选择了哪一种、最大轮数是多少、错误率是否已转为越高越好。最大迭代数是控制放大强度与成本的旋钮,论文用十展示、用五推荐,二者不是矛盾,而是完整验证与实用部署的两种取舍。记住这些定义,后文所有比较才能对齐到同一口径。

已有路线在强模型区间为什么失灵?

传统客观路线用词错误率和说话人相似度来衡量可懂度和音色保持。词错误率白话说就是用语音识别再转写合成音频,看错了多少字,英文是 word error rate,中文对应字错误率。说话人相似度白话说就是用说话人 embedding 算合成音频和参考音频有多像,英文是 speaker similarity。这两个指标在弱模型时代有效,因为差距大,但在强模型区间会被压缩到很窄的范围,评价器自身的偏差就足以翻转排名。

主观路线用平均意见分做听感打分,英文是 mean opinion score,做法是请人按 5 分制评价整体质量,另有成对比较和专注音色相似度的变体。这类分数总体上反映偏好,但人之间分歧大、条件敏感、成本高,难以复现和扩展。神经网络预测 MOS 的路线想用模型代替人,例如 DNSMOS 和 UTMOS 系列,但在高质量子集上区分强模型时同样乏力,大语言模型做评委的路线则计算开销大且可能继承底层模型偏见。

论文的对照逻辑是同输入同目标下的行为差异:同样输入首轮音频和文本,同样追求与人评排序一致,客观单轮分数、神经 MOS 预测、人评三者在强模型区间出现脱节。论文没有把类别差异当成胜负,而是指出单轮客观分在该区间的共同短板是可区分度不足。后续的迭代框架正是要保留现有客观指标的计算方式,只改变调用和聚合方式,从而在不更换评价器的前提下恢复区分度。

再看相关工作:同输入同目标下的有源对照

把相关工作放在同一输入、同一目标、同一运行阶段下对照会更清晰。同样输入首轮合成音频,同样目标是预测人耳排序,词错率与相似度提供内容与音色的可解释锚点,MOS 预测器提供整体质量的单分估计,大模型评委提供可解释的多维判断。论文的迭代框架与它们不在同一层竞争,而是作为外层调用协议兼容前两者:不改变单轮分数的定义,只改变参考的供给方式与汇总方式。

这种定位决定了比较的公平性。论文保留原文实际可运行的策略做比较:单轮基线对多轮聚合,同一评价器对同一评价器,同一人工子集对同一人工排序。搜索最优或事后最优若出现应另行标明,不能代替可部署的固定轮数与固定聚合。理解这一点,就不会把聚合后的提升误读为换了一个更强的评价器,也不会把交叉交换实验的回升误读为模型本身变强,它只是换入了更好的条件。

饱和如何被证明:首轮分数挤在一起意味着什么?

论文先用中文子集的首轮柱状分布证明饱和。直观上,所有被评模型在四项客观指标上高度接近,部分模型甚至达到或超过真实录音的水平。标准差是衡量分散程度的统计量,数值越小说明大家挤得越紧。首轮说话人相似度的分散很小,内容错误率和两个 MOS 预测器的分散更小,真实差距小于评价噪声,微小波动就能改变排名,这就解释了为何与人评的相关很弱。

分数饱和 × 误差累积: 分数饱和负责描述强模型首轮客观分被压缩在极窄区间、评价器噪声淹没真实差距的状态,误差累积负责描述把幻觉、漏读、噪声逐轮回填为参考后失配不断放大的过程,搭配理由是用可控的误差累积去撑开饱和区间,使原来小于评价噪声的差距变得大于噪声,从而恢复排序可靠性。

更关键的是相关性证据。论文把客观指标与主观维度配对:相似度对说话人一致性,一减字错率对内容准确率,两个 MOS 预测器对整体自然度。分别在话语级和系统级计算斯皮尔曼排序相关,英文是 Spearman rank correlation coefficient,值越高说明排序越一致。首轮话语级和系统级上,MOS 预测器与自然度的相关都很弱,内容和音色指标也只保留粗粒度的排序能力。这支持了一个判断:不是人评不可靠,而是单轮客观分在强模型区间确实撑不开差距。

教学上可以这样理解饱和。假设用一把最小刻度很大的尺子量 10 张几乎等厚的纸,读数相同不代表纸真的一样厚,而是尺子不够细。论文的解决思路不是换尺子,而是让纸的厚度差异自己变大,大到旧尺子也能读出来。让差异变大的手段就是反复自我条件合成,使鲁棒性差的模型更快变薄。

I2D 全景:一个样本如何走完十轮?

I2D 的英文全称是 Iterate to Differentiate,直译是靠迭代来区分。它的全景可以沿一个样本走一遍。起点是一个三元组:参考音频、参考文本、目标文本。第一轮用初始参考去合成目标文本,得到第一轮目标音频。从第二轮开始,不再用原始真值参考,而是把上一轮生成的目标音频当作本轮的参考音频,同时把目标文本当作本轮的参考文本,目标文本本身保持不变。如此重复到预设的最大轮数,保留每一轮的音频供后续打分。

这个设计里藏着一个误差放大机制。如果某轮出现幻觉或漏读,生成的音频就与下一轮所用的目标文本不一致,文本与音频失配会被带入下一轮的条件,进一步拖垮内容和音色。强模型退化慢,弱模型退化快,差距逐轮拉开。论文用最大迭代数为 10 轮来展示完整轨迹,并建议在计算受限时取 5 轮左右以平衡成本与人评一致性。

下图展示了从开源数据集到参考与目标文本、再到多个待评模型、再到客观与主观评估并做相关分析的完整工作流,虚线回路是理解迭代的关键。

看图路径: 1. 先沿左侧开源数据集经参考音频文本到中间 TTS 模型再到目标音频的蓝色主箭头走一遍;2. 再看目标音频经顶部 Update 虚线回填为参考音频、目标文本回填为参考文本的循环;3. 最后看右侧客观指标与主观指标如何分别汇入相关性分析

原论文 Figure 1:The overall workflow of our evaluation.

论文图 1。原论文 Figure 1:“The overall workflow of our evaluation.”。

从像素看,左侧蓝色框是 3 个开源数据集,中间白色框是参考音频、参考文本和目标文本,橙色框是待评的多个语音合成模型,右侧绿色框分为客观指标与主观指标并汇入相关性分析。顶部黑色虚线把目标音频回填为参考音频,下方小虚线把目标文本回填为参考文本,中间橙色循环箭头标示重复执行。客观侧列出词错率、相似度、DNSMOS、UTMOS,情绪 F1 只用于情绪数据集,主观侧列出内容准确率、说话人一致性和自然度。读图时不要把情绪 F1 当成通用指标,也不要把主观分支误读为直接参与合成,它只在事后做相关性对照。

组件分工:客观与主观指标各自算什么?

客观侧在中英文数据集上采用四项指标:词或字错误率、说话人相似度、DNSMOS 和 UTMOSv2,情绪数据集只报告情绪分类 F1。主观侧在人工子集上采用平均意见分流程,并细化为内容准确率、说话人一致性和整体自然度 3 个维度。每个样本配有合成音频、参考音频和目标文本,由 5 到 6 名标注员独立打分,事先经过培训以统一标准。客观分由机器算,主观分由人听,二者在后文按固定配对做相关,而不是混为一谈。

零样本语音合成 × 迭代合成协议: 零样本语音合成负责在只给一段参考音频和对应文本的条件下克隆音色并朗读新文本,迭代合成协议负责把该模型本轮生成的目标音频回填为下一轮的参考音频并把目标文本回填为参考文本,二者搭配的理由是零样本模型天然依赖参考质量,组合后参考退化会被模型自身缺陷逐轮放大,从而把首轮看不清的鲁棒性差距转化为可测量的退化速度差。

说话人相似度 × 内容准确率: 说话人相似度负责度量合成音色与参考音色的接近程度,内容准确率负责度量可懂度和文本一致性,论文把二者并列的原因是首轮两者都饱和但退化机理不同,组合观察可以判断退化是整体坍缩还是单一维度漂移,迭代后期两者同步下降则支持整体鲁棒性不足的判断。

聚合是把多轮分数压成一个总分的关键组件。论文设计了 4 种汇总轨迹的方法:算术平均、线性加权平均、指数加权平均和曲线下面积。算术平均平等看待每一轮,线性加权给靠后轮次更大权重,指数加权按 0.9 的底数给早轮更大权重,曲线下面积用梯形法则算折线下面积。对于越低越好的错误率,在做相关前会转换为越高越好的形式,例如用一减字错率,以保证方向一致。教学例子是:若只看首轮,好比只看起跑线合影;聚合多轮好比看十圈长跑的平均配速与掉速曲线,更能反映耐力。

有无训练:本研究冻结了什么、实际计算了什么?

本研究没有训练任何新的语音合成模型,也没有微调评价器模型,这一点必须明确。所有被评的 11 个开源模型都按公开权重直接调用,所有评价模型都按既有工具链直接计算。论文未报告梯度路径、参数更新或重置时机,因为不存在训练阶段,不能从模型名称推定其内部实现,也不能把无训练等同于输出确定,同一模型在不同参考条件下的输出仍然会变化。

平均聚合指对各轮指标取算术平均,线性加权平均指对靠后轮次赋予线性递增权重。两者分工在于前者刻画多轮整体水平,后者放大后轮差异,组合使用可兼顾稳健性与区分度,这正是跨轮汇总时同时考察二者的原因。

平均聚合 × 线性加权平均: 平均聚合负责对多轮分数取算术平均以反映全程鲁棒性,线性加权平均负责给靠后轮次线性增大的权重以更强调长期稳定性,两者搭配是为了检验结论是否依赖某种加权偏好,若多种聚合都提升与首轮人评的相关,则说明改善来自迭代本身而非特定加权技巧。

实际计算过程是重复合成与重复打分。英文数据集用 VERSA 工具包统一算分,其中词错率用 Whisper-large-v3,说话人相似度用 ESPNet 链路;中文数据集遵循 Seed-TTS-Eval 官方协议,用 Paraformer 中文识别算字错率,用微调过的 WavLM 算相似度;DNSMOS 与 UTMOSv2 同样经由工具包得到;情绪数据集遵循 CV3-Eval 官方协议,用 emo2vec-large-plus 模型报告每类情绪 F1 及加权平均。

人工部分纳入首轮与第 10 轮的合成样本及对应真值,共两千余条样本、万余条标注,标注前做能量归一化以防响度偏差,事后按多人一致性、标注时长和主客观分歧 3 条标准过滤,仅当同时违反至少两条才剔除,剔除比例约 1% 量级。缺项是论文未给出每轮合成的耗时与硬件预算,因此不能从轮数直接承诺 wall-clock 成本,只能说计算量随轮数线性增长。

计算细节补遗:标注规模与过滤如何影响结论

人工部分的规模与质量控制值得单独交代,因为它是所有相关的 ground truth。论文纳入首轮与第 10 轮的合成及真值,共两千余条样本,每条由 5 到 6 人独立评分,累计万余条标注。能量归一化排除了响度干扰,3 条过滤标准分别捕捉标注者间不一致、标注时长异常与主客观严重背离,仅同时违反至少两条才剔除,剔除比例约 1%。这意味着人评排序本身经过清洗但未被过度修剪,相关提升更可能来自客观侧的改善而非人评侧的筛选。

未报告项也应点名:每轮合成的硬件型号与耗时、并发策略、存储开销,以及标注者数量与报酬之外的细节。这些缺项不构成技术错误,但影响成本判断。复现时若硬件不同,应记录自己的 wall-clock 与预算,而不是沿用论文未给出的数字。教学例子是:轮数好比曝光时间,曝光越久缺陷越清晰,但底片与冲洗成本也越高,选五还是十要看你愿意为多大的排序置信度付费。

数据与配置:三套子集与十一个模型如何保证可比?

中文子集来自 Seed-TTS-Eval 的中文测试划分,含上 1000 位说话人各两条音频,每条 4 到 12 秒。英文子集来自 LibriTTS 的干净测试划分,按时长 3 到 15 秒过滤,保留数千条、数十位说话人。情绪子集来自 CV3-Eval 的情绪克隆划分,含中英文、 happy、sad、angry 3 类,每语言每类 50 条,共 300 条。另从中文子集随机抽取 100 条、每条对应唯一说话人构成人工评估子集。数据集来源与划分按原文交代复述,不自行编造切分比例。

被评模型覆盖自回归、非自回归与混合 3 类架构,共 11 个开源系统,包括 FireRedTTS2、Qwen3-TTS、VoxCPM1.5、F5-TTS、MaskGCT、CosyVoice 系列、GLM-TTS 和 IndexTTS2 等。提示配置上,中英文与情绪数据集凡有官方预设提示表则严格遵循,英文 LibriTTS 因历史配置不一致,论文统一用目标文本对应的真值音频作为首轮参考,目的不是刷高首轮分,而是消除提示设计歧义以保证可复现。最大迭代数设为十,每轮音频都保留并计算客观指标。

公平条件是同一数据集、同一提示规则、同一评价工具链下比较不同模型,指标方向固定为错误率越低越好、相似度与 MOS 预测越高越好、主观 3 维度越高越好。人工标注的能量归一化与异常过滤对所有模型一致,避免响度或个别异常标注主导排序。复现时应先对齐识别器、说话人模型与 MOS 工具版本,再对齐提示表,否则首轮分数的微小偏移会被误读为模型差距。

主结果:迭代如何撑开差距并拉回人评排序?

首轮饱和的定量证据是分散程度极小。中文子集上相似度、字错率与两个 MOS 预测器的标准差都被压缩在很窄的区间,去掉明显偏低的个别系统后相似度分散更小。这意味着强模型之间的真实差距与评价器噪声相当,排序不可靠。第 10 轮的分散则显著放大,四项指标的标准差都比首轮高出一个量级,说明迭代确实把差距撑开了。

为回答首轮是否挤在一起、第 10 轮是否拉开的问题,下表整理首轮分散的原文报告,指标方向按错误率越低越好、其余越高越好理解,公平条件是同一中文子集与同一工具链。

迭代轮次评价对象指标数值来源条件
首轮全部模型中文子集说话人相似度标准差3.83百分比口径
首轮去掉偏低系统后说话人相似度标准差1.51排除 CosyVoice 后
首轮全部模型中文子集字错率标准差0.64百分比口径
首轮全部模型中文子集UTMOSv2 标准差0.12同一工具链
首轮全部模型中文子集DNSMOS 标准差0.07同一工具链

上表显示首轮四项指标的分散都很小,尤其是去掉异常低值后相似度分散进一步收窄,这支持饱和判断而非模型真的完全相同。代价是该表只描述分散,未直接给出排序,还需结合相关系数与第 10 轮对照才能下结论。

为回答放大了多少的问题,下表整理第 10 轮分散的原文报告,同样的指标方向与公平条件,数值变大在此处代表区分度恢复而非质量变好。

迭代轮次评价对象指标数值来源条件
第 10 轮全部模型中文子集说话人相似度标准差12.15相对首轮放大
第 10 轮全部模型中文子集字错率标准差17.62相对首轮放大
第 10 轮全部模型中文子集UTMOSv2 标准差0.48相对首轮放大
第 10 轮全部模型中文子集DNSMOS 标准差0.52相对首轮放大

上表的主要收益是四项指标的分散同步放大,说明不同维度的退化被同时暴露。具体例子是相似度上最强的系统仍保持四十余分而弱系统跌到二十左右、最低者跌到十余分,内容错误率上首轮最差仅个位数而 10 轮后多个系统超过十甚至四十。反例是 Qwen3-TTS 在第 10 轮自然度上保持相对稳定,说明放大不是所有模型同速下滑,这正是鲁棒性差异的证据。

UTMOSv2 × DNSMOS: UTMOSv2 负责预测整体自然度 MOS,DNSMOS 负责给出非侵入式感知质量分,两者分工都是不依赖参考文本的纯音频质量预测器,论文同时聚合两者是因为它们在首轮都与人评自然度几乎无关,组合后可以检验迭代放大是否对不同预测器都有效,而不只是某一个模型的偶然改善。

下图是客观与主观在话语级和系统级、首轮与第 10 轮的相关热力图,读懂它才能把分散放大与人评对齐联系起来。

看图路径: 1. 先对比第一轮左上与右上两个热力图的颜色深浅与对角线数值;2. 再对比第十轮左下与右下热力图是否整体变深;3. 最后核对横轴 1-CER、SIM、UTMOSv2、DNSMOS 与纵轴三个主观维度的配对关系

原论文 Figure 2:SRCC between objective metrics and subjective dimensions at utterance and system levels (1st and…

论文图 2。原论文 Figure 2:“SRCC between objective metrics and subjective dimensions at utterance and system levels (1st and 10th iterations).”。

从像素看,右上首轮系统级热力图整体偏浅,对角线上的相似度与说话人一致性为 0.68 尚可,但 UTMOSv2 与自然度仅 0.12、DNSMOS 与自然度仅 0.09,左上话语级更浅。右下第 10 轮系统级整体变深红,对角与非对角普遍超过 0.8,左下话语级也普遍超过 0.6。解释是第 10 轮用拉开后的客观排序去对照人评,评价噪声占比下降,排序一致性回升。需要注意非对角相关也升高,原因是多轮退化往往是整体坍缩,内容、音色与自然度的模型排序趋同,不能把交叉相关误读为指标可以互替。

下图是中文子集全部模型在首轮与第 10 轮的柱状对比,虚线代表真实录音,可直观核对饱和与分化。

看图路径: 1. 先看每个子图蓝色首轮柱与红色第十轮柱的高度差;2. 再看 CER 子图中被截断并标出 0.41、0.48 等数值的红色柱;3. 最后看黑色 GT 虚线与蓝色柱的相对位置以判断首轮饱和

原论文 Figure 3:Bar chart of objective metrics for all models on Chinese dataset at the 1st and 10th iterations.

论文图 3。原论文 Figure 3:“Bar chart of objective metrics for all models on Chinese dataset at the 1st and 10th iterations. The dashed lines indicate the values for real audio.”。

从像素看,蓝色首轮柱在 4 个子图中都紧贴 GT 虚线且高度接近,红色第 10 轮柱则显著偏离:CER 子图多个红色柱被截断并标出 0.41、0.48、0.21、0.32 与 0.30 等高错率,SIM 子图红色柱普遍下探,UTMOSv2 与 DNSMOS 子图红色柱分化但 Qwen3-TTS 保持高位。解释是首轮看似都能以假乱真,10 轮后稳定性差异暴露,伴随噪声、含糊、韵律不稳与音高失真等可听退化。未胜出项是 FireRedTTS2 与 MaskGCT 在内容维度退化更快,CosyVoice 出现电流噪声与含糊,F5-TTS 出现语速加快与语调单调,这些都是迭代特有的失败模式,单轮评估不易发现。

模型全景与交叉验证:谁更稳,谁在情绪上偏科?

在 3 数据集的平均聚合下,CosyVoice3、CosyVoice3-RL、CosyVoice2、IndexTTS2 与 Qwen3-TTS 整体偏强。其中 CosyVoice3-RL 在中文字符错与中英文相似度上占优,IndexTTS2 在英文词错与首轮内容和自然度主观分上占优,Qwen3-TTS 在中英文 UTMOSv2 与第 10 轮自然度上占优且退化较慢。这些差异说明没有单一冠军,不同维度各有领先者,选型应按内容、音色、自然度与情绪的权重分别看。

为回答具体差距有多大的问题,下表整理相似度分化与情绪 F1 的原文报告,公平条件是同一迭代协议与同一聚合口径,指标方向为相似度与 F1 越高越好。

评价切面对象指标数值条件
10 轮相似度分化CosyVoice3-RL相似度46.34最优者
10 轮相似度分化较弱模型相似度20 左右多个系统
10 轮相似度分化CosyVoice相似度11.41最低者
情绪加权平均IndexTTS2情绪 F164.69加权平均
情绪细分IndexTTS2 愤怒与开心情绪 F173.26 与 71.42分列第一

上表说明迭代后音色保持的差距可达数十分,而情绪上 IndexTTS2 综合最强。反例是 CosyVoice 在悲伤类 F1 看似最高,但论文解释为输出逐渐趋同于悲伤风格导致该类召回虚高、其他情绪明显受损,属于系统性偏差而非真正的情绪建模能力,选型时不能只看单类最高值。

交叉模型交换实验进一步区分退化原因。做法是在第六轮交换强鲁棒系统与快速退化系统的参考音频,其余配置不变后继续迭代。若退化主要来自参考质量,则换入高质量参考应立即回升;若还涉及分布偏移与自身鲁棒性,则回升后仍会再次分化。结果显示换入高质量参考的弱系统在交换点 across 四项指标迅速回升并接近强系统轨迹,但随后再次下滑,而被注入低质量参考的强系统先跌后逐渐收窄与原轨迹的差距。这支持参考质量退化是主因、自身鲁棒性决定能否维持的解释,但属于有限解释而非因果证明,因为只做了 2 模型单点交换,未覆盖全部架构与轮次。

聚合与轮数:用第几轮的总分去预测首轮人评?

实际应用更关心首轮质量,因此论文检验用多轮聚合分去预测首轮人评排序的能力。系统级相关显示,相似度与内容指标的聚合与首轮基线相当或略优,而 MOS 预测器提升明显。UTMOSv2 在平均聚合下从约 0.11 提升到约 0.46,DNSMOS 在平均与曲线下面积下从约 0.09 提升到约 0.25。这支持聚合轨迹比单轮 MOS 更能反映人评排序,同时保留了现有指标的计算方式。

为回答提升是否依赖特定加权的问题,下表整理不同聚合下与首轮人评的系统级相关,公平条件是同一人工子集与同一配对关系,数值越高代表排序越一致。

评价目标指标首轮基线聚合后聚合方法
首轮人评自然度排序UTMOSv2 系统级相关0.1180.464平均聚合
首轮人评自然度排序UTMOSv2 系统级相关0.11820.4636平均聚合
首轮人评自然度排序DNSMOS 系统级相关0.09090.2545平均与曲线下面积
首轮人评内容排序内容指标系统级相关基线水平相当或略优多种聚合
首轮人评音色排序相似度系统级相关基线水平相当或略优多种聚合

上表的主要收益是 MOS 类指标的排序可靠性回升,代价是相似度与内容指标的增益较小,说明聚合对饱和最严重的预测器帮助最大。未胜出项是指数加权等变体并未全面占优,因此不能声称某种加权必然最优,应按原文同时报告多种聚合以检验稳健性。

下图展示不同最大轮数下聚合分的系统级相关变化,是选择 5 轮还是 10 轮的直接依据。

看图路径: 1. 先看横轴最大迭代数从 1 到 10、纵轴系统级相关系数的变化趋势;2. 再比较 Mean、LWA、EWA、AUC 四条曲线在 3 到 5 轮附近的爬升位置;3. 最后观察 5 轮之后曲线是否进入平台以判断继续增加轮次的收益

原论文 Figure 4:System-level SRCC between aggregated UTMOSv2 scores and human ratings of first-iteration speech,…

论文图 4。原论文 Figure 4:“System-level SRCC between aggregated UTMOSv2 scores and human ratings of first-iteration speech, computed under different maximum iteration numbers.”。

从像素看,横轴为最大迭代数一到十,纵轴为系统级相关,起点约 0.1,4 条曲线在 2 到 4 轮快速爬升,到 5 轮附近进入 0.4 以上的平台,之后波动但不再大幅上升。解释是在计算受限时取 5 轮即可获得与 10 轮可比的人评一致性,继续加轮的边际收益有限。限制是该结论基于 UTMOSv2 与中文人工子集的曲线,不能推广为所有指标与所有语言的最优轮数,复现时应按自己的指标重画该曲线再定轮数。

边界何在:成本、表达多样性与参考依赖

论文明确承认迭代带来更高的合成与打分成本,轮数越多开销越大,这是最直接的代价。5 轮建议是成本与一致性的折中,而非性能上限。其次,迭代本质上奖励稳定性,可能偏好保守、变化少的输出,因此建议配合多样性导向的度量做更全面的评估,不能把稳定等同于富有表现力。

另一边界是自然度与相似度的权衡。零样本条件下参考音频的质量与风格会影响自然度判断,当参考本身次优时,追求贴近参考可能损害自然度,反之亦然。论文聚焦开源系统,商业系统因访问、成本与可复现约束难以纳入统一的受控迭代,这限制了结论向闭源前沿的推广。情绪评估只覆盖 3 类基本情绪与有限样本,语言与说话人覆盖也不及通用场景,因此情绪结论应视为在该划分下的表现,待更大更多样的验证。

相关性提升也不等于每条样本都改善。总体趋势是系统级排序更可靠,但话语级相关虽提升仍非完美,个别样本仍可能误判。未测量推理延迟、误判率置信区间与完整预算时,不应承诺这些量同步改善。复述时应保留这些边界,避免把在特定数据集与轮数下成立的趋势推广为全程每步成立。

复现先做什么:数据、工具与核对清单

复现应先准备 3 套子集的原始划分与提示表:中文用 Seed-TTS-Eval 官方设置,英文用 LibriTTS 过滤后的集合并统一用真值音频作首轮参考,情绪用 CV3-Eval 官方设置。接着锁定工具链版本:英文经 VERSA 统一算分并明确识别与说话人模型,中文遵循官方识别与 WavLM 链路,情绪用指定的情绪表征模型。被评模型按公开权重调用,最大迭代数先设为十以复现完整轨迹,再按聚合曲线决定是否降到五。

关键超参数与信息条件包括最大轮数、每轮参考回填规则、目标文本不变、错误率转一减形式的聚合方向、4 种聚合的并行计算,以及人工子集的能量归一化与三取二剔除规则。核对时先看首轮分散是否复现饱和,再看 10 轮分散是否同步放大,最后看聚合分与首轮人评的系统级相关是否回升。若首轮就不饱和,可能是提示或工具版本不一致,应先对齐配置而非直接质疑结论。

项目页当前可用,地址为论文给出的演示页,可用于核对示例与补充材料,但正文事实仍以论文原文为准。代码与权重方面,论文说明使用了开源数据集与评估代码并仅作学术研究用途,未声称提供统一可运行的一键脚本,因此复现前应区分代码开源、权重下载与系统可运行三件事,逐项确认后再跑全量 10 轮。

何时值得尝试:给新生的选型建议

当你的候选模型在首轮客观分上难分高下,尤其是 MOS 预测器挤在一起时,值得尝试 I2D 作为第二视角。它不更换评价器,只通过反复自我条件把鲁棒性差距放大,适合在论文选型、回归测试与鲁棒性审计中补充单轮榜单。操作上先跑 5 轮平均聚合看排序是否稳定,再对可疑模型补到 10 轮并听检第 10 轮音频的噪声、含糊与韵律变化,避免只看数字。

当目标是追求表达多样性、首轮惊艳度或低延迟部署时,不应单独用 I2D 做决定,应并行报告多样性、首轮人评与延迟成本。情绪克隆选型应分开看加权平均与分情绪表现,并警惕某类虚高背后的风格坍缩。若复现后发现聚合增益集中在 MOS 预测器而内容与音色增益小,这与原文一致,不必强求所有指标同幅提升。还需补的验证包括更多语言、更多情绪、闭源系统的受控对比,以及轮数选择的成本模型,这些都是原文未覆盖但影响实际落地的部分。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总