英文题目:NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
会议身份:
conference:interspeech:2026:conference-paper-id:ni26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#基准测试 #基准设计 #多语言 #文本到语音
评分:8.1/10 | 创新 1.4/2 | 技术严谨 1.1/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.1/1.5 | 开源 1.2/1.5 | 可复现 0.3/0.5 | 工程/实践 1.2/1.5
排名:前25% | 文档类型:数据集与基准
👥 作者与机构
- Qinke Ni:机构信息未能从会议 PDF 纯文本可靠映射
- Huan Liao:机构信息未能从会议 PDF 纯文本可靠映射
- Dekun Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Yuxiang Wang:机构信息未能从会议 PDF 纯文本可靠映射
- Zhizheng Wu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
非言语发声(nonverbal vocalization,NV)合成要求由带标记文本生成兼顾语言内容与副语言事件的语音,难点在于事件长尾分布、在野录音多人混叠以及缺乏配对真人参考导致控不准与音质差无法解耦。本文构建多语言在野基准NV-Bench,先用多语言非言语识别器批量转写再经十名专家校验得到提示与真人音频对,共1651条约7.9小时,按严格均衡单标签与相对均衡多标签划分中英文子集。评测沿指令对齐与声学保真双维度展开,前者用副语言字符错误率刻画事件级可控性,后者用分布距离与说话人相似度刻画真实感差距。与把非言语当附加音效的主流做法相比,该工作以Batliner功能分类统一标签并强制配对参考,使韵律恰当性可被量化检验。在SMIIP-NV测试集下,NVASR的CER为1.29%,低于Qwen2.5-Omni的CER 3.59%。结论仅适用于中英文短句层面的受控提示合成,未验证长对话、自发交互与跨文化语用迁移,原文未披露训练推理成本与时延。
🔗 开源与复现资源
- 数据相关资源:https://charlesnii.github.io/nvbench.github.io → https://charlesnii.github.io/nvbench.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么:要解决的合成任务与目标是什么?
本文输入是带有非言语发声标记的目标文本,例如英文目标文本写成 I want to [Cough] …,或中文目标文本写成 [Laughter] 我好开心[Uhm]…,方括号内是待合成的非言语事件。输出是对应说话人的连续语音波形,要求文字部分可懂,非言语部分在正确位置出现且听感自然。目标读者是刚进入语音合成的研究生,需要先建立的直觉是:这不是在文字语音后贴一段音效,而是要求模型理解咳嗽、笑、呼吸、嗯哼等声音在对话中的交际功能。
论文把非言语发声理解为交际行为,白话说就是它们传达生理状态、情绪与互动意图,例如确认、犹豫、惊讶或身体反射。评价因此必须回答两个不同问题:第一,模型是否按指令生成了该生成的事件,没有漏掉也没有自己加戏;第二,生成的声音整体是否像真实录音,包括音色一致性与感知质量。原文为此设置双维度协议:指令对齐与声学逼真度。本文解读的输出是把构造方法、评测计算与实验条件讲到可复述,不做超出证据的效果承诺。
资源状态方面,官方页面本次校验可用,地址为 https://charlesnii.github.io/nvbench.github.io,论文称其为公开多语言测试集与评估框架,可按该页面当前可用理解,不推定权重与代码的长期可运行性。
已有路线做了什么:为何训练数据变大仍缺评测标准?
已有路线大致分为两类。第一类是把非言语发声当作离散符号插入文本,例如 NVTTS 把事件写成特殊标记参与建模;第二类是把它们当作可叠加的层或风格描述参与合成,例如 CapSpeech 一类做法。训练语料侧已有 Emilia-NV、SMIIP-NV、NVTTS、DisfluencySpeech、NonverbalSpeech、SynParaSpeech 等大规模语料,论文用一张对比表说明它们在语言、是否有测试集、是否均衡、是否有提示方面的差异,结论是 NV-Bench 是该表中有测试集、均衡且有提示的一行。教学上要区分的是:训练数据变大解决的是模型见过更多例子,不等于评测变可靠。
论文指出的缺口有三点。第一,任务定义模糊,把非言语发声当通用音效,只检查声学存在,不检查语用恰当性。第二,评测多用内部测试集或把文本改写当参考,没有真正配对的人声真实录音,因此只能做粗粒度的有无判断,无法量化与真实录音的差距。第三,非言语事件天然长尾分布,不均衡的测试集会使平均指标偏向高频事件,不利于公平诊断。NV-Bench 的定位就是补评测标准:提供配对的人声参考、均衡的单标签与多标签划分,以及可复现的对齐与逼真度指标。
例子仅为教学:若测试集全是笑声,模型把咳嗽都合成笑声仍可能得高分,这就是不均衡带来的误导,论文用每类 50 条的单标签均衡设计来避免它。
问题如何界定:两种失败模式为何必须分开?
论文把评估对象明确为两种失败模式的分离。第一种是没按意图生成事件,例如目标要求咳嗽但模型漏掉,或把笑声听成咳嗽,或在不该出现的位置插入嗯声。第二种是事件位置大体对了,但音频质量低或不自然,例如音色断裂、韵律不连贯、非言语质感与前后文字脱节。若把两者混成一个总分,就无法判断该改进可控性还是该改进声码器与建模。因此 NV-Bench 规定指令对齐只关心按提示生成的准确性,用可识别的标签编辑距离度量。
声学逼真度只关心与真实录音分布的接近程度,用分布距离、说话人相似度与感知质量度量。测试复杂度也分两档。单标签子集每条恰含一个事件,普通话 650 条加英文 350 条,共 1000 条,每类 50 条,用于隔离基本能力。多标签子集每条含两个以上事件,普通话每标签 41 至 91 条,英文每标签 75 至 112 条,用于考察密集副语言条件下的鲁棒性,同时承认自然共现的长尾性,只做相对均衡。
全部 1651 条都来自 2025 年上传的在线视听媒体,目的是降低数据泄露风险,且每条都有对应的人声真实录音,可做配对比较。需要保留的关键信息是:语言为中文与英文,事件总数为 14 类,总时长 7.9 小时,格式统一为 24 kHz 的 MP3。
方法全景:一条样本如何走完构建与评测?
先沿一个样本走完全程。假设爬取到一段中文网络音频,含 1 次笑声与 1 次嗯哼。第一步是数据处理:先用 Emilia 流程做标准化与过滤,再用 MiMo-Audio 大模型排查残留的多说话人重叠,只保留确认为单说话人的干净片段,且时长小于 30 秒。第二步是转写:用多语言 NVASR 把音频听写成带标签的富文本,例如 [Laughter] 我好开心[Uhm]…。
第三步是人工校验:10 名专家检查并修正标签的语用恰当性,其中 5% 数据由 2 人重复标注,一致性用 Cohen’s kappa 高于 0.85 来报告,其余每条由 1 名专家标注并核验,最终形成提示文本与真实音频的配对。第四步是评测:把目标文本送给待测语音合成系统生成语音,一路用 NVASR 重听并计算指令对齐指标,另一路与真实录音比较分布距离、说话人相似度与感知质量,同时用人评校验客观指标是否与人耳一致。
下图是该全景的官方示意,阅读时先看 3 段虚线框的纵向关系,再看横向分支如何汇合到评测。
看图路径: 1. 先从上到下跟随三条虚线框:数据处理、NVASR 训练、评测,确认箭头主路径;2. 再看中间 Rich Text 如何同时分叉到人工校验与单标签、多标签目标文本;3. 最后对比右侧 D1 指令对齐与 D2 声学逼真度分别用了哪些裁判与指标
论文图 1。原论文 Figure 1:“Overview of the NV-Bench. (1) Data Processing: Raw audio is filtered using the Emilia-Pipe and MiMo-Audio.”。
上图从上到下分为数据处理、多语言 NVASR、评测三框。数据处理框显示原始网络数据经 Emilia-Pipeline 标准化过滤,再经 Xiaomi MiMo 过滤多说话人,得到时长小于 30 秒的干净片段。中间框显示开源数据经标签归一化与分类体系整理后训练多语言 NVASR,再对干净片段转写为带非言语标签的富文本。
下框显示富文本经人工校验后分为中英单标签与多标签目标文本,送入语音合成得到合成音频,再与真实参考分别走 D1 指令对齐与 D2 声学逼真度,前者用 NVASR 做裁判,后者用 Fréchet 距离、说话人相似度与 DNSMOS 度量,最后与人类评价对齐。该图的学习价值在于明确监督来源与裁判分工:NVASR 既是构建工具也是评测裁判,人工校验是标签可信度的闸门,配对真实音频是逼真度可计算的前提。
声学逼真度 × Fréchet 距离: 声学逼真度指合成语音整体分布与真实录音的接近程度,Fréchet 距离负责在音频特征空间度量两个分布之间的差距,前者提出要与真实录音比分布的要求,后者给出具体的分布差距算法,二者组合后即使指令标签全对,音色不自然或非言语质感失真仍会被检出。
分类与标签如何统一:14 类从哪里来?
统一标签是构建的第一块硬骨头,因为不同开源语料对同一声音的写法不同。论文的做法是把非语音标签映射到 AudioSet 本体的第 3 层,保留如 [Laughter] 这类可区分事件,同时采用 Emilia-NV 的分类并对 NVTTS 与 DisfluencySpeech 的英文子集做针对性人工标注,以区分例如 [Question-huh] 这类此前英文数据缺失的语用功能。最终形成按交际功能划分的 3 层 14 类。植物性声音包括呼吸、咳嗽、叹息,负责提供生理真实感;情感爆发包括笑与各类惊讶、失望声,负责传达情绪与即时反应。
会话咕哝包括嗯哼、确认、疑问词等,负责管理互动与消歧意图。具体到语言,普通话覆盖呼吸、咳嗽、叹息、笑、惊讶啊、惊讶哦、不满哼、嗯哼、确认恩、疑问诶、疑问啊、疑问恩、疑问哦等,英文覆盖呼吸、咳嗽、叹息、笑、惊讶哦、嗯哼、疑问 huh 等,论文以表格形式给出完整清单。操作上可复述为:收集 Emilia-NV、NVTTS、DisfluencySpeech、NVS、SMIIP-NV、MNV-17 等开源语料,先做标签归一化,再训练统一的多语言 NVASR,最后用该模型转写新爬取的野外音频。
未报告的缺项是各语料在训练混合中的具体比例与采样权重,论文只说构成综合训练语料,没有给出逐数据集时长占比,因此复现时只能按列出的语料名自行构造混合,不能推定原配比。
非言语发声 × 功能分类: 非言语发声指呼吸、咳嗽、笑、惊讶声、嗯哼等不构成词汇但携带生理与交际信息的声音,功能分类把它们按植物性声音、情感爆发、会话咕哝 3 层划分,前者负责提供待识别的事件集合,后者负责规定每个事件在合成评测中应承担的语用角色,二者组合后评测不再只问有没有声,而要问该位置该功能是否恰当。
裁判如何听懂非言语:NVASR 做了什么计算?
NVASR 的任务是把含非言语的语音听写成含标签的文本。基座选用 SenseVoice-Small,理由是其在多种音频理解任务上预训练过,能提供较丰富的特征。训练目标是联结时序分类损失,即对输入声学特征序列,最大化所有能对齐到目标序列的有效路径概率,论文给出该损失的标准形式,符号含义为输入特征为 x,目标序列为 y,所有有效对齐路径集合决定了求和范围,优化时最小化负对数似然。实现上是微调而非从零训练,训练数据为上述归一化后的多语言综合语料。
评估该裁判时用了 4 套测试:WenetSpeech 测试集与 LibriSpeech test-other 测通用识别能力,SMIIP-NV 与 NVTTS 测试集测非言语识别能力。基线包括微调前的 SenseVoice-Small 与在 MNV-17 上微调的 Qwen2.5-Omni 非言语识别版本。论文报告该 NVASR 在通用集上保持甚至略优于原 SenseVoice,在非言语集上明显优于 Qwen2.5-Omni,例如在 SMIIP-NV 上做到较低的字符错误率与总体错误率,从而认为它可作为自动裁判。
这里要区分字符错误率、总体错误率与副语言字符错误率:前者只看文字部分,后者把文字字符数与非言语符号数加总后计算全序列编辑距离,副语言错误率则只在抽出的非言语符号上计算编辑距离,用于隔离可控性。文本归一化按 Seed-TTS-eval 流程处理后再计分。
NVASR × 指令对齐: NVASR 是能同时转写文字与非言语标签的自动语音识别器,负责把合成音频重新听写成带标签文本,指令对齐负责比较该听写结果与输入目标文本中标签的位置与类别是否一致,前者提供可复现的裁判,后者定义了可控性是否成立,二者组合使漏生成、幻觉与错类都能被字符级编辑距离量化。
训练了什么、冻结了什么:两条基线如何得到?
本研究既训练评测裁判,也训练合成基线,需要分别交代。裁判侧训练的是多语言 NVASR,基座为 SenseVoice-Small,在归一化后的综合语料上微调,损失为联结时序分类损失,论文未报告学习率、轮数与硬件细节,因此不能复述该部分超参数,只能确认训练确实发生且数据来源为列出的开源语料。合成侧训练了两条基线。第一条是 NV-FlexiVoice,基于在 Emilia 数据上预训练、无非言语事件的 0.5B FlexiVoice 模型微调得到;第二条是 NV-CV3,基于 CosyVoice3 微调得到。
两者共用综合语料,包括 Emilia-NV、SMIIP-NV、NVTTS、DisfluencySpeech 与 NVS,标签按同一归一化协议以特殊控制符号注入文本,优化器为 AdamW,学习率为 1e-5,在 4 张 NVIDIA A800 上训练。论文未说明哪些参数冻结、梯度是否截断、早停与批量大小,因此复现时应先按全参数微调的默认假设起步,并明确记录该假设待验证。其余参与对比的系统按调用处理:Orpheus-TTS2 为单说话人基于 Llama 的 3B 模型,SMIIP-NV-CV2 与 Emilia-NV-CV2 为分别在对应数据上微调的 0.5B CosyVoice2 变体,CosyVoice3 为通用零样本合成的强基线。
推理时所有模型遵循同一标签归一化,对支持事件有限的基线只评估其支持事件的交集,不支持的疑问词映射为最接近的词加标点来近似语用功能,例如 huh 问句形式,这是为保证可运行而做的显式折中,解读时必须保留该条件,否则跨模型比较不公平。
实验条件:数据、指标方向与人评如何规定?
数据条件已在前文交代:1651 条配对样本,单标签严格均衡,多标签相对均衡,来源为 2025 年网络视听媒体,原始候选池为 565316 段约 1560 小时,最终保留 7.9 小时。指标方向必须先记牢。指令对齐侧的字符错误率、总体错误率、副语言错误率都是越低越好;声学逼真度侧的 Fréchet 音频距离与基于 PANNs 的 Fréchet 距离越低越好,表示分布更接近真实录音;说话人相似度基于 WavLM,越高越好,表示音色一致性更好。
DNSMOS 越高越好,表示感知质量更好。人评侧 10 名标注者对每个模型 100 条打 5 分制,包括连贯性平均意见分与指令准确性平均意见分,前者覆盖音质、文本与非言语韵律连续性及说话人一致性,后者考察是否精确执行非言语而无漏错幻。聚合口径按普通话与英文、单标签与多标签分别报告,不直接跨语言平均。统计方面报告了指令准确性与副语言错误率的 Spearman 相关系数与显著性,以及人工标注一致性 kappa。
下表把可由原文连续句逐字支撑的规模与裁判性能放在一起,帮助核对复现起点是否一致,阅读时先问规模是否对齐,再问裁判是否可靠,最后才看合成排名。
| 条件 | 指标 | 规模或基线 | 本研究结果 | 比较对象 |
|---|---|---|---|---|
| 原始候选池 | 音频段数与时长 | 565316 段,约 1560 小时 | 过滤后保留 7.9 小时 | 网络视听媒体 2025 年上传 |
| 基准规模 | 配对样本与类别 | 1651 条,14 类 | 单标签每类 50 条 | 中英野外配对人声参考 |
| 裁判可靠性 | SMIIP-NV 识别 | 通用 ASR 基线 | CER 1.29%,OCER 1.36% | Qwen2.5-Omni 非言语版本 |
| 存储格式 | 采样率与封装 | 24 kHz | MP3 | 标准化后 GT 音频 |
表前已提出比较问题:数据规模是否足够支撑均衡划分,以及自动裁判在非言语集上是否可信。表后需要解释:原始池足够大是能做每类 50 条均衡的前提,7.9 小时说明这是评测集而非训练集,不能拿它直接训练大模型;SMIIP-NV 上的低错误率支持用 NVASR 做自动裁判,但该结论主要来自该测试集,不能推广到所有野外口音与噪声;24 kHz MP3 说明逼真度比较的上限受压缩格式约束,讨论高频细节时应留有余地。未胜出项是 Qwen2.5-Omni 在非言语标签检测上落后于专用微调的 NVASR,说明通用多模态大模型不经针对性微调不足以替代专用裁判。
主结果:谁在对齐上赢,谁在逼真度上赢?
主结果按语言与单多标签分别报告,核心信息是两类冠军不同。指令对齐侧,NV-CV3 在普通话单标签上取得最低的副语言错误率 27.69% 与总体错误率 4.90%,显示大规模多样化训练数据的可控性优势;在多标签与英文上其优势收窄但仍居前列。声学逼真度侧,NV-FlexiVoice 取得最低的 Fréchet 音频距离与 Fréchet 距离,表示其生成分布最接近真实录音;NV-CV3 保持了 CosyVoice3 的音色一致性优势。
Orpheus-TTS 在 DNSMOS 感知项得分最高。主观评价与客观指标方向一致:NV-CV3 的连贯性与指令准确性人评最高,指令准确性与副语言错误率呈显著负相关,相关系数为 -0.65,显著性小于 0.001,连贯性人评与 Fréchet 距离对齐,但论文明确该距离是话语级指标,反映整体真实感而非仅非言语片段。下表把原文直接报告的关键数字放在同一视野,阅读时注意它们来自不同指标,不能跨列相减。
| 条件 | 指标 | 可运行基线 | 本研究最强 | 证据方向 |
|---|---|---|---|---|
| 普通话单标签对齐 | PCER,越低越好 | 高于 27.69% 的多基线 | NV-CV3 27.69% | 大规模多样数据可控性最好 |
| 普通话单标签总体 | OCER,越低越好 | 高于 4.90% 的多基线 | NV-CV3 4.90% | 文字与标签联合错误最低 |
| 全集分布差距 | FAD 与 FD,越低越好 | 高于 NV-FlexiVoice | NV-FlexiVoice 最低 | 分布最接近真实录音 |
| 人评一致性 | IMOS 与 PCER 相关 | 负相关 | ρ -0.65,p 小于 0.001 | 客观对齐指标跟踪人耳 |
表后解释主要收益与代价:NV-CV3 的收益是可控性与整体连贯性,代价是分布距离并非最低,说明指令对得准不等于分布最像;NV-FlexiVoice 的收益是分布最接近真实,代价是其对齐指标与感知项并非全面领先,说明逼真度冠军与可控性冠军可以分离,这正是双维度设计的价值。反例必须保留:Orpheus-TTS 在多处副语言错误率高达 70% 至 80% 量级,且说话人相似度缺失,因其为单说话人模型,跨说话人比较时不占优;SMIIP-NV-CV2 在英文上字符错误率明显偏高,说明单一数据微调的跨语言泛化有限。
单标签子集 × 多标签子集: 单标签子集是每条恰含一个非言语事件的严格均衡测试,负责隔离基本生成能力,多标签子集是每条含两个以上事件的相对均衡测试,负责考察密集副语言条件下的鲁棒性,前者给出公平诊断起点,后者反映真实共现的长尾难度,二者组合才能同时看到模型学会了什么与在复杂上下文中丢了什么。
反证与边界:去掉均衡与配对参考会发生什么?
论文没有传统意义的消融模块,但提供了两组可当反证读的对照。第一组是裁判对照:同一测试下比较原始 SenseVoice、Qwen2.5-Omni 非言语版本与新训练的 NVASR。若去掉针对性微调与标签归一化,通用大模型在 SMIIP-NV 与 NVTTS 上的总体错误率明显更高,说明自动裁判的可靠性依赖领域微调,不能直接用通用语音理解模型替代。
第二组是数据划分对照:单标签与多标签结果系统性不同,多标签的副语言错误率普遍高于单标签,例如同一模型在密集条件下漏生成与错类更多,说明若只测单标签会高估鲁棒性。另一处边界是基线支持范围:对仅支持部分事件的模型只评估交集,不支持事件映射为近义标点形式,这意味着跨模型总体错误率的可比性受映射策略影响,解读排名时必须附带该条件。
未评测的边界包括:未测量推理延迟与实时率,未报告合成失败率与误触发率,也未按噪声、口音、年龄分层报告,因此不能把平均逼真度结论推广到特定人群或极端噪声。相关性证据也需谨慎表达:指令准确性人评与副语言错误率负相关支持指标有效,但相关不是因果,不能说降低该错误率必然等量提升人评。
限制是什么:哪些结论不能超出证据?
第一,语言覆盖仅为中文与英文,14 类清单中英文类别少于中文,例如英文情感爆发与会话咕哝种类较少,因此英文结论不能推广到其他语言的疑问词与语气词。第二,数据虽为野外真实录音,但经单说话人过滤与人工校验,极端重叠语音、强噪声与远场条件已被剔除,逼真度结论适用于相对干净的单人近场场景。第三,客观指标依赖同一 NVASR 裁判,存在裁判与被测模型同分布偏好的风险,人评样本每模型仅 100 条,虽能验证趋势,但不足以支撑细粒度类别排名的显著性断言。
第四,分布距离为话语级度量,论文已提醒它反映整体真实感,不能单独证明非言语片段本身的频谱细节已足够逼真。第五,训练与推理成本报告不完整,仅知合成基线在 4 张 A800 上微调且学习率为 1e-5,未知批量、轮数与推理耗时,因此不能承诺该方案在延迟或成本上更优。表达上应区分:论文直接报告的是错误率、距离与人评数值,有限解释的是大规模多样数据带来可控性优势,未验证推测的是该优势是否来自数据量、数据多样性或基座能力,需待验证。
复现先做什么:按什么顺序核对条件?
复现应先做评测复现,再做训练复现。第一步打开当前可用的官方页面,核对 1651 条、中英、单标签每类 50 条、多标签相对均衡、24 kHz MP3 与配对真实音频是否与下载一致,若页面不可达则记录本次未能确认可达,不自行拼凑数据。第二步复现裁判:按论文列出的综合语料名准备数据,完成标签归一化到 AudioSet 第 3 层与 Emilia-NV 分类,微调 SenseVoice-Small 得到 NVASR,并在 WenetSpeech、LibriSpeech test-other、SMIIP-NV、NVTTS 上核对通用与非言语性能,重点核对 SMIIP-NV 上的低错误率是否重现,再用 Seed-TTS-eval 归一化后计算字符错误率、总体错误率与副语言错误率。
第三步复现合成基线:以 CosyVoice3 与 FlexiVoice 为起点,按同一标签注入方式微调,优化器用 AdamW,学习率先设 1e-5,硬件按 4 卡 A800 或等效算力记录实际耗时,推理时对不支持事件采用论文的交集加近义映射策略并完整记录映射表。第四步计算声学侧:用相同特征提取得到 Fréchet 音频距离、PANNs 的 Fréchet 距离、WavLM 说话人相似度与 DNSMOS,注意区分话语级与片段级聚合,不把不同聚合混入同一列。最后抽样做人评,沿用连贯性与指令准确性的 5 分制定义,检验与客观指标的相关方向是否一致。
何时值得尝试:给新生的行动清单
当你的任务需要在语音中可控地加入笑、咳嗽、呼吸、嗯哼等声音,且需要在乎位置与语用是否恰当时,值得用 NV-Bench 做第一道门槛。先用单标签子集诊断基本可控性,若副语言错误率居高不下,应优先检查标签归一化、提示符号注入与数据覆盖,而非先换更大的声码器;待单标签稳定后,再用多标签子集考察密集条件下的漏生成与幻觉。若目标是提升整体真实感,应同时看分布距离与说话人相似度,记住 NV-FlexiVoice 一类分布最接近真实的模型未必在指令上最强,需要按应用权衡。
常见误解有三。其一,把 DNSMOS 高等同于非言语合成好,实际上它是整体感知质量,需结合副语言错误率一起读。其二,把总体错误率低等同于标签全对,实际上它混合了文字与标签,隔离可控性要看副语言错误率。其三,把平均指标好等同于每类都好,长尾类别仍可能很差,应回到每类 50 条的单标签明细做诊断。还需补的验证是更多语言、更噪环境与延迟成本测量,补完之前不承诺跨场景与实时性收益。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
