英文题目:Investigating Human-Model Discrepancies in Speech Quality Assessment via Acoustic and Prosodic Perturbations
会议身份:
conference:interspeech:2026:conference-paper-id:takagi26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#主观评测 #模型评估 #韵律 #语音 #语音质量评估
评分:6.0/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.1/0.5 | 工程/实践 0.7/1.5
排名:前50% | 文档类型:应用研究
👥 作者与机构
- Masato Takagi:机构信息未能从会议 PDF 纯文本可靠映射
- Masaya Kawamura:机构信息未能从会议 PDF 纯文本可靠映射
- Reo Shimizu:机构信息未能从会议 PDF 纯文本可靠映射
- Yuma Shirahata:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
输入是自然与合成日语语音,输出是人类平均意见分(Mean Opinion Score,MOS)与6种模型预测分的敏感性对比,难点在于标量MOS把声学保真度、韵律正确性与说话人特性压缩为一维而掩盖分歧。方法链分三步推进:先在JVS语料上构造削波、粉红噪声与MP3压缩的声学退化组以检验H1,再用可控声调的NANSY-TTS系统翻转重音短语生成韵律错误组以检验H2,最后用自然多说话人与基频(Fundamental Frequency,F0)及语速人工缩放组检验H3。关键机制差异在于受控扰动实现了解耦归因,而非依赖野外文本到语音(Text-to-Speech,TTS)样本的相关性分析。主观评测由15名日语母语者对全部656个样本按自然度打分并取平均,客观评测经VERSA统一调用6个模型完成,两路结果按条件对齐后比较均值变化与排序相关性。在韵律错误评测条件下,High重音错误条件的人类MOS得分为2.16,低于None基线条件的人类MOS得分4.00,而所有模型预测分变化不足0.10,揭示了声学之外的盲区。结论仅适用于日语重音感知与所测6模型,不宜外推至英语重音语言或未测模型。其适用边界受限于日语重音体系与所测模型范围,跨语言韵律与真实野外退化场景尚未验证。原文未披露训练、推理或部署成本
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要核对什么?
本文输入是论文原文提供的文字证据与一张官方原图像素,目标是为刚进入语音合成与语音质量评估的研究生复述可执行的方法与结论。必须保留的信息包括 3 组扰动的构造方式、15 名日语母语听众的评分协议、6 个预测模型的训练数据与编码器差异、人类与模型在声学劣化上高相关而在重音错误上分离、在平均基频与语速上双重分离的关键数字。输出是 1 篇按学习依赖展开的中文解读,不引入证据之外的数值或效果断言。
现代文本转语音系统在声学干净程度上已经接近自然语音,剩余的质量差异更多落在韵律自然度、重音准确性和说话人特性等细粒度维度。平均意见分预测模型被广泛当作人类听音测试的代理指标,直接用一个标量代替昂贵的主观评价。问题在于标量会把多维质量压缩成一个数,模型训练数据又以声学损伤为主,难以保证它与人类在每个感知维度上敏感一致。
平均意见分 × 自然度评分: 平均意见分是把多名听众的 5 分制打分平均成一个标量,用来代表整体质量;自然度评分是本研究让听众给出的具体打分口径,要求把声学干净程度和韵律恰当性综合成一个分。分工是前者规定聚合计算,后者规定听众要判断什么,搭配理由是只有固定了判断口径,平均后的标量才能在不同扰动之间比较,组合意义是后文所有人类与模型差异都是在这个综合自然度标量上度量的。
本解读先讲任务与相关路线,再讲 3 组扰动如何独立操纵质量维度,然后讲样本构造与主客观评价流程,接着按假设组织实验条件与结果,最后讲复现要点与边界。教学用的举例会明确标为例子,不作为论文事实。
已有路线在哪些维度上已经暴露短板?
论文把已有担忧归纳为 3 类。第一类是标量化信息损失,把多维质量压成一个标量必然丢掉结构信息,已有综述与多维评估工作反复指出这一点。第二类是对韵律不敏感,韵律与语言学特征对预测贡献小,与人类韵律判断相关低,自监督表示携带的音高信息有限,日语重音错误仍需人工介入。第 3 类是说话人依赖偏置,不同说话人在同一合成系统下系统性地得分偏高或偏低。
在模型路线上,自监督平均意见分与 UTMOS 系列在 VoiceMOS 挑战赛上精度很高,但高精度主要是在原有测试分布内获得的。NISQA 语料覆盖编解码器损伤、噪声与丢包,DNS 挑战数据覆盖加性噪声,这些都强化了信号层质量的表示。缺少的是把韵律恰当性单独标注出来的监督信号,因此改变训练数据组成未必能带来韵律敏感性。
选择日语作为研究对象有明确理由。日语是音高重音语言,每个莫拉有高低二值音调型,重音错误可能改变词义,对母语听众感知显著。这使得重音翻转成为检验模型是否理解语言学意义韵律错误的合适探针,而不是一般的语调起伏。
三个假设分别要检验什么可观测差异?
假设 1 针对声学劣化,预测模型与人类对信号层损伤有相近敏感性,两者评分高度相关。依据是模型训练数据已经包含多种声学劣化,特征空间对信号损失有覆盖。该假设若成立,削波、噪声、MP3 压缩的条件排序应在人类与模型之间基本一致。
假设 2 针对韵律错误,预测模型对重音与变调错误的敏感性显著低于人类。依据是已有证据显示韵律特征贡献小、自监督表示音高信息有限。检验方式是固定文本与说话人,只改变重音短语中高低标签的正确比例,观察人类分大幅下降时模型分是否几乎不动。
假设 3 针对说话人特性,模型对音高、语速等说话人相关特性的敏感模式与人类不同。说话人感知涉及音高、语速与其他音色属性的复杂交互,而模型主要在声学劣化检测上训练,因此跨说话人操纵时两者的变化趋势可能不一致。该假设需要同时看自然分布内的说话人差异和人工拉伸到自然分布之外的变化。
三组扰动如何各自独立操纵一个质量维度?
论文设计了 3 组评价样本。A 组是声学劣化,在 4 名说话人的自然语音上施加 6 种信号层失真,用于检验假设 1。B 组是韵律错误,用可控重音的合成系统生成语音并故意翻转音调型,用于检验假设 2。C 组是音高与语速变化,包括自然分布内的多说话人样本和人工平移后超出自然分布的样本,用于检验假设 3。3 组共 656 个样本,全部混在一起交给同一批听众评价,避免听众对某种劣化模式产生适应。
沿一个样本走完全流程有助于理解全景。以 A 组一条自然语句为例,输入是日本语音语料中某位职业朗读者的录音,表示是未经劣化的波形,组件是对波形施加轻削波或重噪声等操作,目标是得到同一内容不同损伤程度的版本,输出是供人类打分和模型推理的 24 千赫样本。B 组则是输入音素与韵律标签序列,模型根据翻转后的标签生成波形,目标是保持文本与音色基本不变而只破坏重音正确性。C 组则是对自然语音做基频缩放或时长伸缩后再经声码器分析合成,目标是分离音高位置、音高起伏与语速的影响。
这种分组的教学价值在于每次只动一个维度。A 组不动语言内容只动信号质量,B 组不动信号处理流程只动语言学重音,C 组不动文本内容只动说话人层面的音高与时长。因此人类与模型在每一组上的分歧可以直接归因到对应维度,而不是混合因素。
样本构造与评价组件各自完成什么计算?
A 组用日本语音语料的平行语句子集,选 4 名说话人男女各 2 人,每人 5 句,共 6 种劣化条件。轻削波是放大 20 分贝后硬削波再归一化,重削波是放大 40 分贝后同样处理。粉红噪声分 20 分贝与 10 分贝信噪比两档。MP3 压缩分 16 千比特每秒与 8 千比特每秒恒定码率,先编码再解回波形。自然未处理条件作为参照。
B 组用 NANSY 合成系统在 24 千赫下为 4 名说话人男女各 2 人生成语音,每人每条件 10 句。系统接受音素与韵律标签序列作为文本输入,在约 207.96 小时带人工音素与韵律标注的内部日语数据上训练。推理时用神经网络从字形预测韵律标签,再按重音短语以给定概率选中一部分短语,把其中的高低标签互换但不违反重音类型约束。高条件选中 80% 到 90% 的重音短语,低条件选中 10% 到 20%,无翻转条件作为基线。
自监督语音编码器 × 线性预测头: 自监督语音编码器负责把 16 千赫重采样后的波形变成能反映音质和内容的向量,例如 WavLM Large 和 wav2vec 2.0;线性预测头负责把该向量映射为一个预测分。分工是编码器提供表示,预测头做标量回归,搭配理由是复用大规模无标注语音学到的特征可以减少平均意见分标注需求,组合意义是 SHEET 系列和 UTMOS 都沿用这一结构,因此韵律不敏感可能来自表示与监督两端而非某一个线性层。
声学劣化 × 韵律错误: 声学劣化指削波、粉红噪声、MP3 压缩这类信号层损伤,直接改变波形或频谱;韵律错误指本研究把日语重音短语内的高低音标签互换,让合成器读出局部错误的音调型而不改变文本。分工是前者考验信号保真度,后者考验语言学恰当性,搭配理由是只有把两者独立操纵才能判断模型是对声音敏感还是对语言敏感,组合意义是论文用分组对照揭示了模型跟随前者却忽略后者的不对称。
平均对数基频 × 语速: 平均对数基频是对每位说话人基频取对数后平均,反映声音整体高低;语速在本研究用朗读相同句子的平均语音时长来体现,时长越长语速越慢。分工是前者刻画音高位置,后者刻画时间展开,搭配理由是说话人感知同时受两者影响,必须分开度量才能看到双重分离,组合意义是人类对语速和基频起伏更敏感而模型对平均基频有强偏置,正是在这两个量上被区分开的。
C 组分三部分。C-1 是自然语音,用贪心算法从语料中选 20 名说话人使平均基频多样性最大,每人 10 句。C-2 是基频平移,对与 A 组相同的 4 名说话人每人 3 句,按 0.5 到 2.0 共 9 档缩放基频,再经 SiFi-GAN 分析合成,其中 1.0 档不改音高只测声码器自身损伤。C-3 是语速变换,同样 4 名说话人每人 3 句,按相同 9 档缩放语速,再经 WORLD 分析合成,1.0 档同样只测声码器损伤。客观评价把所有音频重采样到 16 千赫后送入 VERSA 工具包中的 6 个模型得到预测分。
本研究训练了什么,没有训练什么?
本研究没有训练任何平均意见分预测模型,所有 6 个模型都是调用已有预训练权重做推理。SHEET-MB 是自监督平均意见分结构配 WavLM Large 编码器,在包含 BVCC、SingMOS、NISQA 等 8 个数据集的 MOS-Bench 上训练,覆盖合成、变换、噪声与电话语音,还包含经 SingMOS 引入的日语与中文歌声数据但不含日语语音。SHEET-BV 结构相同但只在 BVCC 英语合成与变换数据上训练。UTMOS 用 wav2vec 2.0 加数据增强与听众建模,在 BVCC 上训练。UTMOSv2 融合 wav2vec 2.0 与 EfficientNetV2 频谱特征,同样在 BVCC 上训练。
NISQA 是用梅尔频谱的卷积网络,在编解码器与噪声语料上训练,不含合成数据。DNSMOS 是用对数梅尔频谱的卷积网络,在 DNS 挑战的噪声与增强数据上训练,不含合成数据。
本研究实际执行的计算是扰动构造、主观评分聚合与客观推理。扰动构造包括削波与加噪的波形运算、MP3 编解码、重音标签翻转后的神经声学模型推理、基频与时长的缩放加声码器重合成。主观部分是 15 名母语听众对全部 656 样本按声学质量与韵律恰当性综合打自然度 5 分制,再对每条样本跨听众平均得到人类平均意见分。客观部分是统一重采样与批量推理,不更新参数,不报告梯度路径与优化器状态。
需要指出的缺项是原文未报告听众间一致性统计、推理耗时与硬件预算,也未报告模型内部特征如何使用音高。不能从模型名称推定其内部一定有显式音高提取,也不能把冻结参数的推理等同于确定性求解,因为声码器与合成中的随机成分未被完全刻画。
主客观评价条件如何对齐,指标方向如何读?
主观评价的被试是 15 名日语母语者,每人评价全部 656 样本,所有条件混合呈现以防适应特定劣化。指导语要求把声学质量与韵律恰当性作为一个综合分来评自然度,5 分制,样本以 24 千赫呈现。聚合方式是对每条样本跨听众平均,报告均值与 95% 置信区间。客观评价的对齐方式是把输入统一重采样到 16 千赫以匹配预训练模型期望,再用同一工具包推理,避免不同实现带来的偏移。
指标方向是分数越高表示预测质量越好,相关系数越高表示人类与模型排序越一致。系统级与话语级斯皮尔曼等级相关分别回答条件排序与单句排序问题,皮尔逊相关用于度量说话人特性连续量与分数的线性关联。
系统级斯皮尔曼等级相关 × 话语级斯皮尔曼等级相关: 系统级斯皮尔曼等级相关是先把同一条件下的样本取平均再算排序一致性,反映条件排序是否正确;话语级斯皮尔曼等级相关是直接对每条样本算排序一致性,反映细粒度排序能力。分工是前者看条件层面是否颠倒,后者看单句层面是否保序,搭配理由是多域训练可能破坏条件排序却保留单句排序,组合意义是 SHEET-MB 在 MP3 条件上系统级失序而话语级尚可,正需要这两个指标联合才能定位失败。
公平性上,A 组比较的是同一批说话人与语句在不同损伤下的排序,B 组比较的是同一合成基线在不同重音错误比例下的变化,C 组比较的是同一文本下说话人特性与分数的关系。语言失配是已知边界,所有模型训练时都没有日语语音数据,但论文指出这些模型常被当作跨语言通用指标使用,因此该失配本身就是值得检验的实践问题。
声学劣化上模型与人类是否同向变化?
在声学劣化组,人类对自然条件的评分为 3.49 左右,所有劣化条件都显著更低,范围约在 1.12 到 2.24 之间,且随严重程度单调下降。多数模型在条件排序上与人类高度一致,只有 SHEET-MB 在 MP3 条件上出现排序错乱,把人类只给 1.43 的 8 千比特每秒样本预测到 3.76 附近。论文把该例外归因于多域训练对声学劣化的泛化下降,这与 MOS-Bench 中多域模型在声学损伤上泛化减弱的观察一致。
下面这张表要回答的问题是,在相同结构下改变训练数据与编码器是否改变声学跟踪能力。公平条件是同一组 A 样本与同一个人分数,指标方向是等级相关越高越好。表中只用原文连续句子逐字覆盖的数值,不引入表格裸值的新单位。
| 模型与对照 | 训练数据要点 | 系统级等级相关 | 话语级等级相关 | 原文支持的判断 |
|---|---|---|---|---|
| SHEET-MB | 多域 MOS-Bench 含歌声与噪声 | 0.750 | 0.782 | 系统级在 MP3 上失序 |
| SHEET-BV | 仅 BVCC 英语合成变换 | 0.964 | 0.776 | 换数据后系统级恢复 |
| UTMOS | 与 SHEET-BV 同数据不同编码器 | 0.929 | 未在引用句中报告 | 编码器差异影响小 |
上表显示的主要收益是把训练数据从多域换成单一合成域后,系统级排序从 0.750 恢复到 0.964,而话语级保持在 0.782 对 0.776 基本不变。代价是该结论只在声学劣化组内成立,不能推广到韵律组。未胜出项是 SHEET-MB,它在 MP3 低码率上明显高估,说明多域覆盖噪声与电话语音并不自动保证对压缩失真的排序正确。编码器对照显示 WavLM 与 wav2vec 2.0 在同数据下模式相近,支持训练数据组成是主导因素的解释,但这仍是有限解释而非因果证明。
看图路径: 1. 先看左上自然语音平均基频面板中红色人类点是否随横轴起伏,对比橙色与棕色模型点是否随横轴倾斜;2. 再看右上自然语音平均时长面板中红色人类点是否随横轴下降,对比模型点是否呈水平带状;3. 然后看左下基频平移面板中各颜色点带在极端横轴处是否发散,判断人工拉伸是否超出自然分布;4. 最后看右下语速变换面板中红色人类点是否在中间时长形成峰顶,对比模型点是否缺少对称峰形
论文图 1。原论文 Figure 1:“Scatter plots of MOS against speaker characteristics (mean log F0, speaking rate) for Groups C-1–C-3.”。
上图是 C 组说话人特性的散点矩阵,包含自然语音平均基频、自然语音平均时长、基频平移后平均基频、语速变换后平均时长 4 个面板,纵轴都是分数,图例区分人类与 6 个模型。可见内容支持后文的双重分离讨论:自然基频面板中人类红色点带基本水平而部分模型点带倾斜,自然时长面板中人类点带有下降趋势而模型点带较平,语速面板中人类在中间时长形成峰顶而模型缺少对称峰。像素不能精确读出的具体分值不硬写,以原文报告的相关系数为准。
重音翻转与说话人操纵为何暴露更大分歧?
在韵律错误组,增加翻转比例带来人类分大幅下降,从无翻转 4.00 经低比例 3.19 降到高比例 2.16,总共下降 1.84 分。所有预测模型在 3 个条件之间变化不超过 0.1 分,均匀地不敏感,与编码器是否为自监督无关。把 A 组与 B 组放在一起看,训练数据从多域换成 BVCC 能修复声学排序,却不能带来韵律敏感性,论文据此认为缺少针对韵律质量的显式监督可能是瓶颈,而自监督表示音高信息有限与韵律特征贡献小的已有发现与此一致。
在说话人特性组,自然语音中平均对数基频与人类分几乎无关,平均语速与人类分呈负相关,基频起伏与人类分呈正相关。模型呈现相反模式,多数模型对平均基频有强负相关,给低基频说话人更高分,而对人类敏感的语速与基频起伏接近零相关。人工平移基频后人类仍与基频弱相关而模型保持原有负关联,人工变换语速后人类在约 6.0 秒处峰值对称下降而模型没有对称峰。
下面这张表要回答的问题是,人类大幅变化的维度上模型是否同步变化。公平条件是同一文本与同一说话人集合,指标方向是人类变化大而模型变化小即为不敏感,相关绝对值大即为强关联。表中数字全部来自原文连续句的逐字数值。
| 质量维度 | 人类分数或相关 | 模型变化或相关 | 差异含义 | 支持的假设 |
|---|---|---|---|---|
| 重音翻转高中低三档 | 4.00 到 3.19 到 2.16 共降 1.84 | 至多变化 0.1 | 人类显著下降模型几乎不动 | 假设 2 成立 |
| 自然平均基频 | 相关 -0.059 可忽略 | 多数模型强负相关 | 模型有人类没有的偏置 | 假设 3 成立 |
| 自然语速 | 相关 -0.520 负相关 | 接近零或方向不一致 | 人类注意而模型忽略 | 假设 3 成立 |
| 自然基频起伏 | 相关 0.477 正相关 | 接近零 | 人类注意而模型忽略 | 假设 3 成立 |
表后解释是重音维度构成最强反证,人类 1.84 分的跌幅在模型端几乎为零,说明当前标量预测没有编码语言学重音。说话人维度构成双重分离,模型在人类不敏感的平均基频上有偏置,在人类敏感的语速与起伏上不敏感。未胜出项包括所有 6 个模型在 B 组都失败,没有一个模型能作为韵律代理。边界是语言失配可能部分解释 B 组不敏感,但模型常被跨语言使用,因此该边界不削弱实践警示。SHEET-MB 是例外,它因歌声数据呈现正基频相关与中等语速相关,方向与其他语音模型相反,支持训练分布塑造偏置方向的解释。
换数据与换编码器分别改变了什么,没有改变什么?
论文没有做传统消融训练,但提供了两组天然对照。第一组是同结构不同数据,SHEET-MB 与 SHEET-BV 共享结构而训练数据不同,系统级声学排序从 0.750 提升到 0.964,话语级保持 0.782 对 0.776 不变。这支持数据组成主导声学敏感性的判断,代价是多域数据在提升覆盖面的同时破坏了条件级排序。第二组是同数据不同编码器,SHEET-BV 用 WavLM 而 UTMOS 用 wav2vec 2.0,在同数据下系统级为 0.964 对 0.929 模式相近,支持编码器不是声学差异主因。
关键在于这两组对照在 B 组都失效。换成 BVCC 后模型依然对重音翻转不敏感,说明仅靠调整数据组成不足以诱发韵律敏感性。论文进一步指出当前平均意见分数据集没有把韵律恰当性从整体声学质量中分离标注,因此监督信号本身缺失。梅尔频谱卷积模型在语速变换组出现更强的时长相关,论文解释为时间拉伸减少段内频谱变化,被卷积网络当作更高质量,这是模型误读时间维度而非真正理解语速自然度的例子。
作为例子,假设只看 MP3 8 千比特每秒 1 个条件,SHEET-MB 的高估会被平均数掩盖,只有同时看系统级排序与条件均值才能定位失败。这说明单看总体相关会漏掉条件特异性失败,需要按扰动类型分开报告。
哪些结论有边界,哪些推测尚未验证?
直接报告的是人类与模型在 3 组扰动上的分数与相关差异,有原文数值支撑。有限解释的是训练数据与歌声分布对偏置方向的影响,论文用可能与 plausibly 等措辞连接分布特性与观测到的正基频相关,属于支持性解释而非因果证明。未验证推测是缺少韵律监督即为根本原因的判断,论文没有提供加入韵律标注后敏感性恢复的对照实验,因此只能写成可能与待验证。
相关性不是因果,模型对低基频打高分不等于模型内部有显式基频检测器,也可能是数据分布中低基频样本质量更高的附带关联。缺失证据不是技术错误,原文未测量误判率、延迟、推理成本与听众间一致性,不能承诺这些量得到改善。总体趋势不等于每组都成立,例如 SHEET-MB 在声学组是例外,在说话人组方向相反,不能把多数模型的负基频偏置推广到它身上。
资源状态是正文开源声明的唯一依据,本次未发现来源绑定且完成超文本传输安全协议状态验证的资源,因此不得声称代码、模型或数据已公开。复现时应以论文文字描述与 VERSA 工具包的公开情况自行核对,不把无训练等同于确定性求解。
要复述方法先做什么,需要哪些具体参数?
先按表 1 思路清点样本量,A 组 4 说话人每人 5 句共 6 条件计 120 条,B 组 4 说话人每人 10 句共 3 条件计 120 条,C-1 为 20 说话人每人 10 句计 200 条,C-2 与 C-3 各为 4 说话人每人 3 句共 9 档各 108 条,总计 656 条。A 组 4 人与 C-2 和 C-3 的 4 人相同,且是 C-1 中 20 人里按男女最高最低平均基频选出的子集,其未处理原音不重复计数。
再固定评价协议,主观用 15 名母语者全量评价 656 条综合自然度 5 分制,客观把音频重采样到 16 千赫后用 VERSA 推理 6 个模型。A 组劣化参数要保留原文写法,轻削波放大 20 分贝、重削波放大 40 分贝后硬削波归一化,粉红噪声 20 分贝与 10 分贝信噪比,MP3 恒定码率 16 千比特每秒与 8 千比特每秒。B 组翻转概率要保留高 80% 到 90% 与低 10% 到 20%,且在重音短语内互换高低标签并遵守重音类型约束。C 组缩放因子要保留 0.5、0.7、0.8、0.9、1.0、1.1、1.2、1.5、2.0 共 9 档,其中 1.0 档用于度量声码器自身损伤,C-2 用 SiFi-GAN 而 C-3 用 WORLD。
还需补的验证是听众指导语是否在不同实验员之间一致、声码器重合成的随机种子是否固定、模型版本与权重哈希是否记录。若要检验韵律监督假设,需要额外构造带韵律恰当性单独标注的数据并做对照训练,否则不能断言加上标注必然恢复敏感性。
何时值得尝试这类模型,何时必须回到人工听音?
当任务是比较不同编解码、加噪或压缩带来的信号层损伤排序时,这类模型值得尝试,因为多数模型在 A 组与人类高度一致,且换成合成域训练数据后系统级排序可恢复。但当任务涉及日语重音准确性、韵律自然度或跨说话人选音时,必须回到人工听音,因为所有模型对 1.84 分的重音下跌至多只动 0.1 分,且对平均基频有系统性偏置。
实践中常见的误解是把总体相关高当成每个维度都可靠。本文的教训是总体相关可能来自声学维度主导,掩盖韵律维度的完全失效。另一个误解是多域训练一定更稳健,SHEET-MB 的例子显示多域反而在 MP3 条件上失序。还有一个误解是自监督编码器自带音高理解,论文引用的音高提取能力有限与韵律贡献小的证据不支持这种期待。
收束是标量平均意见分在声学保真度之外丢失了感知结构,人类综合多种声学与韵律线索而现有模型强调其中不同的子集。未来工作需要能分离韵律与说话人维度的评估框架,而不是继续用单一标量代替人类判断。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
