英文题目:PASQA: Pitch-Accent-Focused Speech Quality Assessment Model Trained on Synthetic Speech with Accent Errors
会议身份:
conference:interspeech:2026:conference-paper-id:kawamura26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#自监督学习 #主观评测 #韵律 #语音 #语音质量评估
评分:6.5/10 | 创新 1.3/2 | 技术严谨 1.2/1.5 | 实验充分 1.1/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Masaya Kawamura:机构信息未能从会议 PDF 纯文本可靠映射
- Yuma Shirahata:机构信息未能从会议 PDF 纯文本可靠映射
- Kentaro Mitsui:机构信息未能从会议 PDF 纯文本可靠映射
- Reo Shimizu:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
日语语音合成评估需判断输入波形在东京方言下的音高重音正确性,输出1至5分的口音质量分,难点是传统整体自然度分对局部声调核偏移不敏感。所提音高重音聚焦语音质量评估Pitch-Accent-Focused Speech Quality Assessment(PASQA)先用可控文本到语音Text-to-Speech(TTS)系统篡改重音核位置并按错误mora占比生成伪分与帧级标签,再以wav2vec 2.0提取帧级声学特征并与mora序列经Transformer编码与交叉注意力融合。融合表示分三路输出,分别用Bradley-Terry排序损失学相对顺序、帧级二分类定位错误区间、梯度反转层去说话人偏置。在受控重音错误评测条件下,PASQA的顺序准确率为0.785,高于ACC-SSL-MOS的顺序准确率0.738。与仅用L1回归的整体MOS基线不同,该多任务融合迫使模型关注局部核偏移而非说话人或整体自然度,从而在跨说话人上保持排序稳定。该结论限于日语朗读合成与合成错误分布,真实录音口音变体与跨语言韵律尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,要解决的听感问题是什么?
本文的输入是待评价的合成语音波形,在文本转语音评测场景下还可获得输入文本。目标不是预测整体自然度,而是预测日语声调正确度:同一个词如哈希,重音核位置不同可以表示筷子或桥,核位置轻微移动就会改变词义并影响可懂度和自然度。初学者可以这样理解:白话是音高在哪里掉,英文是 pitch accent nucleus,指重音短语内音高下降所在的拍。常规做法是让人听后打平均意见分,英文是 mean opinion score,缩写 MOS,做法成本高耗时长,于是出现自动 MOS 预测模型。
问题在于这类模型输出的是 utterance 级整体分,对局部核位置错误往往不敏感,错误加重时分数顺序不保持。本文要保留的信息是评估必须直接作用于语音信号,因为许多现代合成结构把重音相关表示当作黑盒,评测时拿不到内部标签。输出是一个限定在 1 至 5 区间的重音质量分,首要要求是严重度越重分数越低,绝对数值校准是次要目标。
同输入同目标的相关路线有何不同?
按同输入、同目标、同监督和同运行阶段对照,有 3 条路线。第一条是通用非侵入式质量预测,输入同样是波形,目标是整体自然度或噪声抑制质量,代表是 DNSMOS、NISQA、UTMOS、UTMOSv2 和基于自监督的 SSL-MOS,本文用 VERSA 工具包获取其分数作为对照。它们与本文同输入但不同目标,因此类别差异不能当作同条件胜负,只能检验整体分是否顺带反映重音正确度。第二条是帧级细粒度质量预测,目标是提高可解释性和定位退化位置,但已有工作尚未聚焦声调正确性,与本文同运行阶段但监督不同。
第 3 条是显式重音模块准确率路线,若合成系统自带重音预测模块,可直接测模块准确率,但它依赖内部标签,在黑盒结构下不可用。本文选择直接对波形打分的路线,理由是原文明确指出的跨系统适用性:在评测时无法保证拿到内部韵律预测。教学例子:这好比只听成品录音打分,不允许打开合成器的中间日志看它自己认为的重音是什么。
为什么顺序比绝对分数更重要?
本文把问题定义为保序问题。同一文本和同一说话人合成 3 个版本:无错误、低严重度、高严重度,期望预测分数满足无错误大于低严重度大于高严重度。顺序准确率,英文是 order accuracy,定义为满足该严格顺序的三元组比例,并列视为违反。相关系数 LCC、SRCC、KTAU 用来衡量预测分与伪重音质量分或人工分的一致性,其中 SRCC 和 KTAU 侧重排序一致,LCC 侧重线性一致,均以越高越好为方向,均方误差 MSE 以越低越好为方向。
原文报告显示,未在重音错误数据上训练的公开模型排序接近随机且相关接近零甚至为负,这支持整体自然度分与局部核错误的错位判断。需要区分的是直接报告与推测:接近随机是报告的现象,不敏感是有限解释,而断言这些模型完全听不到音高则属于未验证推测,本文不做此断言。
从一句话到一个分数,PASQA 走哪条主链?
先沿一个样本走完全程。输入是一句话文本与目标错误率,文本先经基于 MeCab 的形态分析做文本规范化,再经深度网络韵律标签预测模型得到三部分标注:mora 序列、重音短语边界与重音核,其中斜杠表示短语边界,星号表示核所在的 mora。
然后按目标错误率均匀抽取短语并从合法核位置中重采样出不同于原核的新核,合法类型按短语长度为 0 至长度减 1,0 表示平板无下降,其余表示在第几个 mora 后下降,由可控合成模型 NANSY-TTS 合成出带错语音,同时算出实际错误率并映射为伪重音质量分,还经合成模型的音素级时长预测对齐得到帧级错误标签。声学侧输入波形经 wav2vec 2.0 得到帧级特征,与 mora 编码经交叉注意力融合后分 3 路输出:帧级错误定位、utterance 级重音质量分、说话人分类。
下面的导读针对数据集构造图,帮你把文本改动与语音生成的对应关系看清楚。
本图展示重音错误数据集的构造管线,重点看文本如何变成带错语音与监督信号,阅读时注意标注、改核与合成 3 步的先后关系。
看图路径: 1. 先沿文本经形态分析与重音标签预测得到短语边界与重音核标注的主链看下去;2. 再看核位置被改动后如何分支生成多个错误严重度版本并汇入重音错误数据集;3. 对照底部图例区分原始韵律标注与重音核错误标记的含义;4. 记录每个样本同时产出改动后韵律、伪分数与帧级标签三类监督来源
论文图 1。原论文 Figure 1:“Accent-error dataset construction pipeline.”。
该图可见左侧从日文文本经重音标签预测得到带边界与核的序列,中间对核位置做改动并计算重音质量分,右侧经合成模型落入重音错误数据集,底部图例区分了原始韵律与重音核错误标记。这说明数据集的每条样本不是自然录音,而是同一文本在受控核改动下的合成版本,其监督来自改动记录本身而非人工打分,因此可扩展但分布受可控合成器限制。后续模型的所有排序监督都建立在这一构造逻辑之上。
声学与语言信息在哪里汇合?
主干沿用 SSL-MOS 结构:wav2vec 2.0 输出帧级声学特征,下游经掩码均值池化与投影头得到 utterance 分。在此之上第一项增强是 mora 条件融合。mora 序列从文本分析得到,分词嵌入为 256 维,经 1 层变换器编码器上下文编码,编码器使用 4 头、前馈 512、丢弃 0.1 并带旋转位置编码,再经交叉注意力与声学帧融合,交叉注意力维度 256、4 头、丢弃 0.1,生成按 mora 条件化的声学表示。直观说,声学分支回答实际音高怎么走,语言分支回答按文本应该在哪里掉,汇合点让模型能对位比较。
重音核 × 交叉注意力: 重音核指重音短语内发生音高下降所在的 mora 位置,是应被定位的语言期待;交叉注意力以声学帧为查询、以 mora 编码为键值做融合,是对位比较的实现方式,分工是语言侧提供应在何处下降、声学侧提供实际音高走向,组合后得到按 mora 条件化的声学表示,使后续打分能对位比较期待与实现。
第二项是重音质量头与排序学习。质量头是两层多层感知机,隐藏 64 维,输出经双曲正切变换裁剪到 1 至 5 区间。训练先对帧级分数按时间平均得到 utterance 分,再在小批量内对所有满足目标伪分严格大于关系的样本对计算成对逻辑排序损失,灵感来自 Bradley-Terry 模型,批量为 16 时按 B(B-1)/2 构成批内样本对。该目标只关心相对顺序,不强求精确数值。
伪重音质量分 × 实际错误率: 实际错误率指被改动重音核的短语所含 mora 数占全句总 mora 数的比例,伪重音质量分是对该比例做单调映射到 1 至 5 区间的 utterance 级目标;前者负责如实记录改动比例,后者负责给出可学习的排序目标,搭配原因是真实人工重音分难以大规模获得,组合意义是用可控合成的可计算比例替代人工标注来驱动排序学习。
右上 mora 示例对应片假名序列输入,上方波形图标对应输入波形,下方 3 路损失分别对应帧级错误标签、伪分数与说话人标签,中间橙色条带示意被判定为错误的帧段。这张模型总览图把四项增强的位置 1 次讲清:语言信息在交叉注意力处进入,定位监督在左路,排序与绝对误差在中路,话者对抗在右路。
本图是 PASQA 模型总览,重点看 3 路监督如何共用同一融合表示,阅读时先分清哪一路做定位、哪一路做打分、哪一路做去话者化。
看图路径: 1. 先沿左上输入波形经自监督模型到交叉注意力的声学主路径看下去;2. 再看右上 mora 序列经变换器编码器在何处与声学分支汇合;3. 比较下方三个分支的监督目标:帧级错误标签、伪分数与说话人标签;4. 确认均值池化与梯度反转层分别出现在哪个分支上
论文图 2。原论文 Figure 2:“Overview of the proposed PASQA model.”。
从像素可见顶部两个输入分别进入自监督模型与变换器编码器,编码器输出横向进入交叉注意力,融合表示向下经多层感知机接帧级损失并对照底部 0 与 1 标签,中间一路经多层感知机与均值池化接伪分数损失,右侧一路经均值池化与梯度反转层接说话人标签损失。这对应原文的 4 个修改点,新增作用是让同一表示同时承受定位、保序与去话者压力,而不是只拟合一个 utterance 分。
定位、排序与去话者化各自算什么?
第三项是辅助帧错误头。utterance 分本身不显式指出错误在时间轴何处,为此增加帧级二分类头,从自监督模型输出预测每帧标签,标签为 1 表示该帧属于核被改动的短语,否则为 0,标签经合成模型的音素级时长预测对齐得到,优化二元交叉熵。它的作用是给局部监督,帮助模型发现轻微错误。第四项是说话者不变学习。对自监督输出做掩码均值池化得到 utterance 嵌入,经梯度反转层接说话人分类器,分类器按交叉熵训练,主干收到反转梯度从而去掉话者可辨信息。
原文采用调度梯度反转,随归一化进度变化缩放反转强度,细节公式未在证据中给出完整形式,此处不补写具体曲线,只记录使用了进度相关的调度且常数为 10。最终总损失是四项加权和,权重在训练节交代。
排序损失 × 绝对误差损失: 排序损失负责学习同一批次内不同错误严重度样本的相对先后,绝对误差损失负责让预测分数靠近伪重音质量分的具体数值;前者分工是保序,后者分工是定标,搭配理由是本任务首要目标是错误越多分数越低而非精确复刻伪分数,组合后模型既保持严重度顺序又不完全偏离分数区间。
帧级错误检测头 × 话者不变表示: 帧级错误检测头负责逐帧判断该帧是否属于被改动重音核的短语,提供时间轴上的定位监督,话者不变表示通过梯度反转层接话者分类器迫使主干去掉话者可辨信息;前者分工是定位局部错误,后者分工是防止模型记住特定音色,搭配原因是可控语料中话者有限易形成捷径,组合意义是让 utterance 分数更依赖重音实现而非说话人音色。
自监督表示 × WORLD 声学特征: 自监督表示指由 wav2vec 2.0 从波形直接提取的帧级数据驱动特征,WORLD 声学特征指按 10 毫秒帧周期提取的对数基频、清浊标志、24 维梅尔倒谱和 1 维非周期性拼接成的 27 维参数;前者分工是保留丰富的韵律线索,后者分工是提供可解释的传统声学基线,搭配比较的原因是检验韵律敏感性是否来自数据驱动表示,组合意义在本文是作为对照基线说明自监督表示更能反映重音错误严重度。
需要明确的缺项是参数冻结与更新范围:证据只说明主干遵循 SSL-MOS 并描述下游结构与优化器,未明确 wav2vec 2.0 是否冻结或微调,也未给出梯度在交叉注意力与变换器之间的完整阻断说明,因此不能从模型名称推定全部参数都更新,复现时应先按全量可训练跑通,再把冻结策略当作待验证变量。
数据如何生成,损失如何加权训练?
构造侧用内部日语语料训练的 NANSY-TTS,语料含 173987 条人工标注音素与韵律标签,总计 207.96 小时,覆盖 17 个说话人。韵律标签预测模型在 80061 条人工韵律标注上训练。随后对 91157 个句子构造带错数据,每个句子生成 3 个严重度版本,错误率目标分别为 0、低严重度 0.1 至 0.2、高严重度 0.8 至 0.9,实际错误率按被改短语 mora 数占比计算,伪分按 5 减 4 乘以该比例得到。训练集共 2130858 条、总时长 2898.79 小时,开发集为剩余 20%,测试分 13 个见过说话人的 1170 条与 4 个未见说话人的 2400 条。
训练侧全部使用 16 千赫波形,优化器为随机梯度下降,学习率 0.001、动量 0.9、批量 16、梯度裁剪范数 1.0、最多训练 100000 步。总损失为排序损失、绝对误差损失、帧损失与说话人损失的加权和。下表把构造规模与训练配置放在一起,便于复现时先对齐数据量级再调优化细节。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 1 | 3 | 0 | 1.5;0.5;0.2;0.1 |
| 来源句二 | 128 | 0.1 | 16 kHz | 1;10;3;0.9;16;1.0;5686 |
| 来源句三 | 10 | — | — | — |
| 来源句四 | 1 | — | — | — |
该配置表说明原文把排序权重设为 1.5 高于绝对误差的 0.5,支持首要目标是保序的判断。代价是绝对分数可能偏离人工尺度,这在结果节的均方误差讨论中得到呼应。反例是梯度反转调度常数为 10,但其进度曲线未给出可抄写的完整形式,复现时只能先实现常见调度再做敏感性检查。
用什么对照、什么指标、什么主观条件?
对照分两类。第一类是未在重音错误数据上训练的公开模型,包括 DNSMOS P.835、DNSMOS P.808、NISQA、SHEET SSL-MOS、UTMOS、UTMOSv2,用 VERSA 工具包打分。第二类是在重音错误数据上训练的模型,包括基于 WORLD 特征的 ACC-WORLD-MOS 与仅用绝对误差训练的 ACC-SSL-MOS,以及完整 PASQA 及其消融变体。WORLD 特征按 10 毫秒帧周期从 16 千赫音频提取,基频范围 50 至 500 赫兹,使用对数基频、清浊标志、24 维梅尔倒谱与 1 维非周期性拼接为 27 维。客观指标是顺序准确率与 LCC、SRCC、KTAU,顺序准确率要求严格大于,相关系数越高越好。
主观评测招募 15 名日语母语者,对来自 4 个说话人、文本与训练不重叠的 120 条合成语音按东京方言声调自然度打 5 分制,计算顺序准确率与 MSE、LCC、SRCC、KTAU。域外评测用 GPT-4o-mini-TTS,对 50 个不重叠文本分别用字形输入与 mora 序列输入合成,预听确认字形输入声调更好,于是把字形版本当作正例,比较模型预测与 10 名母语者判断的成对准确率,并用单侧精确二项检验对比 0.5 随机水平。
谁保住了错误越重分数越低的顺序?
客观集上每个文本对应 3 个严重度版本,检验预测分是否保持无错误大于低严重度大于高严重度。报告显示未训练于重音错误数据的公开模型排序接近随机且相关接近零或为负,说明其整体分在局部核错误下与重音正确度不对齐。在重音错误数据上训练后排序与相关大幅提升,说明构造数据对学习重音质量有效。其中 ACC-WORLD-MOS 在见过与未见说话人上把排序提到约 0.34 但相关仍弱,ACC-SSL-MOS 全面超过 WORLD 版本,支持数据驱动自监督表示比传统声学参数保留更多韵律线索的判断。
PASQA 在见过与未见说话人上进一步超过两个基线。主观评测中人工自身排序一致性达 0.925,说明任务可判。PASQA 在 LCC、SRCC、KTAU 上最强,SRCC 为 0.828,KTAU 为 0.614,而 ACC-SSL-MOS 在顺序准确率上最高。下表聚焦主观条件下的可运行对照,帮你同时看到排序、校准与相关 3 个维度。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 2 | 0.580 | 0.161 | 0.850;1.293;0.814;0.828;0.614 |
| 来源句二 | 0.900 | 1.272 | 0.739 | 0.764;0.541 |
| 来源句三 | 0.850 | 1.293 | 0.814 | 0.828;0.614 |
| 来源句四 | 2016 | 14 | 5 | 33;2025;6255;6271;15;2022;8442;8446;16;2.0 |
表后解释需要同时讲收益与代价。收益是 PASQA 在 3 个相关上全面高于仅用绝对误差训练的基线,支持排序损失、帧定位、语言条件与去话者化共同改善了与人的一致性。代价有两处:一是 PASQA 的顺序准确率 0.850 低于基线的 0.900,属于明确的未胜出项,说明保序最强与相关最强不在同一模型上;二是常规 MOS 模型均方误差反而更低,原文解释为 PASQA 在伪分上训练导致动态范围与人工尺度错位,这支持首要目标是排序敏感而非绝对校准。
限制是人工仅覆盖 4 个见过说话人,不能推广到未见说话人的主观一致性。域外配对中 PASQA 成对准确率 0.780 且显著超过随机,而常规模型多未达显著性,支持跨合成器的敏感性,但人类成对准确率高达 0.984,差距仍大。
| 来源证据 | 量化值一 | 量化值二 | 量化值三 | 量化值四 |
|---|---|---|---|---|
| 来源句一 | 173,987 samples | 10 ms | 16 kHz | — |
| 来源句三 | 2,400 | 4 | — | — |
| 来源句四 | 1 | 3 | 0 | 1.5;0.5;0.2;0.1 |
该表把来源中的主结果数值按原文证据句整理,数值和方向只适用于当前验证条件,不能外推到其他数据。
拿掉哪一块,排序与相关掉得最多?
消融通过去掉 Bradley-Terry 排序损失、帧错误头、梯度反转层与 mora 条件融合来检验互补贡献。报告显示去掉帧头或融合会同时损伤排序与相关,与局部监督和语言条件有助于发现轻微错误的机制解释一致。去掉梯度反转层对见过说话人条件影响最强,支持话者对抗训练缓解了受控语料中的话者捷径。去掉排序损失后线性相关可能保持但排序相关下降,说明绝对误差能定标但保序仍需成对目标。
需要谨慎的是原文未给出每次消融的训练种子方差与显著性,差值大小不能直接当作因果强度的精确度量,只能作为方向性支持。另一个细节是 WORLD 基线始终弱相关,这反证了仅用基频与倒谱拼接不足以捕捉核位置错误,除非配合更强的时间对齐与语言期待。教学例子:去掉帧头好比只让学生交总分不要求标出做错的题号,总分仍可学但对小错更迟钝。
哪些边界本文没有测,不能承诺?
第一,资源可达性是明确缺项。本次收到的资源状态为没有发现来源绑定且完成验证的资源,不得声称代码、模型或数据已公开,摘要中的仓库链接在本次解读中只能视为文本提及,不能写成当前可用或已公开。第二,绝对分数校准未解决,PASQA 均方误差高于常规模型,不能承诺其分数可直接替代人工 5 分制,只能承诺排序与相关更优。第三,主观仅覆盖见过说话人与东京方言自然度,未测量误判率、延迟、推理开销与输出帧率,不能承诺这些量得到改善。
第四,域外仅用一种外部合成器与 50 文本的配对比较,且正例来自预听观察,不能推广到所有合成器与自发语音。第五,训练资源与硬件预算未报告,2898.79 小时的大规模合成训练意味着复现成本可能很高,总体趋势不等于每组每步都成立。这些缺失是证据边界,不是技术错误。
要复现,先对齐哪三件事?
先对齐数据构造。复现 NANSY-TTS 与韵律标签预测流程,或用任一可显式控制核位置的日语可控合成器替代,但必须保留同一逻辑:先预测短语边界与核,再按目标错误率均匀抽取短语并重采样新核,再合成并按被改短语 mora 占比计算伪分与帧标签,同时保存 mora 序列供语言分支使用。错误率三档建议先按 0、0.1 至 0.2、0.8 至 0.9 实现,再检查实际错误率分布是否与目标一致。其次对齐模型与训练。
主干用 wav2vec 2.0 接交叉注意力与 3 路头,mora 嵌入 256 维、变换器与注意力按原文头数与维度实现,质量头隐藏 64 维并裁剪到 1 至 5,帧头隐藏 64 维,话者分类器隐藏 128 维,优化器与批量、裁剪、步数与四项权重按配置表抄写,梯度反转调度先实现进度相关版本并把常数设为 10。最后对齐评测。客观按同文本同说话人三元组算严格排序, ties 算违反;主观按东京方言自然度 5 分制聚合后再算排序与相关;域外按字形对 mora 的配对准确率并做单侧二项检验。
若 wav2vec 2.0 冻结策略不明,应把冻结与微调当作显式对照,而不是默认全量微调。
何时值得尝试,还需补哪项验证?
当你的合成评测出现整体分很高但母语者仍抱怨词义混淆、且怀疑是局部音高下降位置错误时,值得尝试 PASQA 这类显式重音质量路线,尤其在黑盒合成器拿不到内部重音标签时。复现后先做两项验证:一是用未见说话人与新文本检验排序是否保持,二是补测校准曲线与决策阈值,因为本文优势在排序而非绝对分,直接用其分数做通过门限会失准。
未来工作指向域外鲁棒性与多语言扩展,但对初学者更实际的下一步是检查标注噪声:若韵律预测本身在长句上不准,构造的错误数据会把预测误差当作真值,必要时应对标注做人工抽检。记住中心矛盾:整体自然度与局部声调正确度不是同一目标,优化前者不自动修复后者,评价时需要为后者单独保留一个保序的尺子。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

