英文题目:Feature Design and Generative Modelling in Deep Articulatory Synthesis

会议身份:conference:interspeech:2026:conference-paper-id:mcghee26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#流匹配 #模型评估 #发声与构音 #语音合成

评分:6.0/10 | 创新 1.0/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 0.8/1.5 | 开源 0.2/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Charles McGhee:机构信息未能从会议 PDF 纯文本可靠映射
  • Mark J.F. Gales:机构信息未能从会议 PDF 纯文本可靠映射
  • Kate Knill:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

构音合成需从发音反演得到的低维发音轨迹重建语音,难点在于跨说话人一致性反演表示已剥离基频、能量、音色与韵律,直接合成频谱模糊且机械感重。先以14维发音表示ArtVVN为输入,该步负责以舌体唇下颌关节点及发声鼻音主成分保持跨说话人音位一致,输出剥离语调与音色的纯发音轨迹。再将该轨迹与对数归一化到0至1的基频短时能量及预训练说话人验证模型嵌入拼接,该步负责显式补回韵律与音色,输出增强声学条件。最后将增强声学条件送入Conformer回归器或扩散Transformer条件流匹配模型生成梅尔谱,并将梅尔谱送入冻结BigVGAN Base声码器输出波形,其中流匹配以欧拉求解器函数求值次数调节保真与多样性。与直接确定性回归相比,生成式建模从数据中学习韵律分布而非依赖可能受噪污染的源特征。在VCTK噪声子集评测设置下,仅用发音的Base级联模型的PER为15.0,低于使用SPARC未归一化源特征的同架构模型的PER 29.1。该结论限于英语LibriTTS-R训练与小模型区间,未验证大规模数据下生成模型能否同时兼顾可懂度、音质与说话人还原。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

  • 演示资源:https://artsynth.github.io/ — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,输出是什么,什么信息必须保留?

这篇解读的输入是论文正文给出的发音合成对照实验,目标是让刚进入语音领域的读者能复述方法并理解结论的边界。输入端是语音波形,中间是发音逆变换估计出的发音动作,输出端是合成器重建的语音。必须保留的信息是音位内容,也就是听者据以区分词义的辅音元音区别。

发音逆变换这个术语初学者可以先理解为从声音猜动作,即用自监督语音模型从语音回归出舌头嘴唇下颌的位置。发音合成则反过来,是从动作生成声音,即学习从发音特征到声学特征的映射。论文的闭环是语音到发音再到语音,用合成语音的音位错误率来评价逆变换是否可靠。

关键矛盾在于逆变换为了跨说话人一致,有意丢掉了语调和说话人特性等信息,而合成为了听起来像原句,又要把这些信息加回来。加回的方式有两种,一种是显式加入基频、能量和说话人嵌入等附加特征,另一种是隐式使用生成模型从数据中学习缺失变化。加得越多,重建越好听,但合成结果就越不能代表原始发音估计,这正是论文要拆解的权衡。

同输入同目标的已有路线如何评价发音?

在同输入同目标的维度上,论文回顾了用发音合成评价发音逆变换的路线。输入都是语音,目标都是得到跨说话人一致的发音表示,运行阶段都是先逆变换再合成。已有工作包括用一致性训练的逆变换模型、用语音识别错误率衡量合成语音与原语音的音位差距,以及用纯声码器结构直接从发音加说话人信息生成波形。

在同监督的维度上,逆变换训练依赖威斯康星 X 射线微束数据集的配对语音与发音数据,发音表示覆盖舌唇下颌的 fleshpoint 位置,但原文明确说明该表示不含鼻腔气流与发声信息。后来的工作用语音模型的表示做主成分分析,构造出发声与鼻音维度,与上述发音组合成理论上覆盖英语辅音的完整表示,但仍不含语调与说话人特性。

与文本转语音的生成路线相比,本文借用了条件流匹配的思想,但目标不同。文本转语音用生成模型学习韵律变化,本文用生成模型补回发音未编码的声学变化。因此不能把文本转语音的自然度结论直接搬运为发音保真结论,这是后文所有对照需要保持的公平条件。

为什么加回信息会让评价失真?

问题可以沿一个样本走一遍来理解。输入一句话,先经逆变换得到每帧的发音轨迹,再送入合成器得到梅尔谱图,最后经冻结的大模型声码器得到波形。理想情况下,如果合成词错了,我们希望能归因于发音估计错了,例如把元音估计偏了。

但如果合成器同时看到基频与能量,它可能从这些信号中读出音位线索。例如清浊、能量包络本身就与辅音类别相关,小模型在数据不足时会依赖这条捷径。此时即使发音轨迹是错的,合成器仍可能靠声源特征猜对音,或者反过来因声源特征被噪声破坏而读错音。评价就失真了。

说话人嵌入也有类似风险。论文比较了两种嵌入,一种是基于语音模型卷积层并用声码器损失优化的嵌入,更易受噪声影响并可能携带更多语音内容,另一种是预训练说话人确认模型的嵌入,相对稳健。生成建模则带来另一层失真,多步采样会加入训练数据中的自然变化,使声音更自然但偏离输入发音。因此论文要回答何时附加信息是补全,何时是改写。

两条合成路径的全景是什么?

方法全景是级联合成加冻结声码器。无论是确定性路径还是生成路径,都先预测中间梅尔谱图,再送入预训练并冻结的大模型声码器合成波形。这样做的好处是隔离变量,声码器不参与训练,对比集中在发音到梅尔谱的映射上。

左侧确定性路径用基于 Conformer 的主干,直接从发音加可选的声源与说话人特征回归梅尔谱。右侧生成路径用从语音合成借来的扩散 Transformer 主干,把发音与噪声样本拼接后输入网络,并以时间步与说话人作为条件,学习速度场后再用 1 阶欧拉求解器迭代生成。论文主结果取函数求值次数为 2 且单随机种子,因为在该步数下不同初始化的音位差异有限。

发音逆变换 × 发音合成: 发音逆变换负责从语音估计发音动作,丢掉语调和说话人等信息以换取跨说话人一致性;发音合成负责从发音动作重建声学特征,用于检验逆变换输出是否保留了音位区别;二者搭配构成语音到发音再到语音的闭环,合成的保真度因此成为评价逆变换质量的可听探针。

下图展示了推理时的两条路径,左侧为基线合成器,右侧为流匹配合成器,是理解后文所有消融的前提。

看图路径: 1. 先看底部两路输入:左侧是发音加声源特征,右侧是发音加噪声,确认条件进入位置不同;2. 再看中间加号节点:说话人嵌入与时间嵌入在何处汇入两条主干;3. 最后沿顶部箭头看输出:两路是否都汇到同一梅尔谱图再送入冻结声码器;4. 注意右侧标有 NFE 的循环箭头,理解生成侧需要多次调用网络

原论文 Figure 1:Inference diagrams for baseline synthesiser (Left) and flow-matching synthesiser (Right).

论文图 1。原论文 Figure 1:“Inference diagrams for baseline synthesiser (Left) and flow-matching synthesiser (Right).”。

从像素看,底部左侧是两层轨迹叠加,上层多色曲线为发音,下层两条曲线为声源特征,共同经加号进入蓝色长条主干。底部右侧同样是发音曲线,但下方是绿色噪声块,共同进入粉色长条主干。中间有两个小方块分别标注时间嵌入与说话人嵌入,经加号汇入。顶部是一条梅尔谱图,左右主干都指向它,右侧还有一个标有 NFE 的圆圈回路指向噪声,表明生成需要多次调用网络。这种画法直接对应了显式加特征与隐式学生成的区别。

发音与附加特征在网络中如何组合?

组件层面先解释术语。发音特征在论文中记为 ArtVVN,是 14 维表示,包括 6 个 2 维点表示舌体、上下唇与下颌,加上 2 维的发声鼻音特征。白话说就是每 1 帧用若干个点的横纵坐标描述口腔形状,再加两个维度描述是否振动与是否鼻音化。声源特征指基频与短时能量,取对数后归一化到 0 到 1 区间。说话人嵌入来自预训练说话人确认模型。

组合机制是拼接或相加后送入主干。基线侧将发音与声源特征纵向堆叠,再与说话人嵌入相加进入 Conformer。生成侧将发音与噪声样本拼接,再与时间嵌入和说话人嵌入相加进入扩散 Transformer。主干规模上,基线与生成的小模型都是 8 层隐藏维度 256,与已有声码器模型量级接近,另有一个大模型为 12 层隐藏维度 768,用于检验容量与数据量的作用。

发音特征 × 声源特征: 发音特征描述舌唇下颌位置与发声鼻音维度,承担音位区分的主要分工;声源特征指基频与短时能量,承担补回韵律与能量包络的分工;搭配理由是前者按设计不含语调信息,后者能直接补齐缺失的激励信息,但组合后合成器可能转而依赖声源特征携带的音位线索,从而掩盖发音本身的错误。

说话人嵌入 × 声码器: 说话人嵌入负责提供全局音色条件,使同一发音能生成不同说话人的声音;声码器负责把梅尔谱图变成波形,承担最后的波形细节生成;搭配时嵌入作为条件与发音拼接或相加进入网络,声码器被冻结以隔离比较对象,但若嵌入本身混入噪声或音位信息,就会同时改变说话人相似度评价与音位保真度。

条件流匹配 × 函数求值次数: 条件流匹配负责学习从标准高斯噪声到真实声学分布的速度场,以隐式方式补回发音未编码的变化;函数求值次数指推理时欧拉求解器走多少步,承担控制生成自由度的分工;搭配理由是步数越少输出越贴近条件均值而保音位,步数越多越能采样出自然细节而偏离条件,因此步数成为保真与自然度之间的调节旋钮。

这种组合意味着附加特征与发音在同一序列位置逐帧对齐,网络可以在每 1 帧自由选择信任哪一路。当声源特征干净时,网络倾向于信任它以降低训练损失,当声源被噪声破坏或被替换为另一词的声源时,这种信任就会暴露为音位错误,这正是后文噪声集与最小对立词替换实验的设计动机。

训练如何组织,哪些参数更新冻结?

训练数据上,小模型用 LibriTTS-R 的训练干净 100 小时子集,大模型再加上 360 小时子集。评估用该语料的测试干净子集,以及另一平行噪声与干净语料的干净与噪声子集,用于检验声源与说话人特征被破坏时的表现。基线非生成合成器训练 25 个轮次,生成合成器训练 100 个轮次,理由是生成模型需要对每个数据样本充分采样不同的时间步。优化器用 AdamW,学习率为 1e−4。

参数更新方面,论文明确说明梅尔谱预测主干参与训练,而后端的通用神经声码器预训练后冻结,不参与梯度更新。对照的纯声码器模型则用全部 LibriTTS-R 训练数据训练,训练时间更长。论文未报告梯度裁剪、学习率衰减时刻与早停细节,也未给出生成模型时间步采样的具体分布之外的实现,因此复现时应先按均匀采样与默认优化器设置起步,并把缺失项记为待验证。

监督来源是配对的声学梅尔谱与发音特征,损失上基线是回归损失,生成是条件流匹配的速度场均方误差。推理时基线 1 次前向得到梅尔谱,生成则从噪声出发按速度场迭代多步。论文未声称冻结声码器能保证输出确定性,生成路径因初始噪声与步数不同会产生分布性变化,这是需要与确定性基线区分开的计算性质。

测什么,与谁比,条件是否一致?

实验按 3 个问题组织。第一是音位一致性,测重建语音是否保留输入发音的音位,用现成音位识别模型的音位错误率衡量,越低越好,同时用原语音与重建语音的发音重建均方误差衡量,越低越好。论文说明重建发音的相关性普遍高于 0.99,因此用均方误差更能拉开差距。第二是说话人重建,用输入嵌入与输出语音预测嵌入的余弦相似度以及另一说话人确认模型的确认准确率衡量,越高越好。第三是合成自然度,用自动预测模型 UTMOS 衡量,越高越好,但它不是人工评分,不能等同于人评。

比较对象包括纯声码器对照、级联小模型的不同特征组合、级联大模型,以及不同函数求值次数的流匹配模型。公平条件上,级联小模型训练数据一致,特征维度与主干规模接近,声码器冻结一致。纯声码器用了更多训练数据且特征归一化方式与说话人嵌入来源不同,因此不能把它的说话人相似度优势直接解读为结构优势。噪声集的平行干净与含噪条件用于检验信号型特征的脆弱性,最小对立词集的跨词替换用于检验附加特征是否改写音位。

资源状态方面,论文配有演示页,当前可用,状态码为 200,地址为演示站点,可试听基线模型在仅用发音时的机械感示例。但这只是试听,不能替代上文 3 类指标的定量判断。

保真与好听的权衡在数字上如何表现?

主结果围绕发音保真展开。论文报告,在域内测试集上,加不加声源与说话人特征时重建均方误差相近,但加了声源特征的模型音位错误率明显更低。流匹配模型在低函数求值次数下与非生成对应模型音位一致性相当。所有模型在噪声条件下都比干净条件差,但用了附加声源特征的模型在干净与噪声之间的音位错误率与均方误差差距远大于只用发音的模型。论文据此判断,小模型小数据下会依赖声源特征重建音位内容,而增大模型容量与数据量的大级联模型不用附加声源也能达到相近的重建水平。

说话人重建与自然度上,纯声码器在域内与干净域外数据上余弦相似度、确认准确率与自然度更高,但从干净到噪声条件下降剧烈。加声源特征的级联模型也有明显下降,而大级联加说话人嵌入模型没有这种下降。基线小模型上附加说话人嵌入反而损害了域内余弦相似度,但在干净噪声子集上确认准确率略高,论文解释为训练子集与容量不足以学到可泛化的说话人迁移。

下图把生成步数的双向效应画了出来,是理解生成建模代价的关键。

看图路径: 1. 先确认横轴是函数求值次数从 1 到 10,纵轴左侧是音位错误率右侧是自然度分;2. 再比较两条带叉标记的折线在步数 2 附近的陡峭变化;3. 观察步数增大后两条曲线是否同步上升并在高步数趋平

原论文 Figure 2:PER and UTMOS values for the flow-matching syn- thesiser with different Number of Function…

论文图 4。原论文 Figure 2:“PER and UTMOS values for the flow-matching syn- thesiser with different Number of Function Evaluations (NFE) on the clean data from [14]”。

从像素看,横轴为函数求值次数 1 到 10,左侧纵轴为音位错误率(%),右侧纵轴为自然度分。两条带叉折线都随步数上升,步数 2 之后自然度快速爬升,音位错误率也同步爬升,到 10 附近自然度趋平而错误率仍在高位。论文文字与此一致,指出小步数时样本听感接近基线模型,步数增大后音位错误率上升但自然度上升,自然度在接近 10 时趋平,与扩散语音合成中超过 10 步改善有限的趋势相似。这支持了用步数换自然度、用保真做代价的判断,总体趋势成立不等于每一步都单调,图中 4 附近的轻微回落即为例证。

把别人的声源拼到我的发音上会发生什么?

消融问题是附加特征是否只是补全缺失信息,还是会改写音位。操作是最小对立词替换,把一个词的声源与说话人特征拼接到另一个词的发音特征上,声源特征插值到与原发音等长,再重建语音并重新估计发音,用动态时间规整对齐后看最佳匹配词是否仍为原词。若最佳匹配仍为原词记为正确,否则记为错误。

比较问题是不同替换组合对元音与辅音准确率的影响,公平条件是同一基线模型与同一最小对立词表,只改变替换的特征子集,指标方向是准确率越高说明改写越少。下表整理了论文报告的 4 种条件,列数满足宽表要求,表头单位为准确率百分比,数据格为裸值,保留原文 1 位小数。

条件无替换仅替换说话人嵌入仅替换声源特征同时替换声源与说话人
元音准确率91.790.791.390.4
辅音准确率84.984.275.375.2

表后解释需要同时看到收益与代价。替换说话人嵌入对元音准确率下降更大,替换声源特征对辅音准确率影响更大,辅音整体下降幅度远大于元音。同时替换并未比仅替换声源更差太多,说明声源是辅音改写的主因。未胜出项也很重要,无替换时辅音准确率已低于元音,说明即使不替换,辅音本身更难保真,不能把全部误差归于替换操作。

下图展示了元音替换前后的错误分布,是判断新增错误还是放大旧错的证据。

看图路径: 1. 先确认左侧为原始特征右侧为交换后特征,横轴为最佳匹配词纵轴为输入特征词;2. 再对比左右两图亮斑数量:右侧是否出现更多分散的非对角亮点;3. 重点看元音混淆是否从个别对角偏离扩散为跨区域混淆

原论文 Figure 3:Smoothed log counts of substitution errors for vow- els synthesised without swapping…

论文图 2。原论文 Figure 3:“Smoothed log counts of substitution errors for vow- els synthesised without swapping source/speaker features (Left) and after swapping source/speaker features (Right)”。

从像素看,左右两幅热图的横轴为最佳匹配、纵轴为输入特征,颜色越亮表示对数计数越高。左侧原始特征下亮斑集中在少数格,右侧交换后亮斑更多更分散,并出现原文点名的大跨度错误,例如把一类元音判为另一类距离较远的元音。这支持了论文的判断,交换不只是强调已有错误,而是引入了新的错误,说明附加特征确实参与了音位决策,而不仅仅是渲染音色与韵律。

哪些边界尚未验证,什么结论不能推广?

局限首先是评价指标的边界。音位错误率来自现成识别模型,发音均方误差来自重估发音,自然度来自自动预测模型,都不是人工听辨与发音实测。论文用重估发音的最佳匹配做替换实验,本身依赖逆变换模型的准确性,若重估有偏,错误归因也会有偏。说话人评价用了 2 个模型,但输入嵌入模型与评价模型之一相同,存在条件与评价同源的高估风险。

其次是数据与模型的边界。纯声码器用了全量训练数据,级联小模型只用 100 小时子集,因此纯声码器在域内外的音位差距不能直接归于结构。论文明确指出级联大模型扩大数据与容量后表现改善,支持了小模型低数据下依赖声源的解释,但这仍是有限解释而非因果证明,待验证的是更大流匹配模型能否同时达到声码器的自然度与说话人重建。

下图展示了辅音在替换前后的错误分布,是理解声源脆弱性的最直接反证。

看图路径: 1. 先确认左侧稀疏右侧稠密,理解交换特征后辅音错误明显增多;2. 再看右侧首列附近是否出现整列偏亮,判断是否有系统性偏向某一类音;3. 对比元音图与本图的扩散程度,确认辅音对声源特征更敏感

原论文 Figure 4:Smoothed log counts of substitution errors for con- sonants synthesised without swapping…

论文图 3。原论文 Figure 4:“Smoothed log counts of substitution errors for con- sonants synthesised without swapping source/speaker features (Left) and after swapping source/speaker features (Right)”。

从像素看,左侧原始特征下亮点稀疏,集中在少数行列,右侧交换后整图明显变亮变密,多行出现横向扩散,首列附近甚至出现整列偏亮的系统性偏向。论文报告的数字是辅音准确率(%)从 84.9 掉到 75.3 左右,元音只从 91.7 掉到 90.4 左右,两者下降幅度不在一个量级。这表明辅音对声源替换更敏感,也意味着用含声源的合成结果去论证辅音发音质量时风险更大。未评测的边界包括真实噪声之外的混响与信道失真,以及跨语言音位的泛化,这些都不能从当前英语数据推广。

复现先做什么,需要哪些配置与检查?

复现应先固定评价管线,再动模型。第一步是用同一逆变换得到发音,用同一音位识别模型、同一说话人嵌入模型与同一自然度预测模型跑通重建评估,保证数据集划分、采样率与聚合对象一致。百分点差与相对百分比要分开记录,不同指标的差值不能混入模型列下比较。

第二步是按配置重训对照。下表整理了论文明确给出的主干与训练配置,列数满足宽表要求,数值保留原文写法,裸值不擅自添加单位,学习率保留科学计数形式。

模型主干层数隐藏维度训练轮次优化器与学习率
基线非生成合成器825625AdamW,1e−4
流匹配合成器8256100AdamW,1e−4
大级联说话人条件模型12768未报告AdamW,1e−4

表后需要说明代价与缺项。大模型的训练数据为 100 小时加 360 小时子集,训练轮次原文未明确给出,不能用小模型的 25 轮去猜。生成模型主结果取函数求值次数为 2 且单随机种子,复现时应先固定该步数与种子,再扫描步数以复现保真下降与自然度上升的曲线。声源特征需取对数并归一化到 0 到 1,对照声码器的未归一化声源与定制说话人嵌入不能混用,否则噪声鲁棒性对比不再公平。

第三步是跑两个诊断实验,一是用平行干净与噪声集比较加声源与不加声源模型的差距变化,二是用最小对立词跨词替换检验辅音是否出现大跨度混淆。若只复现域内音位错误率而跳过这两个诊断,就会错过论文的核心主张。

何时值得尝试,常见误解是什么?

何时值得尝试取决于研究目标。如果目标是用合成结果论证发音估计本身的质量,应优先使用只用发音的级联模型或低步数的流匹配模型,并报告噪声与替换诊断,避免用好听但可能改写音位的配置去支撑发音结论。如果目标是做可听演示或需要说话人相似度,则可以加入声源与说话人嵌入或增大生成步数,但需明确此时合成已补入非发音信息,不能再作为发音准确的证据。

常见误解一是把自然度等同于发音保真。论文显示步数增大同时提升自然度与音位错误率,好听与保真在此处是反向变化。误解二是把纯声码器的高说话人相似度当作结构胜利,实际上它用了更多数据与不同的嵌入和归一化,公平比较需要对齐这些条件。误解三是把附加说话人嵌入必然改善相似度,论文在小模型上观察到域内余弦相似度反而下降,说明容量与数据不足时条件可能成为负担。

收束时回到中心判断,附加信息与生成建模不是免费的修复,它们以可听性换取了对发音的忠实度。论文的价值在于给出可复述的检查动作,用噪声集差距、跨词替换与步数扫描把这种代价显式化。后续待验证的是扩大流匹配模型后能否在保持低音位错误率的同时接近纯声码器的自然度与说话人重建,这需要新的容量与数据对照,而非仅靠调大步数实现。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总