英文题目:ProsoCodec: Prosody-Oriented Speech Codec for Voice Conversion
会议身份:
conference:interspeech:2026:conference-paper-id:choi26d_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#扩散模型 #向量量化 #韵律 #零样本 #语音转换
评分:6.7/10 | 创新 1.4/2 | 技术严谨 1.2/1.5 | 实验充分 1.2/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Jeongsoo Choi:机构信息未能从会议 PDF 纯文本可靠映射
- Ji-Hoon Kim:机构信息未能从会议 PDF 纯文本可靠映射
- Shujie Hu:机构信息未能从会议 PDF 纯文本可靠映射
- Joon Son Chung:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
零样本语音转换(Voice Conversion,VC)要求保留源语音的语言内容与韵律(Prosody),只替换目标说话人音色,难点在于整体式神经编解码器将三者纠缠,而提示生成又易整体模仿参考音频。该文提出韵律导向编解码器 ProsoCodec,先用预训练语音识别与说话人验证模型抽取文本与说话人嵌入作为前缀条件,再将低频梅尔谱送入 Transformer 编码器并经二值球面量化形成离散瓶颈,最后由扩散 Transformer 解码器以流匹配目标重建全频梅尔谱。与显式分解内容、音色与基频的方法不同,该设计不设对抗解耦目标,而是靠条件冗余与容量限制迫使瓶颈只编码残差韵律,并用同说话人双话语训练阻止从提示复制话语级风格。在 LibriTTS test-clean、test-other 与 VCTK 合并的 3000 条零样本转换评测中,该方法在内容错误率、目标音色相似度与源韵律保持上同时优于 Seed-VC、Vevo、FACodec、HierSpeech++、UniAudio 与 DDDM-VC 共 6 个开源基线,自然度接近源语音。其结论限于 24 kHz 英文朗读语音与 2秒至8秒短句转换,尚未验证跨语言、强情感、歌唱或噪声自发语音的外推能力。原文未披露训练硬件、推理延迟与部署成本。
🔗 开源与复现资源
本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,输出是什么,哪些信息必须保留?
这篇论文研究的是零样本声音转换。输入是两段语音,一段称为源,提供要说什么以及怎么说,另一段称为参考,提供要变成谁的声音。目标输出是一段新语音,它的内容与韵律要跟随源,音色要跟随参考。必须保留的信息有 3 类,论文反复区分它们。第一是语言内容,即字词序列是否正确。
第二是韵律,即语调起伏、节奏快慢等随上下文变化的表达方式。第三是音色,即听起来像谁。初学者容易把韵律当成可以整体替换的独立旋钮,论文明确反对这种看法,指出韵律是以内容和说话人为条件的,即使同一说话人说不同句子,韵律也不同。因此任务难点不是把声音压缩得更像,而是如何在换音色的同时不丢掉源的韵律,也不要把源的音色漏过去。
论文把神经语音编码器看作已有进展的基础,这类编码器把连续语音压成离散 token,便于生成模型使用,但通常是整体重建,把内容、音色、韵律缠在一起。对零样本克隆而言,整体模仿参考是有利的;对声音转换而言,整体模仿恰恰会覆盖源韵律。理解这个矛盾,是理解后文所有设计的前提。
已有路线如何拆分语音,为何韵律最难拆?
已有声音转换路线大致可分为 3 类。第一类是显式分解,把语音拆成内容、音色、基频等属性,转换时只替换音色表示,其余保持不变。第二类是约束瓶颈或对抗目标,在自编码器中施加信息瓶颈或对抗损失,学出所谓解耦表示。第 3 类是基于提示的生成,用语言模型或扩散模型以参考音频为提示做上下文学习,直接生成目标语音。论文指出,前两类把韵律当成可独立于说话人的流,但韵律本身带有说话人条件下的细微差别,强制解耦会丢掉表现力。
后一类虽然音质与相似度强,但提示生成倾向于整体模仿参考,容易把参考的风格也搬过来。论文还回顾了神经语音编码器追求有限码率下忠实重建整体声学信号的路线,以及自动语音识别与说话人验证模型已经足够可靠,可作为外部先验。与之对照,本文不追求整体重建,而是做选择性表示学习。相关工作的共同缺口是,缺少一种既不依赖手工韵律标注,也不依赖脆弱对抗解耦,又能保留细粒度韵律控制的方法,这正是本文的切入点。
问题如何形式化,成功标准是什么?
形式化地说,给定源波形与参考波形,系统先用编码器各自得到离散 token 序列,再由解码器以源 token 为韵律载体、以参考语音及其 token 为音色锚点生成转换语音。训练时参考与源来自同一说话人,推理时来自不同说话人。成功需要同时满足 4 个方向。内容上,生成文本应与源一致,通常用词错误率衡量,越低越好。音色上,与参考的说话人相似度要高,与源的相似度要低,前者越高越好,后者越低越好,这对组合用于判断源音色是否泄露。
韵律上,与源的基频轨迹要接近,论文用对数域基频均方根误差衡量,越低越好。自然度上,既有人工平均意见分,也有自动预测分。举例来说,若只看与参考相似度高就宣布胜利,可能掩盖了韵律被参考带偏的问题,因此论文要求内容、音色、韵律、自然度一起报告。例子仅为教学说明,不代表论文给出阈值。
ProsoCodec 让离散瓶颈只学残差的全景是什么?
ProsoCodec 的核心想法是把韵律建模为条件残差,而不是一条可拆出的独立流。具体做法是,编码器与解码器都以文本与说话人嵌入为条件,离散瓶颈因此被鼓励去编码那些被内容与说话人解释不了的变化。沿一个样本走一遍,源波形先经短时傅里叶变换得到梅尔谱,源转录经文本编码器得到文本前缀,参考或源的说话人嵌入经说话人编码器得到说话人前缀,三者拼接后送入变换器编码器,再经插值与量化得到离散 token。
解码时,带噪梅尔谱与量化表示相加,再与说话人、文本前缀拼接,送入扩散变换器解码器预测速度场,最终输出梅尔谱并经声码器变成波形。训练用条件流匹配损失,推理用参考提示做上下文一致生成。下图展示了从底部波形到顶部波形的完整路径,是理解前后缀与量化器位置的关键。
下图为论文图 1 的模型结构图,建议先看清底部两路输入与顶部输出的主干,再核对条件从哪里注入。
看图路径: 1. 先从底部参考与源波形出发,确认说话人验证、语音识别与短时傅里叶变换三条支路的指向;2. 再看编码器下方三路输入如何汇入编码器,量化器位于编码器与解码器之间;3. 接着核对解码器左侧噪声、时间步与说话人、文本条件,以及顶部声码器输出波形的箭头;4. 最后观察右侧虚线条件流匹配损失连接输入与输出梅尔谱的闭环
论文图 1。原论文 Figure 1:“Model architecture of ProsoCodec. Reference and source are from the same speaker during training and different speakers during inference.”。
图中底部左侧为较短的参考波形,右侧为较长的源波形,两者共同向上连接说话人验证、语音识别与短时傅里叶变换模块,再分别以说话人、文本、梅尔谱 3 路进入中间的编码器。编码器输出经量化器进入上方的解码器,解码器还接收噪声、时间步、说话人与文本条件,输出梅尔谱后经声码器得到顶部波形,右侧虚线标出条件流匹配损失连接输入与输出谱。这个布局直接对应条件残差思想,显式先验在编码与解码两侧同时出现,量化器是唯一的窄口。
文本与说话人条件如何作为前缀注入编码器?
编码器的输入不是裸梅尔谱,而是带前缀的序列。论文先用大规模预训练的语音识别模型得到整句转录,切分为子词后查表嵌入,再经多层感知机文本编码器映射到模型维度,得到长度为子词数的文本嵌入。说话人特征由预训练说话人验证模型抽取整句嵌入,再经多层感知机说话人编码器映射为单个向量。梅尔谱本身经线性层投影到同样维度。
拼接时按说话人、文本、梅尔谱的顺序沿时间维连接,送入双向自注意力的变换器编码器,输出后再切出与梅尔谱对应的那段作为引导后的特征。这样做的操作含义是,梅尔帧在编码时始终能看到内容与音色的显式说明,模型不必把有限容量浪费在重复存储它们。实现细节上,编码器与解码器分别由 8 层与 16 层变换器组成,隐藏维度为 1024,中间维度为 4096,注意力头数为 16,并从已有文本感知扩散语音分词器初始化以加速训练。
论文未报告文本与说话人编码器在训练中是否冻结,此处记为缺项,复现时需按原文实现细节另行确认。
文本先验 × 说话人先验: 文本先验负责交代说了什么,由预训练语音识别模型给出转录并编码为前缀;说话人先验负责交代是谁的全局音色,由预训练说话人验证模型给出 utterance 级嵌入;两者同时拼接到编码器与解码器输入前端,是为了让瓶颈不必再存冗余的内容与音色,搭配理由是这两类信息已有可靠外部模型可用,组合后离散 token 更可能只剩下两者解释不了的残差韵律。
需要强调的是,前缀不是简单的拼接装饰。编码器用双向注意力让每 1 帧梅尔都能参考前缀,解码器同样接收这两类前缀,因此瓶颈两侧的条件是一致的。这种对称条件是后文残差解释成立的前提,如果只在一侧加条件,模型仍可能在另一侧偷存冗余信息。
量化与扩散解码器如何分工保存韵律?
即使有显式先验,连续表示仍有足够容量记住缠绕的声学细节,因此论文加入严格的信息瓶颈。做法是在量化前后做线性插值以控制 token 速率,再用二值球面量化把特征投影到单位超球面并做二值量化,输出为取值为正负 1 的序列,隐式码本大小为 2 的 d 次方。限制容量的效果是,模型被迫依赖显式先验,把离散资源留给结构性变化,如语调与节奏。解码器采用扩散变换器,输入为加噪梅尔谱与量化表示的融合,外加说话人与文本前缀与扩散时间步嵌入。
训练按语音补全目标构造掩蔽,用随机片段掩蔽模拟推理时提供参考提示的情形,优化目标是让预测速度场逼近真实谱减噪声的方向。推理时源与参考分别编码为 token,解码器以源 token、源转录、参考说话人嵌入为条件生成,并在提示部分给出参考语音及其转录与 token 以保持上下文一致。梅尔谱用 128 个滤波器、80 毫秒窗长、20 毫秒 hop 抽取,帧率为 50 赫兹,推理用欧拉常微分方程求解器采样 32 步,再经声码器合成 24 千赫兹波形。
离散瓶颈 × 残差韵律: 离散瓶颈负责限制容量,采用二值球面量化把连续特征压到有限码本;残差韵律负责指代给定文本与说话人之后仍会变化的语调与节奏;搭配理由是不用对抗解耦也能迫使模型依赖显式先验,组合意义是把韵律建模为条件残差而非可独立交换的属性,保留了与内容和说话人相关的细腻变化。
扩散解码器 × 流匹配: 扩散解码器负责从韵律 token 重建高保真梅尔谱,采用扩散变换器结构并注入时间步嵌入;流匹配负责给出训练目标,让预测速度场逼近从噪声到真实谱的方向;搭配理由是自回归语言模型路径容易整体模仿提示,而掩蔽重建加流匹配更适合做给定源 token 与参考提示的条件补全,组合后实现源韵律加目标音色的生成。
沿样本再走一遍解码,带噪源谱提供需要补全的骨架,源 token 提供韵律走向,参考提示提供目标音色锚点,文本与说话人前缀提供内容与身份约束,时间步告诉模型当前噪声水平。这种分工使得去掉 token 的极端情形退化为零样本合成,韵律将由提示或文本泛化决定,而不是跟随源,这正是后文用基频曲线对比要证明的一点。
双话语采样与低频输入如何减轻风格泄露?
论文指出,直接把随机片段掩蔽与补全搬到声音转换,会引起提示风格泄露。因为训练时提示与源来自同一句话,基于提示的生成又倾向于整体模仿,输出会继承提示的风格,而不是保留源的韵律。为此论文引入双话语训练,从同一说话人采样配对的两句话,一句做提示,另一句做源,与随机片段掩蔽交替使用。这样提示与源在内容与韵律上不再相同,模型无法通过照抄提示蒙混过关,必须从源 token 中保留可生成的韵律信息。
第二个策略是只把低频梅尔带送入编码器,依据是韵律线索主要位于低频区,而送入解码器的提示仍用全带梅尔谱以提供说话人特征。由于没有显式解耦目标,瓶颈原本可能为最小化流匹配损失而保留过多声学细节,限制输入带宽相当于给 token 加上韵律偏置。训练整体端到端优化编码器、量化器与解码器,优化器为权重解耦的自适应矩估计,学习率为 2 乘 10 的负 5 次方,预热 10,000 步,共训练 150,000 步,全局批量按时长计为 160 秒。
论文未给出损失权重与掩蔽比例等全部超参数,复现时应以原文实现为准,不从名称推定。
双话语训练 × 提示风格泄露: 提示风格泄露指解码器整体模仿参考音频的语气与节奏,导致源韵律被覆盖;双话语训练负责从同一说话人采样配对话语,一个做提示、另一个做源,从训练上让从提示直接抄走语气变得困难;搭配理由是随机片段掩蔽训练时提示与源来自同一句,模型容易走捷径,组合后模型被迫从源 token 中保留可生成的韵律信息。
低频梅尔带 × 韵律偏置: 低频梅尔带负责只把梅尔谱的低频部分送入编码器;韵律偏置负责让有限码本优先编码语调与节奏而非细粒度频谱细节;搭配理由是韵律线索主要集中在低频区,而解码器仍用全带提示以保留音色,组合意义是在不加显式韵律监督的情况下,用输入带宽选择实现信息偏置。
这两个策略的共同点是都不增加手工韵律标注。双话语解决的是训练与推理的不一致,低频输入解决的是瓶颈容量被细节挤占的问题,前者管提示怎么给,后者管编码器看什么。
数据、基线与指标如何保证可比?
训练数据为 LibriTTS,共 585 小时、2456 位说话人的 24 千赫兹朗读语音。评测用 LibriTTS 测试干净集与测试其他集,以及跨域的 VCTK 数据集。每个评测子集随机采样 1000 条时长 2 至 8 秒的语音,每条配同说话人的另一条做重建提示,配不同说话人的一条做零样本转换参考。基线覆盖多种路线,包括基于分解属性重建的模型、统一音频生成的语言模型路线、因子化编码器路线,以及基于提示的扩散模型,论文点名的对比有 DDDM-VC、HierSpeech++、Vevo、UniAudio、FACodec 与 Seed-VC。
指标分主观与客观,主观由 15 位听众对每子集随机 10 条按 5 分制打分,分别测与参考的说话人相似度、与源的韵律相似度与整体自然度。客观包括词错误率,用与训练不同的 Whisper-large-v3 转写以避免评测偏置;说话人相似度用预训练 WavLM-Large 嵌入的余弦相似度,分别报告与参考和与源的相似度;韵律用 Harvest 提取基频并取对数后计算与源的均方根误差;自然度用 UTMOS 自动预测。
方向上,词错误率、与源相似度、基频误差越低越好,与参考相似度、主观分、UTMOS 越高越好。硬件与统计显著性在证据中未报告,此处记为缺项。
主结果在内容、音色与韵律上各付出什么代价?
比较的问题是,在同一合并评测集上,转换语音是否同时做到内容对、音色像目标、韵律像源。公平条件是所有方法都做零样本转换,参考来自不同说话人,内容转写用独立于模型的识别器,音色用同一说话人验证嵌入计算。指标方向如前所述,词错误率与基频误差越低越好,与参考相似度越高越好,与源相似度越低越好。下表整理 3 个可运行基线与本方法的关键客观数字,列数满足宽表要求,数值保留原文写法。
| 系统 | 词错误率↓ | 与参考相似度↑ | 与源相似度↓ | 基频误差↓ |
|---|---|---|---|---|
| Seed-VC | 5.078 | 0.531 | 0.239 | 0.473 |
| Vevo | 4.826 | 0.478 | 0.243 | 0.464 |
| ProsoCodec | 4.451 | 0.565 | 0.167 | 0.428 |
表后解释需要同时谈收益与代价。报告显示,ProsoCodec 的词错误率(%)为 4.451,低于 Vevo 的 4.826 与 Seed-VC 的 5.078,支持内容保留更好。与参考相似度为 0.565,高于另两者的 0.478 与 0.531,与源相似度为 0.167,低于另两者的 0.243 与 0.239,支持目标音色采用更好且源音色泄露更少。基频误差为 0.428,也低于 0.464 与 0.473,支持韵律跟随源更好。主观方面,原文表 1 还报告说话人平均意见分 4.167、韵律平均意见分 3.852、自然度平均意见分 4.000,韵律主观分高于对比方法,但自然度主观分略低于 Vevo 的 4.056,这是一个未全面胜出的点,说明韵律保真与整体自然度之间仍有 trade-off。限制是,这些是合并集上的平均趋势,不等于每组说话人或每句都成立,且未测量延迟与计算成本,不能承诺效率改善。
拿掉低频输入、双话语与条件后哪项最先变差?
消融要回答每个组件是否必要,以及瓶颈宽窄如何权衡。论文在 LibriTTS 测试干净集上做累积消融,条件一致,指标方向与主结果相同。下表整理原文消融行的核心数字,同样保留原文精度。
| 配置 | 词错误率↓ | 与参考相似度↑ | 与源相似度↓ | 基频误差↓ | 自然度预测↑ |
|---|---|---|---|---|---|
| ProsoCodec | 4.684 | 0.608 | 0.168 | 0.376 | 3.978 |
| 去低频梅尔 | 4.810 | 0.585 | 0.192 | 0.386 | 4.004 |
| 再去双话语 | 5.630 | 0.634 | 0.166 | 0.421 | 3.884 |
表后解释先看反证。把低频输入换成全带后,多项指标变差,支持限制带宽有助于聚焦韵律而非细粒度频谱。进一步去掉双话语训练后,基频误差从 0.386 升至 0.421,支持该策略对保留源韵律必要,但与参考相似度反而升至 0.634,提示去掉该策略后模型更倾向于模仿提示音色,这正是风格泄露的表现。继续去掉说话人条件后,原文报告说话人相似度下降、源泄露加重;去掉文本条件后词错误率大幅升至 86.601 量级,说明瓶颈在有限码率下高度依赖文本先验。
瓶颈配置方面,提高码率改善重建但加重转换时的源音色泄露,论文最终选 12.5 赫兹帧率加 4096 码本、约 150 比特每秒的配置以平衡内容保留与转换质量。未评测边界是,更低码率或不同语种下的稳定性未在证据中展开。
下图为论文图 2 的基频轮廓对比,建议先按图例区分 3 条曲线,再逐段核对跟随关系。
看图路径: 1. 先确认横轴时间为秒、纵轴为基频赫兹,以及图例中源真值、重建与零样本合成三条曲线;2. 再逐段比较橙色重建曲线与蓝色源曲线在起伏峰谷处的跟随程度;3. 最后观察绿色合成曲线在多处明显偏离源曲线的走向
论文图 2。原论文 Figure 2:“Pitch contour of resynthesis result of ProsoCodec along with source speech and zero-shot TTS output.”。
图中横轴为时间秒,纵轴为基频赫兹,图例区分源真值、重建与合成 3 条曲线。可见橙色重建曲线在多个峰谷处紧贴蓝色源曲线,包括约 2 秒附近的大起伏与 3 秒后的一段下行,而绿色合成曲线在约 1 秒、2 秒后与 3 秒后多处明显偏高或走向不同。解释是,带源 token 的重建能复现源语调轨迹,去掉 token 的零样本合成则生成与源不一致的泛化韵律,这支持离散 token 确实携带了源韵律信息。像素不能精确读出每点数值,此处只做走向判断,不硬写具体赫兹差。
哪些结论有证据,哪些还只是推测?
有直接报告支撑的是,在给定数据与指标下,条件残差加双话语与低频偏置的组合,在内容、音色与韵律 3 组客观指标上优于所列可运行基线,且消融显示去掉任一条件或策略都会在对应指标上变差。有限解释的是,低频有助于聚焦韵律、双话语迫使保留源韵律,这些机理解释与误差变化一致,但论文未提供因果干预之外的逐帧归因,因此只能说支持而非证明。
待验证的是跨域泛化到自发对话、歌声或强情感语音时的稳定性,以及不同识别与说话人模型失配时的鲁棒性。缺失证据不是技术错误,但需要明确,未测量误判率、推理延迟、内存占用与训练能耗时,不应承诺这些量得到改善。另一个常见误解是把总体平均改善当成每句必胜,原文合并集与子集的平均不能推广到每个说话人对,复现时应按说话人对分层检查。
最后,基频误差只是韵律的代理指标,节奏、重音与停顿未被该单指标完全覆盖,主观韵律分提供了补充,但样本量有限。
复现应先固定什么,再调什么?
复现先固定信息条件,再调容量。第一步固定文本与说话人来源,论文实现用 Qwen3-ASR 得到转录、用 CAM++ 得到说话人嵌入,评测转写用不同的 Whisper-large-v3,音色评测用 WavLM-Large,这些模型不同会改变指标口径,因此必须与原文一致或明确记录替换。第二步固定音频前端,128 维梅尔、80 毫秒窗、20 毫秒 hop、50 赫兹帧率,编码器只看低频带,解码器提示用全带。第三步固定瓶颈,12.5 赫兹、码本 4096、约 150 比特每秒是论文权衡后的选择,先用该点跑通转换,再扫码率观察重建与泄露的 trade-off。
第四步固定训练采样,双话语与随机片段掩蔽交替,训练与推理的提示来源差异要保留,否则容易复现出风格泄露。推理固定 32 步欧拉求解与声码器配置。关于可用性,本次收到的资源状态显示没有完成验证的公开代码、模型或数据绑定,因此不能写当前已公开或可下载,复现需按论文文字自行实现。建议先做重建的基频跟随检查,再做跨说话人转换的内容与音色检查,避免只看单一指标。
何时值得尝试这种条件残差路线?
当任务要求换音色但留住源表达,且已有可靠的文本与说话人模型时,这种路线值得尝试。它的好处是不需要手工韵律标注,也不用对抗解耦,通过对称条件加窄瓶颈实现残差建模,工程上只需处理前缀拼接、量化码率与双话语采样。当目标是整体克隆参考的风格时,则不必用此路线,直接用提示生成可能更合适。当输入是噪声大、转录不可靠或说话人嵌入不稳定时,应先补验证,因为瓶颈高度依赖这两类先验,去掉文本条件会导致内容崩溃就是明证。
未来验证应补三项,一是节奏与停顿等超越基频的韵律指标,二是按说话人对与语体分层的细粒度报告,三是推理成本与实时性的测量。只有在这些条件下,才能判断该方法在 expressive 合成与对话系统中的真实可用边界。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses

