英文题目:Exploring Cross-Lingual Voice Conversion Methods for Anonymizing Low-Resource Text-to-Speech

会议身份:conference:eacl:2026:conference-paper-id:2026.eacl-short.16

✅ 来源为官方会议 PDF;可重放的表格、公式文本与 Figure 像素已按 PDF 抽取结果绑定,未成功恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#迁移学习 #跨语言 #低资源 #说话人匿名化 #语音转换

评分:5.6/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.9/1.5 | 清晰度 0.7/1 | 影响力 0.7/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5

排名:前50% | 文档类型:方法研究

👥 作者与机构

  • Shenran Wang:机构信息未能从会议 PDF 纯文本可靠映射
  • Aidan Pine:机构信息未能从会议 PDF 纯文本可靠映射
  • Mengzhe Geng:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本研究处理低资源文本到语音中的说话人匿名化,输入为nêhiyawêwin与SENĆOTEN文本,输出为剥离原始音色但保持自然度与可懂度的语音,难点在于说话人极少且社区内易识别,匿名强度与口音韵律保持难以兼顾。方法以StyleTTS2为统一底座,先在单语语料上训练无转换基线,以随机同说话人音频提取风格嵌入指导合成,为后续匿名提供参照起点。接着在冻结模型上检验免训练路径,前者对风格嵌入做平均、性别偏移与加噪,后者将基线合成波形送入预训练SeedVC做波形级音色替换,其输出质量与相似度直接与基线对比。最后将低资源语料与LibriTTS-R英语数据混合从头训练多语言模型,在风格编码器与文本编码器处加入可学习语言嵌入以解耦语言与音色,推理时以英语参考音频的风格嵌入引导跨语言迁移合成。相对推理扰动易残留原音色与外挂转换损伤质量口音的缺陷,语言嵌入使模型在共享多说话人表示的同时保留目标语言置信度,从而实现更稳定的跨语言匿名。在CRK测试集评估下,CRK-ENG带语言嵌入Custom设置的预测PESQ为3.92,高于单语无转换基线的3.83。该结论适用边界受限于仅两种语言且测试说话人均在训练中出现、仅经预测式客观指标验证而尚未验证人工听感与未见说话人外推,训练硬件为第一阶段两块A100-40GB与第二阶段一块A100-40GB。

🔗 开源与复现资源

  • 第三方资源:https://github.com/Plachtaa/seed-vc — 链接可访问(HTTP 200) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

输入是什么,目标是什么,本文要保留什么信息

本文输入是论文原文证据与本次收到的官方原图像素,目标是让刚进入语音音乐音频领域的研究生能核对并复述方法。必须保留的信息包括任务动机、数据划分、3 种匿名化路线、训练与推理动作、评价指标方向与关键数字。本文输出是 1 篇中文技术解读,不做营销判断,不补无源数值。

研究对象是低资源语音合成中的说话人匿名化。背景是原住民语言教育项目需要用 TTS,但提供录音的人在社区内广为人知,若合成模型直接克隆其声音,一旦说错或被滥用,会损害其作为语言专家的声誉或被用于诈骗。匿名化不是解决全部风险,只是降低对供音个人的直接牵连。

任务可复述为:在保持合成语音自然度与目标语言可懂度的前提下,让合成语音不再听起来像原来的录音人。论文用 StyleTTS2 做底座,因为它在少样本跨语言说话人适配上已被验证有效。推理时该模型必须输入一段参考音频,用以引导风格与说话人特性,这是后文一切替换、平均、加噪与跨语言迁移的抓手。

与哪些同目标路线相邻,本文站在哪里

同输入同目标的工作是语音转换与说话人匿名化。常见思路有两类,一类在合成模型内部动风格表示,另一类在合成后再接一个独立语音转换模型把声音转走。本文把两者都纳入比较,并增加第 3 类:在训练阶段就混入高资源英语数据,让模型见过更多说话人,再在推理时用英语说话人做参考。

同运行阶段的对照是推理时方法与训练时方法的区分。推理时方法不重训,只改风格嵌入或外挂 SeedVC;训练时方法从头训练多语言 StyleTTS2,并对比加与不加语言嵌入的版本。这种划分让读者能按成本选路线:无训练成本、现成转换成本、重训成本。

同监督的差异在于 StyleTTS2 用自监督从音频学习风格与说话人特性,而评价侧用无参考预测指标与说话人相似度、语种置信度做间接监督。论文明确指出标准 PESQ 与 SI-SDR 需要平行真值波形,而换声后已无真值,因此只能用预测式质量指标,这是理解后文指标选择的关键。

要测什么问题,什么算成功什么算失败

要测的问题是:换声之后,声音还自然吗,还像原来的人吗,口音还是原语言吗。成功需要同时满足 3 条:自然度不明显下降,说话人相似度下降,语言归属不漂向英语。只满足一条不算成功。

失败有 3 种典型形态。第一种是听起来很好但还是原人的声音,等于没有匿名。第二种是确实不像原人了,但质量崩了或口音变成英语,等于不可用。第 3 种是在一种语言上有效、在另一种语言上失效,等于不稳健。论文在两种加拿大原住民语言上同时检验,正是为了暴露第 3 种失败。

举例说明指标方向,例子不是论文数值:若某策略让相似度从高降到低而自然度基本不动,则支持匿名有效;若相似度降了但语种置信度也从高掉到接近零,则说明把语言信息一起换掉了,需要加语言嵌入或换路线。

三类方法全景:一个样本走完全流程

沿一个样本走完全流程有助于建立依赖顺序。输入是目标语言音素序列与一段参考音频。参考音频先进声学与韵律风格编码器得到风格嵌入,音素序列经文本编码器与韵律文本编码器得到语言内容表示,两路在解码器汇合生成梅尔频谱再合成波形。匿名化的操作点就是换掉参考音频或扰动风格嵌入。

第一类是推理时改嵌入:在单语 StyleTTS2 上,对同一说话人的多个风格嵌入取平均,或在男女均值差方向上平移,或用异性均值替换,或加高斯噪声,或直接用 LibriTTS-R 中随机 10 人的嵌入做引导。第二类是外挂 SeedVC:先用单语模型按不换声方式生成,再用 4 个预训练 SeedVC 模型把声音转成英语参考人的声音。第 3 类是训练时多语言迁移:把低资源语言与 LibriTTS-R 混训,再在推理时用英语说话人做参考。

下图是理解第 3 类的关键,它展示了语言嵌入加在哪里以及 2 阶段训练优化哪些模块,读图时先看主路径再看语言分支的注入点。

看图路径: 1. 先沿左侧梅尔频谱到声学风格编码器再到解码器的主路走一遍;2. 再看顶部语言嵌入分出几条线分别注入哪些编码器;3. 确认绿色框内第一阶段优化哪些模块;4. 对比右侧风格扩散去噪器与时长韵律预测器的输入来源

原论文 Figure 1:Architecture of the multilingual model with language embedding.

论文图 1。原论文 Figure 1:“Architecture of the multilingual model with language embedding.”。

图中顶部语言嵌入同时连向风格编码器、韵律文本编码器与文本编码器,左侧绿色框标出第一阶段只优化声学相关模块,第二阶段再联合优化全部模块。右侧风格扩散去噪器、时长与韵律预测器构成另一条从文本到风格的通路。可见设计意图是让语言信息有显式载体,从而把说话人风格与语言解开,这直接对应后文有无语言嵌入的口音差异。

组件分工:风格编码器、语言嵌入与扩散去噪器

声学风格编码器与韵律风格编码器分别从梅尔频谱抽取音色质感与韵律走向,输出的风格嵌入在推理时决定像谁在说。文本对齐器、声学文本编码器与韵律文本编码器负责把音素变成内容与韵律表示,解码器负责把内容、韵律、风格与基频信息合成波形。判别器侧的多周期与多分辨率判别器用于对抗训练保真度。

风格嵌入 × 说话人匿名化: 风格嵌入是 StyleTTS2 从参考音频经声学与韵律风格编码器学到的向量,控制合成音色与韵律,说话人匿名化是让合成语音不再接近原说话人;二者搭配的理由是推理时只替换或扰动该向量即可换声而不重训,组合意义是把匿名化变成参考音频与向量运算的选择问题,但也因此容易只改音色而留下原说话人痕迹。

语言嵌入 × 跨语言说话人迁移: 语言嵌入是加入文本编码器与风格编码器的可学向量,用于标明当前是何种语言,跨语言说话人迁移是用英语 LibriTTS-R 说话人参考去合成低资源语言;二者分工是前者分离语言信息、后者提供新声源,搭配理由是防止风格编码器把说话人与语言缠在一起,组合意义是换声后仍保留目标语言口音。

风格扩散去噪器是另一关键组件,它在推理时可从文本预测风格分布,从而减少对参考音频的依赖。论文的多语言改造没有改动原 StyleTTS2 其他模块,只在风格编码器、韵律文本编码器与文本编码器处加入语言嵌入,参数量因此从约一亿九千万增至约一亿九千八百万,嵌入维度为 64。训练时先只优化绿色框内声学模块,再联合优化全部模块。

\[Similarity = 0 Similarity = 0.3 Similarity = 0.5 Similarity = 1\]

上式是 SeedVC-v2 实验中控制与参考语音相似程度的超参数取值的原文呈现,分别取零、0.3、0.5 与一。论文还试验了不转换风格的配置。符号含义按原文:相似度系数越大,越要求贴近参考语音的风格;是否转换风格决定是否动韵律风格。原文未给出这些系数内部梯度路径的进一步推导,因此这里只按配置字面解释,不猜其扩散变换器内部实现。

训练与构造:数据混合、两阶段与推理参考如何取

训练数据由三部分混合:nêhiyawêwin、SENĆOTEN 与 LibriTTS-R 的 train-clean-100 中与 StyleTTS2 音素列表相交的约 53 小时。每种数据集随机抽 100 条做验证、100 条做测试,其余做训练。nêhiyawêwin 训练约 8 小时 8 人,SENĆOTEN 训练约 4 小时 2 人,LibriTTS-R 训练约 53 小时 247 人。测试集说话人在训练中都出现过,因此评价的是已见说话人的匿名化,而非未见人泛化。

训练动作是分 2 个阶段。所有第一阶段在两块 A100 上训练,第二阶段在一块 A100 上训练,优化器为 Adam,模型、BERT 与声学模块学习率分别为 1e-4、1e-5 与 1e-5,第一阶段 150 轮、第二阶段 100 轮,批量大小为 4。论文共训练 8 个模型:单语两个,多语言 6 个,覆盖是否加语言嵌入与 3 种语言组合。推理时多语言模型的换声动作用的是 LibriTTS-R 中随机 5 男 5 女共 10 人的风格嵌入均值。

推理时基线动作是:对每个说话人随机取一条该说话人样本做风格参考,引导生成该说话人的语音。Custom 动作是:随机取 LibriTTS-R 中 10 人的嵌入做引导并对 10 次运行取平均。SeedVC 动作是:对单语模型的不换声生成结果再做转换,v1 用默认配置,v2 调节是否转换风格与相似度系数。

实验条件:数据划分、指标方向与公平性

评价只用 nêhiyawêwin 与 SENĆOTEN 测试集,不评价英语测试集,因为目标是匿名化这两种语言。比较的公平条件是同一语言测试文本、同一底座 StyleTTS2 流程、同一组英语参考人取平均,避免单次参考人偶然好坏。质量侧用预测 PESQ、预测 SI-SDR 与 UTMOS 预测的 MOS,越高越好;匿名侧用 SECS,越低越好;口音侧用 MMS-LID 判定为 nêhiyawêwin 的置信度,越高表示口音保持越好。SENĆOTEN 因无现成语言分类器而不测口音。

预测 PESQ × UTMOS: 预测 PESQ 与 UTMOS 都是无参考语音质量预测,前者用 torchaudio-squim 预测感知质量与失真,后者预测平均意见分;二者分工是分别近似可懂度失真侧与自然度侧,搭配理由是换声后没有平行真值波形可用,组合意义是共同回答匿名化是否以质量崩塌为代价,但都不是真人听感。

SECS × MMS-LID 置信度: SECS 是用 Resemblyzer 算生成音频与真值间说话人嵌入余弦相似均值,越低表示越不像原人,MMS-LID 置信度是多语言语种识别判定为 nêhiyawêwin 的置信度;前者管音色像不像,后者管口音对不对,搭配理由是 SECS 可能只被音色主导而漏掉口音漂移,组合意义是同时检查匿名成功与语言保真。

需要提醒的限制是:所有质量分都是模型预测,不是真人听评;SECS 高可能只反映音色像,不能证明口音对;MMS-LID 置信度只是口音的代理指标。论文也说明因说话人少、社区评估难而未能做真人评价,预训练评价器本身可能有偏。因此后文数字应读作支持性证据,而非最终可用性证明。

主结果测什么:自然度、相似度与口音是否同时成立

主结果要回答:在两种语言上,哪条路线能同时做到质量不崩、相似度下降、口音不漂。比较对象包括不换声基线、推理时平均与 Custom、SeedVC 各版本、多语言加与不加语言嵌入的 Custom 迁移。指标方向按上节约定:质量越高越好,SECS 越低越好,语种置信越高越好。

下表是 SENĆOTEN 侧的结构化结果,问题是单语 Custom 与多语言迁移谁更能降相似度且保质量,公平条件是同一测试集与同一英语参考取平均策略。

ModelSetting PESQ↑SI-SDR↑MOS↑SECS↓ LibriTTS-R, multilingual models were able to pro-
- Ground Truth3.2923.053.171.00
STR No Conversion3.4023.753.210.87
STR Custom3.5524.643.290.74

表后解释需要同时看收益与代价。报告显示 SENĆOTEN 不换声基线的相似度为 0.87,单语 Custom 降到 0.74 但降幅有限,而与英语混训的多语言模型能降到 0.69 乃至无语言嵌入版本的 0.56,且预测 PESQ 与 MOS 同步上升。这支持多语言训练带来更强匿名与更好质量的判断。但代价在 nêhiyawêwin 侧的口音指标与作者听感中显现:无语言嵌入版本虽相似度更低、质量分更高,却带有强烈英语口音,语种置信接近零,而有语言嵌入版本能保持较高语种置信。因此总体最稳健的是带语言嵌入的多语言迁移,它不是单项最高分,而是三项同时成立。

下表整理训练组合与参考取法的可复述条件,数值与单位保留原文写法,便于核对实验规模与推理参考来源。

条件划分与参考训练组合参考人数备注
数据划分验证 100 条,测试 100 条低资源与英语混合10 人其余做训练
推理参考用英语人嵌入均值引导CRK-ENG,STR-ENG,CRK-STR-ENG5 男 5 女取 10 次平均
模型总数共 6 个多语言模型3 种语言组合10 人含是否加语言嵌入变体

表后补充未胜出项与边界。推理时方法在 nêhiyawêwin 上 Custom 与平均策略能降相似度到 0.63 左右且 MOS 最高,但在 SENĆOTEN 上 Custom 只到 0.74,说明推理时路线跨语言或跨说话人数不稳健。SeedVC 虽能把相似度压到 0.52 附近,但 v1-base 质量明显下降,v2 语种置信接近零,属用质量与口音换匿名。增加第 3 种语言的三语混训并未普遍优于双语混训,CRK-ENG 在多数指标上好于 CRK-STR-ENG,说明多加语言不一定更好。

反证与消融:拿掉语言嵌入、只动部分维度会怎样

反证围绕语言嵌入展开。有与无语言嵌入的对照保持数据组合与 Custom 参考策略一致,只改是否加入 64 维语言嵌入。报告显示无语言嵌入版本在两种语言上都拿到更低相似度与更高预测质量分,若只看这两项会误判为更好,但 nêhiyawêwin 语种置信从约 0.6 掉到接近零,作者听感也报告 SENĆOTEN 有强烈英语口音。这支持语言与说话人缠在一起的解释:模型把英语参考人的语言特性一起搬了过来。

另一组反证是只动风格嵌入中部分维度。附录用 32 维 PCA 与逻辑回归找与性别最相关的维度,再只在这些维度上做平均、平移、加噪与 Custom,结果与全维度推理时方法相近,未能实现充分匿名。这说明仅靠性别方向或少数维度的扰动不足以抹掉说话人身份,也从侧面解释为何需要引入外部说话人。

下表整理 SeedVC 侧的配置对照,问题是不同预训练版本与相似度设置是否改变质量与匿名的权衡,公平条件是同一单语生成结果再转换。

路线模型版本扩散步数风格处理备注
现成转换v1-base,v1-xlsr,v1-small30 到 50默认配置base 宜设 30 到 50 步
现成转换v230 到 50转换或不转换风格调相似度系数
相似度v230 到 50相似度 0 到 1含 0,0.3,0.5,1

表后解释代价。SeedVC-v1-xlsr 相对保质量,v1-base 与 v1-small 在口音与质量上损失更大;v2 各相似度取值的相似度都在 0.53 附近,语种置信极低,说明调该系数未能找回原语言口音。这支持论文判断:现成转换以牺牲质量换匿名,且不解决跨语言口音问题。未评测边界是 SeedVC 只转了 nêhiyawêwin 单语生成结果,未在 SENĆOTEN 上报告同等对照,因此不能把该权衡直接推广到另一种语言。

哪些结论有限,哪些量根本没测

直接报告的是预测指标与相似度、语种置信的变化;有限解释的是口音缠结与稳健性排序;未验证推测是真实社区听感与隐私保证。论文明确把人类评价缺失列为局限,原因是说话人少、低资源听评难组织,且所用预测器可能有偏。因此不能把 UTMOS 或预测 PESQ 当成真人自然度,也不能把 SECS 降低等同于法律或伦理意义上的匿名。

未测量的量包括误判率、延迟、推理开销与训练碳成本。训练资源只报告了 GPU 数量与轮数批量大小,未报告总时长与显存峰值;推理开销、输出帧率与实际延迟未分别讨论。总体趋势不等于每组每步成立,例如三语混训总体不如双语,但不能推出加任何第三语言都无益。

数据层面的边界是测试说话人均在训练中出现过,且 SENĆOTEN 训练仅 2 人约 4 小时,nêhiyawêwin 训练 8 人约 8 小时。这种极小说话人集合下的结论,迁移到说话人更多或录音条件更杂的场景时需要重新验证。权重不公开也是重要边界,复现只能复流程而不能直接下载模型。

复现先做什么,需要哪些信息条件

复现先做数据与基线。按表 1 规模准备划分:每种语言各留 100 条验证、100 条测试,其余训练;LibriTTS-R 取与 StyleTTS2 音素列表相交的 train-clean-100 部分混训。先训出单语 StyleTTS2 不换声基线,确认能用随机同说话人参考稳定生成,再做推理时 Custom 与平均等扰动,避免直接跳到多语言。

再做多语言分支。实现语言嵌入并注入风格编码器、韵律文本编码器与文本编码器,嵌入维度 64,先只优化声学相关模块再联合优化,学习率与轮数按原文 2 阶段设置。推理时固定用同一组 5 男 5 女英语参考取平均,以保证与基线可比。评价时同时跑预测 PESQ、预测 SI-SDR、UTMOS、Resemblyzer 相似度与 MMS-LID 语种置信,缺一不可,否则会误判无语言嵌入版本更好。

代码与资源状态需如实记录。论文给出 Speaker_Anonymization_StyleTTS2 仓库链接,SeedVC 引用第三方仓库。经本次核对,第三方 SeedVC 资源状态为 available,本次返回 200,可写当前可用;但原作者权重按伦理声明不公开,模型仍归社区所有,因此系统可运行不等于权重可下载。复现时若 SeedVC 版本更新,需锁定 v1-base、v1-small、v1-xlsr 与 v2 及扩散步数等默认配置,否则质量权衡不可比。

何时值得尝试这条路线,还需补哪项验证

当任务是为已知小群体供音人做教育类 TTS,且必须避免直接克隆其声音,同时能接受重训成本时,值得尝试带语言嵌入的英语混训加英语参考迁移。它在两种语言上都降低了相似度且保住了质量与口音,是 3 类中最少踩坑的选择。若只能做无训练方案,可在说话人较多的语言上试 Custom 或平均嵌入,但要预先接受在说话人极少的语言上可能降不下去。

当不能接受英语口音或质量明显下降时,不应选无语言嵌入混训与现成 SeedVC。前者看似分数更高实则口音已漂,后者匿名有限而质量代价大。若考虑增加更多语言混训,需先做小规模对照,因为本文三语并未稳定优于双语。

还需补的验证是真人听评与口音细粒度评估。至少应补目标语言母语者的自然度、像不像原人、像不像本语言三项打分,并报告错误率与推理延迟,才能把预测指标的排序落到可用性上。在此之前,本文结论应读作在给定预测指标与代理口音指标下的稳健性排序,而非对隐私安全的保证。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 eacl-2026 论文汇总