英文题目:Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens
会议身份:
conference:interspeech:2026:conference-paper-id:takizawa26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#自监督学习 #跨语言 #多语言 #语音识别 #语音情感识别
评分:6.5/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.8/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 1.0/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Daigo Takizawa:机构信息未能从会议 PDF 纯文本可靠映射
- Tomohiko Nakamura:机构信息未能从会议 PDF 纯文本可靠映射
- Samuele Cornell:机构信息未能从会议 PDF 纯文本可靠映射
- William Chen:机构信息未能从会议 PDF 纯文本可靠映射
- Satoru Fukayama:机构信息未能从会议 PDF 纯文本可靠映射
- Shinji Watanabe:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
本文研究跨语言离散语音表征问题,输入为英语、日语和中文的原始波形,输出为下游自动语音识别和语音情感识别所需的特征,难点在于神经音频编解码器离散化与自监督预训练都会引入语言偏差且相互混淆难以分离。方法链分为三步:先在重建波形上评估多种编解码器及不同训练语言条件下重训的编解码器的跨语言稳定性以刻画编解码器偏差。接着固定编解码器只切换自监督预训练语言以量化表征阶段偏差,其重建波形基线归一化后的错误率作为对照进入跨语言比较。最后固定自监督语言与目标语言一致只切换编解码器训练语言以检验编解码器复用性。在跨语言识别与情感语料任务下,评估统一采用跨语言变异系数比较经波形基线归一化后的错误率,覆盖三种语言的多套识别与情感语料。与已有以英语为中心且不区分两阶段的研究不同,本文通过双向固定对照将声学离散化与语言建模分离,揭示偏差主要来自后者,具有复用声学编解码器的实际意义。在DAC重训配置条件下,18码本配置的码率指标为9 kbps,高于官方配置的码率指标6 kbps。结论适用边界为声学编解码器加掩码预测表征的组合,在语义型编解码器、低资源语言和翻译等任务上尚未验证。原文未披露训练、推理或部署成本。
🔗 开源与复现资源
- 第三方资源:https://github.com/TencentGameMate/chinese_spe — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,本文要回答什么?
本文的输入是原始语音波形,目标是为自动语音识别与语音情感识别提供可复用的自监督表示。研究对象不是端到端识别器本身,而是中间两段:先用白话说,神经音频编解码器(Neural Audio Codec,简称 NAC)是一个先压缩后能解码的语音压缩器,它把波形变成一串离散编号;编解码器自监督学习(codec-based SSL)是直接拿这串编号做掩码预测预训练,再把学到的表示送给下游识别。论文要回答的是实际部署中的成本问题:如果目标语言变了,是否两段都要重训。
如果编解码器也要按语言重训,那么所谓压缩带来的存储与算力节省就会被抵消。作者因此把语言敏感拆成 3 个可核对的研究问题:重建波形上的下游性能是否随编解码器训练语言变化;固定编解码器、只变自监督预训练语言会怎样;固定自监督语言与下游语言一致、只变编解码器训练语言又会怎样。全文围绕英语、日语、中文三语展开,输出是各下游数据集上的字错率或字符错率与情感平均召回率,以及跨语言离散程度的变异系数。
本文默认只讲论文实际做的任务与条件,教学举例会明确标注为例子。
已有路线走到哪里,本文卡在哪个缺口?
第一条路线是低成本自监督。已有工作指出波形自监督需要海量无标注语音与长训练周期,存储与计算开销大。ESPnet-Codec 提供了统一的编解码器训练与评测基准并给出编解码器自监督的早期经验,Codec2Vec 报告用编解码器 token 做输入可以在保持与波形自监督相当性能的同时显著降低存储与计算成本。但论文指出这些研究以英语为中心,没有评估跨语言差异与语言敏感。第二条路线是波形自监督的语言失配。
低资源识别研究显示,当预训练语言与下游语言不一致时性能下降。第三条路线是编解码器自身的跨语言行为。一方面重建质量在不同语言间存在差异,另一方面在语音重建与语音合成任务中编解码器可以泛化到训练时未见过的语言。本文的缺口正在于没有量化编解码器重建对下游识别的影响,也没有通过控制性重训分离编解码器训练语言的作用。因此作者不争论哪种编解码器压缩率最高,而是固定方法框架,做正交的语言对照。
同输入、同目标、同运行阶段的对照是:同样做英语、日语、中文识别,同样用 HuBERT 类掩码预测,区别只在于输入是波形还是冻结编解码器的 token,以及训练语言如何设置。
语言敏感为什么会混淆,需要控制什么?
混淆来自两段都可能引入语言偏好。举例说明,这只是教学例子:假设英语编解码器对日语促音的量化较粗糙,同时英语自监督模型又没见过日语音素分布,那么日语识别变差时无法判断是哪一段的责任。论文因此要求 1 次只动一处。第一个问题看重建路径:把波形经过不同语言训练的编解码器压缩再解码,用重建波形训练并评测下游任务,观察跨语言性能波动。
第二个问题看自监督路径:固定一个跨语言表现稳定的编解码器,只改变自监督预训练所用的语言数据。第 3 个问题反过来:把自监督预训练语言固定为与下游语言一致,只改变编解码器的训练语言。这样 3 组对照分别对应重建影响、自监督影响与编解码器在自监督内部的影响。评价任务选择自动语音识别(Automatic Speech Recognition,简称 ASR)与语音情感识别(Speech Emotion Recognition,简称 SER),前者对语言与音素敏感,后者对声学与韵律敏感,互为补充。
语言选择英语、日语、中文的理由是原文明确给出的:有大规模公开数据可用于预训练与评测,且语言特性差异大。
三组对照的全景如何走通一个样本?
先沿一个样本走完全流程,再看 3 组如何切换条件。一段日语电视语音输入后,先进入冻结的编解码器量化器,得到多码本的离散编号序列;这些编号映射到预训练码本嵌入并求和,形成 token 嵌入;token 嵌入进入 Transformer 编码器做掩码预测预训练;预训练后的编码器各层表示按可训练加权求和,送入下游识别器。
以 Conformer 识别器为例,日语任务在对应日语训练集上单独训练,不加外部语言模型,直接报告字符错率。情感任务则按 SUPERB 情感设定,用 4 类情感报告平均召回率。下图把 3 组对照画成三行,行的区别只是哪一个方框被允许切换语言标签。
本段先做导读:该图不是模型结构图,而是实验设计图,重点是看哪一段被固定、哪一段被切换,以及最终都汇聚到英日中下游评测。
看图路径: 1. 先自上而下看三行:第一行是重建波形评测,第二行是固定编解码器只变自监督语言,第三行是固定自监督语言只变编解码器;2. 再看每行的输入箭头:都是从左侧波形图标进入浅蓝色编解码器框,再经中间 token 图标向右传递;3. 注意颜色分工:绿色框是下游评测,橙色框是自监督预训练,紫色小标签是语言条件
论文图 1。原论文 Figure 1:“Overview of our controlled experimental design to disentangle language sensitivity in codec-based SSL by de- coupling the NAC and SSL pre-training stages.”。
该图可见内容解释如下:第一行标注为重建对照,波形经编解码器得到 token 再解码为重建语音,然后做识别,编解码器下方挂着英语增强、日语、中文与混合 4 种训练条件,下游挂着英日中 3 种评测;第二行标注为固定编解码器、只变自监督预训练语言,编解码器固定为混合条件,自监督与下游分别挂英日中标签;第三行标注为固定自监督语言为匹配语言、只变编解码器训练语言,编解码器下方挂 4 种条件,自监督下方标注匹配。图中还区分声学与语义分支标记,说明不同公开编解码器的偏向不同。读图时不要把同一颜色当成同一模型,颜色代表阶段,文字标签才代表具体条件。
声学 token × 语义 token: 声学 token 分工是保留可重建波形的声学细节,语义 token 分工是经过自监督或识别监督引导而更偏向语言内容,二者搭配的理由是论文要说明不同公开编解码器的训练目标差异会带来跨语言稳定性差异,组合意义在于解释为何作者最终选择纯声学的 DAC 做后续控制实验以排除语义引导的混杂。
编解码器与自监督编码器各自算什么?
组件分为两部分。编解码器部分以 Descript Audio Codec(简称 DAC)为主。作者用官方 DAC 实现与 16 千赫兹配置,用 18 个码本把比特率从 6 千比特每秒提高到 9 千比特每秒以改善重建质量。训练时编解码器随后被冻结,量化器与码本嵌入在自监督阶段不再更新。自监督部分采用 HuBERT(一种用掩码预测隐单元的语音自监督方法),在 fairseq 框架内实现。
波形输入的 HuBERT 用标准卷积特征提取器;编解码器输入的 HuBERT 则替换输入为冻结编解码器产生的 token 嵌入,具体做法是每步把所有码本的编号映射到对应的预训练码本嵌入并求和,再送入 Transformer 编码器,Transformer 结构与训练目标与波形 HuBERT 相同。伪标签生成分两种:回答第二个问题时用 2 阶段聚类,第一阶段用梅尔频率倒谱系数特征的聚类训练 250 轮,第二阶段用第 6 层表示的聚类训练 400 轮,把语言相关因素限制在预训练数据本身。
回答第 3 个问题时用各语言波形 HuBERT 基座模型的第 9 层特征做聚类生成伪标签。原文未给出编解码器内部梯度细节与重建损失权重,本文不从模型名推定这些实现,只按证据说明冻结与复用关系。
神经音频编解码器 × 离散 token: 神经音频编解码器负责把波形压缩为可重建的离散 token 并提供码本嵌入,离散 token 负责作为自监督模型的紧凑输入替代波形,二者搭配的理由是用同一套离散表示同时实现存储压缩与可学习的语义建模,组合后新增的作用是让 HuBERT 类掩码预测可以直接在 token 嵌入上运行而不必每次解码回波形。
编解码器自监督学习 × 波形自监督学习: 编解码器自监督学习分工是以冻结编解码器产生的 token 嵌入为输入训练 Transformer 编码器,波形自监督学习分工是以卷积特征提取器从原始波形学表示,二者搭配比较的理由是控制预训练目标与网络主体相同、只切换输入形态,组合意义在于分离出离散化本身是否抹掉了语言相关信息。
训练数据、批量与优化如何设置,哪些参数冻结?
编解码器训练设 4 种语言条件:英语增强、日语、中文与混合,每种条件随机采样 1056 小时数据以保证公平。英语增强条件沿用原文数据源但把 Common Voice 限制为英语以避免混入日语与中文语音;日语用内部广播电视数据;中文用 WenetSpeech 大子集加非语音;混合条件合并上述语音加非语音。
非语音指音乐与通用音频,来源沿用公开数据。自监督预训练用各语言专用语料:英语用 LibriSpeech 的 960 小时,日语用内部广播电视数据的 4821 小时,中文用 WenetSpeech 大子集的 7173 小时。回答第二个问题时为了公平,日语与中文各随机采样 960 小时与英语对齐。优化沿用官方 HuBERT 基座配置,批量按 700 秒语音计算,8000 步预热,学习率 0.001,权重衰减 0.015。参数状态是:自监督阶段编解码器量化器与码本嵌入冻结并复用预训练嵌入,不重新学习 token 嵌入。
Transformer 编码器参与训练。下游阶段自监督表示冻结或按加权求和方式使用,识别器单独按语言训练。原文没有报告编解码器训练的完整算力开销与自监督训练的逐轮时长,因此本文不换算总成本,只记录可复现的配置量级。
下游任务、划分与指标如何保证可比?
下游覆盖两类任务三语。识别任务按语言单独训练与评测:英语用 Libri-Light 的 10 小时子集,日语用 LaboroTVSpeech 的 100 小时、自发话语料 CSJ 与方言语料 COJADS,中文用 WenetSpeech 的 100 小时子集与 AISHELL-1。划分沿用 ESPnet 官方划分,只有两处例外:LaboroTVSpeech 只用官方训练划分的前 100 小时,COJADS 为保证地域平衡重新选择评测数据、其余做训练与验证。识别器为 Conformer 模型,以自监督特征为输入,不用外部语言模型,各层表示用可训练加权求和融合,英语报告词错率(Word Error Rate,简称 WER),日语与中文报告字符错率(Character Error Rate,简称 CER)。
情感任务沿用 SUPERB 情感设定:英语用 IEMOCAP 约 12 小时,日语用 JTES 约 24 小时,中文用 EmotionTalk 约 24 小时;IEMOCAP 与 JTES 做五折交叉验证,EmotionTalk 用官方划分;4 类情感为高兴、愤怒、悲伤、中性;JTES 因类别不平衡报告加权平均召回率,另两者报告非加权平均召回率。语言敏感用变异系数(Coefficient of Variation,简称 CoV)衡量,先把每个数据集的错误率除以波形基线模型的错误率得到比值,再在语言内平均,最后算跨语言标准差除以均值。
情感的错误率取 1 减平均召回率。这种归一化使不同语言的不同基线水平可以比较,但它也意味着 CoV 小只代表跨语言波动小,不代表绝对性能好。
自动语音识别 × 语音情感识别: 自动语音识别分工是检验语言学与音素信息是否保留,语音情感识别分工是检验声学与韵律信息是否保留,二者搭配的理由是只测识别字错率无法判断编解码器是否只损伤了韵律,组合意义在于同时用语言敏感与声学敏感任务来刻画跨语言行为是否一致。
重建语音与固定编解码器时语言影响有多大?
先看重建语音对照要解决的问题:在只经过编解码器压缩再解码的波形上,下游性能是否随编解码器类型与训练语言大变。公平条件是同一重建波形流程、同一下游训练方法,只换编解码器。指标方向是识别错率越低越好,情感召回率越高越好,跨语言 CoV 越低越稳定。论文报告公开编解码器中 DAC 的跨语言 CoV 最小,因此后续控制实验选定 DAC 以排除编解码器选型混杂。接着看自监督语言对照:固定混合训练的 DAC,只改变自监督预训练语言。
论文报告的趋势是自监督语言与下游语言对齐时一般取得最好性能,识别与情感大体一致,仅有少数例外。作者还指出在基于梅尔倒谱系数的 2 阶段聚类下该趋势依然成立,说明对齐收益大于伪标签来源差异;用不同录制条件的数据集仍观察到语言对齐更好,支持这是语言差异驱动而非单纯领域差异。
下表把原文对编解码器训练条件与自监督数据量的交代整理成可核对的配置表,数字与单位保留原文写法,宽表用于 1 次看清 4 种编解码器条件与三语自监督数据量。
比较 4 种编解码器训练条件时,公平条件是每种都用 1056 小时、自监督数据量在回答第二个问题时对齐到 960 小时,指标是下游识别与情感及跨语言 CoV。表后解释见下一段。
| 条件 | 语言 | 数据来源 | 小时数 | 用途 |
|---|---|---|---|---|
| EN+ | 英语及多语 | 英语语音加非语音 | 1056 hours | 编解码器训练 |
| JP | 日语 | 内部广播电视数据 | 1056 hours | 编解码器训练 |
| ZH | 中文 | WenetSpeech 大子集加非语音 | 1056 hours | 编解码器训练 |
| All | 混合 | 上述语音加非语音 | 1056 hours | 编解码器训练 |
| SSL-EN | 英语 | LibriSpeech | 960 hours | 自监督预训练 |
表后解释:该表的主要信息是编解码器对照的公平性来自等小时数采样,而自监督对照的公平性来自把日中文采样到与英语相同的 960 小时。代价是这种等小时数并不等于等说话人数或等领域覆盖,内部电视数据与有声书数据的信道差异仍然存在。未胜出项是混合条件并没有在重建评测中系统性优于单语条件,说明简单混合数据不自动带来跨语言增益。原文对重建路径的判断是编解码器训练语言影响有限,尤其对声学编解码器而言。
自监督预训练语言 × 编解码器训练语言: 自监督预训练语言分工是决定掩码预测学到何种音素与韵律分布,编解码器训练语言分工是决定量化器码本覆盖何种语音声学空间,二者搭配做正交对照的理由是语言敏感可能来自两处而互相混淆,组合意义在于论文用固定一处、只变另一处来定位敏感来源。
固定自监督为匹配语言后,换编解码器还重要吗?
本节对应第 3 个研究问题:把自监督预训练语言固定为与下游语言一致,只换编解码器的训练语言,观察是否还需要为每种目标语言重训编解码器。公平条件是每种下游语言都用匹配语言的自监督模型,唯一变量是编解码器来自 4 种训练条件。指标方向同前。论文报告 4 种编解码器条件下的下游性能相近,没有一致趋势,用与下游相同语言训练的编解码器并不必然更好,混合条件也不系统性占优。
把该结果与第二个问题的结果对比,论文指出用波形 HuBERT 生成的伪标签优于基于梅尔倒谱系数的聚类,说明波形输入的 HuBERT 伪标签可以提升编解码器自监督的识别与情感性能。但作者同时强调语言对齐的收益大于伪标签差异。下表把原文对公开编解码器比较与两组自监督对照的文字结论整理成对照表,表中不写入自行计算的差值,只保留原文报告过的条件关系与判断方向,数值细节回到原文表格核对。
比较问题是:在重建评测、变自监督语言、变编解码器语言 3 种设置下,哪一处切换带来大波动。公平条件是每组内部只切换一处,下游任务与指标保持一致。表后解释见下一段。
| 设置 | 固定段 | 变化段 | 论文报告的波动 | 可部署含义 |
|---|---|---|---|---|
| RQ1 重建 | 下游方法 | 编解码器类型与训练语言 | DAC 最稳定,训练语言影响有限 | 选稳定声学编解码器 |
| RQ2 自监督 | 编解码器为混合 | 自监督预训练语言 | 对齐最好,跨语言波动大 | 需按目标语言做自监督 |
| RQ3 编解码器 | 自监督为匹配语言 | 编解码器训练语言 | 性能相近,无一致趋势 | 可复用单一编解码器 |
| 伪标签 | 数据语言 | 聚类来源 | 波形 HuBERT 优于梅尔倒谱 | 优先用波形模型做伪标签 |
| 混合数据 | 小时数 | 是否混合 | 未系统性提升 | 不靠混合解决语言失配 |
表后解释:主要收益是定位了敏感来源在自监督阶段而非编解码器阶段,代价是仍需为每种目标语言准备自监督数据与训练。反例是少数不对齐却不差的个例,原文未展开个例原因,本文不猜测为领域重叠或数据量优势。未评测边界是更多小语种与音乐等非语音任务,原文未来工作明确要扩展语言与任务。本文把相关性与因果分开:对齐更好是观察到的相关趋势,支持语言分布是主要驱动,但不等同于证明换语言必然按固定幅度掉点。
哪些结论有边界,哪些量没有测?
第一,语言覆盖只有英语、日语、中文,且日语与中文的大规模预训练数据量远大于英语对照时的 960 小时对齐量,绝对性能比较需注意数据量与领域差异。第二,编解码器以 DAC 为主要控制对象,公开比较中语义引导的编解码器跨语言波动更大,因此复用单一编解码器的结论更适用于声学编解码器,不能直接推广到所有语义编解码器。第三,下游只有识别与情感两类任务,没有覆盖说话人、合成或音乐任务。
第四,资源状态是正文开源声明的唯一依据,本次收到的第三方资源链接当前不可用,状态为 404,因此不能写该中文预训练权重当前可用或已公开,只能写本次未能确认可达,复现时需自行寻找可达权重或按配方重训。第五,原文未测量误判率分解、延迟、推理帧率与完整训练成本,本文不承诺这些量得到改善。训练资源、推理开销与输出帧率应分别讨论,总体趋势不等于每组数据集都成立。
第六,变异系数依赖波形基线做归一化,若基线本身在某语言上偏弱,比值会放大或缩小波动,阅读时应同时看绝对错率与召回率。
要复现这套对照,先做什么、保留什么?
先复现编解码器 4 个条件。按官方 DAC 实现与 16 千赫兹配置,用 18 个码本训练英语增强、日语、中文与混合 4 个版本,每种随机采样 1056 小时。英语增强需把 Common Voice 限制为英语以避免混入日中文。保留采样种子与小时数,才能保证公平。再准备自监督数据:英语取 LibriSpeech960 小时,日语内部电视数据与中文 WenetSpeech 大子集在回答第二个问题时各采样 960 小时对齐,回答第 3 个问题时用全量匹配语言数据。
伪标签按两套分别生成:一套用梅尔倒谱系数 2 阶段聚类,阶段零训练 250 轮、阶段一训练 400 轮并用第 6 层表示;另一套用各语言波形 HuBERT 基座第 9 层特征聚类。训练批量按 700 秒语音,8000 步预热,学习率 0.001,权重衰减 0.015。自监督阶段冻结编解码器量化器并复用其预训练码本嵌入,不重新学习 token 嵌入。下游按语言单独训练 Conformer 识别器,不加外部语言模型,各层表示用可训练加权求和,英语看词错率、日中文看字符错率。
情感按 SUPERB 设定,4 类情感,JTES 用加权平均召回率,另两者用非加权平均召回率,IEMOCAP 与 JTES 做五折交叉验证。还需补的验证是:换另一款声学编解码器重复第 3 组对照,加入小语种,以及报告存储占用与训练时长以核对成本主张。
何时值得尝试这套做法,何时不必?
当目标是多语言识别或情感分析,且希望节省波形存储与自监督输入带宽时,值得尝试复用一个稳定的声学编解码器加各语言自监督模型的路线。论文显示编解码器训练语言不是跨语言波动的主要来源,而自监督预训练语言与下游语言对齐是关键,因此预算应优先留给目标语言的自监督数据与训练,而不是为每种语言重训编解码器。当只有单语任务且已有波形自监督基线时,不必为了压缩而切换到编解码器输入,除非存储与算力确实受限。
当使用语义引导的编解码器或目标是合成等对重建敏感的任务时,不能直接套用本文复用结论,需先重复第一组重建对照。常见误解是把重建质量等同于下游识别性能,本文的分离表明重建稳定不代表自监督表示已跨语言对齐,语言特有的下游结构主要在自监督掩码预测阶段获得。另一个误解是把混合数据当成万能解,本文显示混合编解码器与混合自监督都未系统性解决语言失配,对齐仍需明确的匹配语言数据。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
