英文题目:Perceptual compensation for tonal context in self-supervised speech models

会议身份:conference:interspeech:2026:conference-paper-id:kirby26_interspeech

来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。

会议来源:官方记录 · 官方 PDF

标签:#自监督学习 #语音学与音系 #言语感知 #语音属性识别

评分:5.4/10 | 创新 1.2/2 | 技术严谨 1.0/1.5 | 实验充分 0.8/1.5 | 清晰度 0.8/1 | 影响力 0.8/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.5/1.5

排名:后50% | 文档类型:方法研究

👥 作者与机构

  • James Kirby:机构信息未能从会议 PDF 纯文本可靠映射
  • Ioana Krehan:机构信息未能从会议 PDF 纯文本可靠映射
  • Michele Gubian:机构信息未能从会议 PDF 纯文本可靠映射

📌 核心摘要

本研究以普通话声调三与声调四两选判断伪复刻人类感知补偿实验,输入为前接声调语境加目标音节的连续统刺激,输出为声调类别判断,难点在于基频同时受声调目标、顺向协同发音、语调与音段扰动多因素决定。处理链条分三环:先从AISHELL-3测试集40位说话人抽取双音节并用Parselmouth重合成14步声调四到声调三连续统,生成约13700条连续统约192000条刺激。再将刺激送入预训练与微调两版wav2vec2.0抽取各层嵌入,最后分别计算嵌入相似度与训练线性探针,以无语境基线为锚观察语境是否推移范畴边界。与既有辅音同化补偿研究不同,本工作聚焦超音段声调语境并以边界相对基线移动方向检验补偿,突出自监督表征对语调语境的敏感性差异。在AISHELL-3语料验证集探针分类任务条件下,高层Transformer的准确率为99%,从卷积层的准确率82%升至高层Transformer的准确率99%。结论仅适用于该架构与普通话声调三四对比,尚不能外推至其他声调对、语言或架构。原文未披露训练、推理或部署成本。

🔗 开源与复现资源

本次未形成可展示的已核验资源记录,开放状态尚未核实。 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。

🧭 深度解读

人类为什么能把声学相同的音听成不同声调?

输入是连续语音,目标是离散的音系类别,本文必须保留的关键信息是语境如何同时改变信号与知觉。普通话每个音节通常携带 4 种声调中的某种:T1 为高平调,T2 为高升调,T3 为低降调且在句末常带尾升,T4 为高降调。声调主要靠基频轨迹实现,但基频同时受前后音、语调、音段扰动和发声类型影响。当 T3 跟在以高收尾的 T1 或 T2 之后,它的起点会被抬高,听起来更像典型 T4;当 T4 跟在以低收尾的 T4 之后,它的起点会被压低,更像典型 T3。这就是顺向协同发音造成的声学混淆。

人类听觉并不照单全收这种混淆。知觉补偿的白话含义是听者按语境打折扣:如果知道前面是高调,就把目标起点偏高的部分归因于语境,仍判为 T3;如果前面是低调,则把偏低的起点归因于语境,仍判为 T4。原文复述的张等人实验正是这样做的:用固定声母韵母、只改变基频轮廓的 T4 到 T3 共 14 步连续体,让被试在孤立、无语境以及前字为 T1、T2、T4 的条件下做两种选项的迫选判断。人类数据显示高偏移语境增加 T3 回答,低偏移语境增加 T4 回答,而孤立条件居中,说明语境是在相对稳定的类别基线两侧施加偏置。

知觉补偿 × 顺向协同发音: 知觉补偿负责在判断目标范畴时扣除语境带来的声学偏移,顺向协同发音负责产生这种偏移:当前字声调的结尾高低会抬高或压低后字起点基频,使三声听起来像四声或反之,二者搭配才能解释人类为何把声学相同的目标判为不同声调,组合意义在于把声学相似性与音系归类分开检验。

下图展示了这种声学前提,左侧是 4 个声调在共鸣音节上的平均标准化基频轮廓,右侧是相同 T3 在不同前字声调后的实现差异。阅读时不要把曲线当作单次录音的瞬时轨迹,它们是对多说话人多样本规范化后的趋势,用于说明起点抬升与压低的系统性。

看图路径: 1. 先看左图四条曲线的整体高低与升降:高平高升低降高降如何分开;2. 再看右图同一三声在不同前字声调后起点有多大抬升或压低;3. 对照横轴归一化韵母时长与纵轴标准化基频理解这是平均轮廓而非单一样本

原论文 Figure 1:1

论文图 1。原论文 Figure 1:“1”。

从像素可见,左图蓝色 T1 维持在高平位置,橙色 T2 先降后升,红色 T3 整体低降,绿色 T4 先高后陡降;右图 3 条同为 T3 目标的曲线在起点处明显分开,蓝色高偏移前字后的起点最高,绿色低偏移前字后的起点最低,到韵母后半段逐渐靠拢。这就建立了后文模型检验的逻辑:如果模型真有补偿,它的内部表示或分类输出应对相同中间步数给出随语境反向移动的判断,而不是随声学相似性正向移动。

自监督模型被认为懂音系,证据来自哪里?

相关路线有两条。第一条是监督语音识别模型的语境适应,例如英语音素边界随模糊训练样本移动,或 wav2vec2.0 微调模型在符合语音规则的同化语境中更常补偿。这类结果较易解释,因为微调目标明确告诉模型存在音素或词汇类别。第二条更令人意外:有研究称纯预训练 wav2vec2.0 在英语塞音或流音的合规则与不合规则语境中也表现出不同编码,据此推测预训练已隐式学到音位规则。本文作者认为声调这类超音段语境可能更考验自监督,因为基频受太多无关因素支配,前字声调只是众多解释之一。

上下文编码器 × 音系语境: 上下文编码器指 wav2vec2.0 中卷积特征提取器之上的 12 层 Transformer,负责融合长时声学上下文,音系语境指前字声调高低对目标基频的系统性影响,二者搭配是要检验 Transformer 是否在无符号目标下自发编码可补偿的语境结构,组合意义在于连接模型机制与人类补偿行为的解释层次。

本文与前人工作的可比性建立在同架构同分析思路上:都用 wav2vec2.0,都比较预训练与微调,都用嵌入相似度或探测方法观察模糊音在不同语境中的归类。但本文把对象从辅音的发音部位或同化换成普通话声调,把语境从音段相邻换成前字声调高低,并引入人类在相同连续体上的基线作为判断标准。这意味着不能把英语辅音上的阳性结果直接搬运为声调也应有补偿,声学维度的数量与变异来源不同,学习难度也不同。

本文要回答的具体问题是什么?

问题可以复述为三句。第一,纯自监督的普通话 wav2vec2.0 表示是否自发表现出以无语境为基线的边界移动,即高语境偏向三声、低语境偏向四声。第二,用普通话有监督识别微调同一结构后,这种移动是否出现或增强。第三,用线性探测分类器从各层读出三声四声时,是否复现人类在有语境与孤立条件下的完整模式。判断标准不是分类准确率本身,而是语境曲线的相对位置与孤立基线的居中性。

教学例子:假设第 7 步在声学上正好介于两端之间,人类在无语境时约一半判四声,在一声语境下更多判三声,在四声语境下更多判四声。如果模型的第 7 步在 3 种语境下表示完全重合,或分类比例完全相同,则记为无补偿;如果随语境声学相似性同向漂移,则是未补偿的声学跟随;只有反向移动才算补偿。本文正是按此逻辑组织刺激与分析。

从一段双音节到模型判断,完整链条如何走?

沿一个样本走完全程有助于定位每个操作。输入是一段双音节序列,前字为一声二声或四声,后字为待判目标;另设无语境条件,只呈现目标音节。研究者先用蒙特利尔强制对齐器确定音节边界,筛选基频完整且非嘎裂的目标,再用 Parselmouth 按张等人的方法操纵时长与基频,生成从典型四声到典型三声的 14 步连续体,端点由说话人相关的基频分位数确定。每个原始双音节据此扩展出多条连续体,最终约 13700 条连续体、约 192000 个刺激。

每个刺激被送入两个 wav2vec2.0 检查点:一个仅在 1000 小时无标注普通话上预训练,另一个再用 178 小时标注语音为普通话识别微调。两者都是 7 层卷积特征编码器加 12 层 Transformer。分析取第 0 层 512 维卷积输出与第 1 到 12 层 768 维 Transformer 输出,对目标音节时间范围内的向量做平均,得到该层的音节级表示。然后用两种方法检验补偿:嵌入相似度直接计算目标与同源两端参考的相对距离,探测分类器则另行训练线性二分类器并在连续体上测试。广义加性混合模型对步数与语境的平滑效应建模,控制说话人与语境的随机平滑项。

两个检查点与两种读出方法各自负责什么?

检查点负责提供待检验的表示。纯预训练检查点代表只见音频的上下文预测学习,微调检查点代表叠加了显式文字监督。两者结构相同,差异仅在训练目标与数据,这使层间比较可以归因于监督而非参数量。层编号需要固定:0 为卷积输出,1 到 12 为 Transformer 层,后文只展示 0、4、8、124 层,其余层趋势类似。

自监督预训练 × 微调: 自监督预训练只用无标注音频学习上下文预测表示,不被告知声调类别,微调则用 178 小时带标注普通话语音把表示拉向汉字与声调识别目标,二者搭配的理由是比较同一结构在有无显式音系监督时的语境整合能力,组合意义在于判断补偿是无监督涌现还是需要类别监督诱导。

读出方法负责把表示变成可与人类比较的判断。嵌入相似度对每个刺激计算它到同源第 1 步四声端与第 14 步三声端的余弦距离,按公式转化为 0 到 1 之间的相对四声相似度,建模时去掉两端只用第 2 到 13 步以避免与参考重合。探测分类器是线性全连接二分类逻辑回归,用交叉熵与 Adam 优化,学习率千分之一,在训练集说话人的自然三声四声音节嵌入上训练,在操纵连续体上测试,建模时包含全部步数。

嵌入相似度 × 探测分类器: 嵌入相似度直接比较目标向量与两端参考向量的余弦距离,不引入额外学习参数,探测分类器则在冻结嵌入上训练线性三声四声二分类器以检验类别可及性,前者看表示本身是否已补偿,后者看类别信息能否被线性读出,组合使用才能区分表示改变与读出方式改变。

组合的意义在于交叉验证:若相似度无分离而探测有分离,说明类别信息需经监督读出才能显现;若两者在孤立条件下都偏离人类 S 形,则说明模型的语境依赖不是人类式的基线偏置,而是更广泛的上下文条件化。

本研究训练了什么,冻结了什么?

本研究没有从头训练 wav2vec2.0,它调用的是已有普通话预训练与微调权重,原文未报告其预训练掩码比例、优化步数与微调解码器细节,因此不能从模型名称推定这些超参数。实际发生学习的只有线性探测分类器。训练数据来自 AISHELL-3 训练集的 40 位说话人,每位中 36 人用于训练、4 人用于验证,每位训练说话人取 100 个三声与 100 个四声音节,验证集结构类似。训练跑 5 个轮次,验证准确率在卷积层约 82%,在高层 Transformer 达 99%,错误偏向误判为三声,最极端的第 12 层误判三声数是误判四声的 4 到 6 倍。

需要明确冻结与监督来源:测试时 wav2vec2.0 参数冻结,探测分类器权重在最后轮次状态下冻结并用于连续体测试;探测训练的监督是音节级三声四声标签,嵌入来自完整话语而非孤立音节,这为后文孤立测试的偏差埋下伏笔。原文未说明探测训练是否平衡基频分布或说话人基频范围,也未报告梯度是否回传到编码器,按描述应理解为仅更新线性层。未报告项应记为缺项,不猜测。

刺激、划分与统计如何保证可比?

实验条件围绕可比性展开。声学材料固定声母韵母只变基频,避免音段差异干扰声调判断;语境限定为前字一声二声四声加无语境,与人类实验对应;说话人来自 AISHELL-3 测试集 40 人,与探测训练的训练集说话人不重叠,减少说话人记忆。目标筛选要求至少 10 个基频采样点且高于说话人基频 10% 分位数,以排除嘎裂三声。统计用 mgcv 包的广义加性混合模型,beta 分布处理有界相似度,Bernoulli 分布处理二分类探测输出,步数的平滑函数按语境分别估计,并加入说话人与语境的随机平滑。

下图是人类基线,必须先读懂它才能评价模型是否拟人。横轴为连续体步数从四声端到三声端,纵轴为判为四声的比例,误差棒为被试间变异。理想的人类模式是 4 条 S 形曲线按语境有序平移且无语境居中。

看图路径: 1. 先确认横轴为从四声端到三声端的连续体步数,纵轴为判为四声的比例;2. 再比较高偏移语境与低偏移语境曲线相对无语境基线的左右移动方向;3. 注意误差棒宽度以判断中间模糊步数的语境效应是否稳定

原论文 Figure 2:Proportion of T4 responses from human listeners in Experiment 3 of \\[21\\].

论文图 2。原论文 Figure 2:“Proportion of T4 responses from human listeners in Experiment 3 of [21].”。

从像素可见,最右侧虚线在前半段维持接近 1.0 的四声回答,到后半段才陡降,对应低偏移四声语境;最左侧点线整体偏低,对应高偏移语境;中间实线为无语境,另一条为一声语境。关键是无语境线大致位于中间,语境效应在中间模糊步数最大,两端因声学明确而收敛。这是后文要求模型复现的相对位置关系,而非绝对准确率。

下表把刺激规模与模型配置放在一起,便于复现时核对数据量、层数与维度是否一致。比较问题是不同语境的刺激是否来自同源操作与同一编码流程,公平条件是同源参考、按层平均、统一统计模型,指标方向是相对相似度与分类比例随步数单调下降。

条件刺激规模预训练数据微调数据编码结构
T1/T2/T4/无语境,14 步 T4-T3 连续体约 13700 条连续体,约 192000 个刺激1000 小时无标注普通话178 小时标注普通话7 层卷积加 12 层 Transformer,0 层 512 维,1-12 层 768 维

表后需要解释代价与边界。规模优势带来的是确定性模型输出的稳定性:同一刺激重复输入结果相同,变异来自多说话人多源音节的重合成,而非人类被试抽样。代价是重合成引入的基频操纵痕迹与强制对齐误差可能成为模型可利用的捷径,而人类实验用少量精心录制刺激控制更严。未评测边界包括非语音语境、不同声母韵母组合以及自然连续语调,这些在原文讨论中列为未来工作,未在本表量化。

嵌入相似度是否随语境反向移动?

主结果先看不经学习的嵌入相似度。纯预训练模型在所有层几乎无语境分离,第 0 层 4 条曲线完全重合,随层加深仅出现有语境与无语境的整体微小差异,但高低语境之间不按补偿方向分开。微调模型在高层出现一定分离:模糊步数在一声语境下更接近三声端,显示上下文改变了表示,但分离幅度远小于人类,且二声与四声聚在一起、一声单独偏离,与人类高语境一致偏三声、低语境偏四声的格局不同,也不是以无语境为中心的双向偏置。

下图按行列展示了这一结论,行是预训练与微调,列是层 0、4、8、12,横轴为第 2 到 13 步,纵轴为相对四声相似度,线宽为 95% 置信带。阅读时先看行内分离,再看列间演变。

看图路径: 1. 先按行比较纯预训练行与微调行在同一层的四条语境曲线是否分开;2. 再按列从第 0 层看到第 12 层,观察语境分离是出现还是始终重合;3. 注意纵轴是相对相似度而非分类比例,黑色无语境线是否为中间基线

原论文 Figure 3:T4 embedding similarities (1) as function of T4-T3 continuum step; line thickness indicates 95%…

论文图 3。原论文 Figure 3:“T4 embedding similarities (1) as function of T4-T3 continuum step; line thickness indicates 95% confidence bands.”。

从像素可见,上行预训练各列中蓝色黄色绿色黑色四线基本重叠,仅在高层右侧略有散开;下行微调从第 4 层起黑色无语境线在右侧明显高于彩色语境线,蓝色一声线在左侧与中段偏低,黄色与绿色居中。这种分离支持微调引入了语境敏感性,但不支持人类式补偿,因为黑色线不是中间基线而是上包络,且语境排序不符合高低偏移预期。

下表聚焦探测训练的配置与验证表现,说明为何后文探测能读出类别却仍不拟人。比较问题是层间类别可及性是否提升,公平条件是同一训练集与线性结构,指标方向是验证准确率越高表示类别越线性可分。

训练来源每说话人样本说话人划分训练轮次验证准确率
完整话语嵌入的自然 T3/T4每人 100 个 T3 与 100 个 T436 人训练,4 人验证5 轮,Adam 学习率千分之一卷积层约 82%,高层达 99%,偏向误判 T3

表后解释主要收益与反例。收益是层间单调提升的可分性,支持高层更易线性读出声调;反例是第 12 层 4 到 6 倍的误判不对称,提示高层可能依赖先验频率而非纯声学,T4 在普通话中更频繁的解释在讨论中提出但未直接验证。未胜出项是纯预训练低层探测,其 S 形弱且语境分离小,说明仅靠底层声学不足以支撑稳定归类。

加上线性监督后,补偿出现了吗?

把分析换成探测分类器可视为一种有监督消融:表示冻结,只允许线性读出学习类别。结果是两种模型的探测都显示一定语境效应,且随层加深对端点更敏感。微调第 8 层在形态上最接近人类,语境曲线按步数单调下降且彼此分开。但关键反证是无语境条件未能形成预期的 S 形:在微调嵌入上,无语境线整体偏向四声回答,无论基频轮廓偏向哪端;纯预训练的无语境线虽居中一些,但整体区分度与语境排序仍与人类不同。也就是说,探测能利用语境,却不能在无语境时给出人类式的基线判断。

下图展示探测的四声回答比例,横轴为第 1 到 14 步全范围,纵轴为判四声比例,布局与上一图对应。需要区分分布曲线与单样本标记:这里每条线是混合模型对多刺激的平滑估计,线宽为置信带,不是单个录音的轨迹。

看图路径: 1. 先看每行从第 0 层到第 12 层曲线的 S 形是否变陡,判断类别可分性随层变化;2. 再看微调行黑色无语境线是否整体偏高,与其他三条语境线拉开距离;3. 对照预训练行,观察语境线分离模式是否一致以及第 12 层的变化

原论文 Figure 4:Proportion of T4 responses of probes as function of T4-T3 continuum step; line thickness…

论文图 4。原论文 Figure 4:“Proportion of T4 responses of probes as function of T4-T3 continuum step; line thickness indicates 95% confidence bands.”。

从像素可见,上行预训练第 4 层与第 8 层蓝色一声线明显偏低,绿色四声线偏高,黑色无语境线居中但中段平坦;下行微调第 4、8、12 层黑色线在右侧仍维持 0.5 以上,而彩色线已降到 0.2 以下,尤其第 12 层黑色线几乎平直高企。这表明微调的上下文编码对孤立音节有害:训练时见过完整话语的探测在测试孤立嵌入时失效,语境信息缺失反而被判为更像四声。原文推测与四声频率最高、典型句末三声带尾升而刺激中无尾升有关,但明确表示尚无解释,应记为待验证而非定论。

哪些结论不能从当前证据推出?

首先,缺失证据不是技术错误。原文未提供非语音类比语境、因果干预交换或任务级识别评估,也未测量延迟与计算成本,因此不能断言补偿缺失源于表示容量不足,也不能承诺微调改善了实用识别。其次,相关性不是因果:探测准确率高只说明类别线性可及,不证明模型编码了语境补偿机制,线性模型可能拟合训练数据中的细微相关。原文引用相关文献提醒了这一点。

其次,声调的高变异性限制了推广。基频同时受基线漂移、音域缩放、截断、语调与音段扰动影响,前字声调只是众多解释之一,模型可能把中段基频变化归因于其他因素。辅音部位特征变异较小,前人阳性结果不能直接预期在声调上复现。总体趋势不等于每层每步成立:微调高层的弱分离不能推广到低层,探测中段的分离不能推广到两端。

最后,数据与划分的边界需保留。刺激来自 AISHELL-3 的朗读语料与重合成,声母韵母固定,说话人有限;人类基线来自另一实验室的少量刺激多数被试设计。两者在刺激自然度与抽样逻辑上不对等,比较的是模式形状而非绝对数值。

要复现这条链条,先做什么?

复现应按学习依赖倒排检查。先准备 AISHELL-3 并用蒙特利尔强制对齐器切分音节,筛选前字为一声二声四声、目标为三声四声的双音节,过滤基频缺失与嘎裂样本,用 Parselmouth 实现时长与基频的 14 步操纵,端点按说话人 10% 与 90% 分位数确定,生成无语境与 3 种语境版本。核对是否达到约万级连续体与十万级刺激量级,而非追求 exact 数字一致。

再调用两个普通话 wav2vec2.0 权重,用 Transformers 库提取第 0 层与第 1 到 12 层嵌入,对目标音节区间平均。嵌入相似度需用同源两端做参考并排除端点,探测需在训练集说话人自然音节上训练线性逻辑回归 5 轮,验证准确率应从卷积层约八成升到高层近满分,否则检查平均区间或标签平衡。统计用广义加性混合模型分别拟合相似度与二分类输出,加入说话人与语境随机平滑。资源状态方面,本文证据未绑定完成 HTTPS 验证的开源资源,不得声称代码模型数据已公开;复现时以实际可下载的检查点与 AISHELL-3 许可为准,本次未能确认可达的链接应记为未能确认。

先复现人类基线的 S 形与居中性,再看预训练无分离、微调弱分离、探测孤立偏置三点是否同时出现,任一点缺失都应检查对齐、平均区间与端点定义,而非直接得出相反结论。

何时值得尝试监督,结论如何收束?

综合判断是报告级别:纯自监督表示未显示以无语境为基线的补偿,微调表示与线性探测显示弱的、非人类排序的语境敏感,且孤立测试严重偏离人类。这支持至少对声调这类高变异超音段,仅靠无监督上下文预测不足以形成人类式补偿,需要鼓励稳定音系类别的额外学习机制。有限解释是语境化不等于补偿:Transformer 确实融合了上下文,但融合方式是广泛条件化而非在不变基线上施加偏置。

何时值得尝试:若目标是在识别或理解中利用前字声调,应优先在标注数据上微调或训练显式分类读出,并保留无语境基线做对照;若目标是检验无监督涌现,应同时报告相似度与探测、同时展示有语境与孤立条件,避免只报模糊步数的分离。还需补的验证包括因果交换干预、非语音语境对照与任务级评估,以排除声学捷径。

常见误解需要澄清:探测准确率高不等于模型懂补偿,微调有分离不等于拟人,孤立偏四声不等于模型坏了,它恰恰揭示训练语境与测试语境失配时的行为。对刚入门的研究生而言,可带走的方法是固定声学只变基频、固定结构只变监督、固定刺激比较两种读出,再以人类相对位置为尺子判断补偿是否存在。

⚖️ 评分明细

评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。

  • 评分规则:type-aware-v1
  • 评分模型:muse-spark-1.3-contributor
  • 评分请求协议:openai_responses

← 返回 interspeech-2026 论文汇总