英文题目:Scaling Human and G2P Supervision for Robust Phonetic Transcription
会议身份:
conference:interspeech:2026:conference-paper-id:metzger26_interspeech
来源为官方会议 PDF;图片依据原页像素,表格数字依据原文引用。PDF 文字层不视为原始 TeX,未可靠恢复的结构不作推断。
标签:#课程学习 #语音学与音系 #语音 #语音识别
评分:6.2/10 | 创新 1.2/2 | 技术严谨 1.2/1.5 | 实验充分 1.0/1.5 | 清晰度 0.7/1 | 影响力 1.0/1.5 | 开源 0.0/1.5 | 可复现 0.3/0.5 | 工程/实践 0.8/1.5
排名:前50% | 文档类型:方法研究
👥 作者与机构
- Alexander Metzger:机构信息未能从会议 PDF 纯文本可靠映射
- Aruna Srivastava:机构信息未能从会议 PDF 纯文本可靠映射
- Ruslan Mukhamedvaleev:机构信息未能从会议 PDF 纯文本可靠映射
📌 核心摘要
该任务输入为母语、非母语及卒中后失语症英语语音,输出为国际音标(International Phonetic Alphabet,IPA)音素序列,难点是口音变异大、病理语音不成词且专家标注稀缺昂贵。方法采用四阶段课程:第一步自监督预训练在数万小时无标注多语语音上学习跨语言声学表示,其检查点直接作为第二步的初始化。第二步以多语言ASR微调引入说话人与方言多样性而不引入规范发音偏置,其输出的声学模型再进入G2P扩量阶段。第三步先用G2P由正字法转写生成近似音素标签扩量,再由第四步以40.81小时人工音素标注微调校准,使模型对齐真实误读与非典型实现。与依赖G2P大规模生成规范发音标签的路线不同,该路线避免向标准发音坍缩,保留对误读与非典型实现的敏感性。在TIMIT、EpaDB、PSST、Speech Ocean已知说话人未见测试集与ISLE未见德意口音测试集上,最优课程相对已有最强基线将平均加权音素特征错误率(Weighted Phone Feature Error Rate,WPFER)从8.1%降至3.5%,约2.3倍降低,失语症PSST从25.8%降至5.3%。人工量低于20至30小时时5.3K小时G2P仍有最多约4个百分点增益,超过后无显著增益甚至损害域外泛化。结论仅在英语17种方言与失语症范围内验证,原文未披露训练推理成本与延迟。
🔗 开源与复现资源
- 代码相关资源:https://github.com/KoelLabs/ML.that — 链接不可用(HTTP 404)
- 模型相关资源:https://huggingface.co/KoelLabs — 暂时无法访问
- 数据相关资源:https://github.com/KoelLabs/ML.that — 链接不可用(HTTP 404)
- 复现相关资源:https://github.com/KoelLabs/ML.that — 链接不可用(HTTP 404) 可达状态仅表示本次链接检查结果,不代表许可证、本文权重或运行复现已验证。
🧭 深度解读
输入是什么,目标是什么,为什么要读这篇?
本文输入是英语语音波形,目标是输出国际音标表示的实际发音序列。读者需要先区分 2 个任务。正字法语音识别回答说了哪些词,音素转写回答实际发出了哪些音。对于标准朗读,两者差异不大;对于非母语口音、儿童、老年人或脑卒中后失语症语音,词面相同但实现可以偏离规范,出现替换、迟疑、重复与不成词片段。临床评估、发音训练与语音增强都需要后者,因此不能用文字转写代替发音记录。
本解读的输入是论文正文证据与两张官方原图像素,目标是让研究生能复述数据构造、4 段课程、评价指标与扩展规律。必须保留的信息包括数据规模与划分、课程组成、指标方向、阈值结论与最优课程的量化结果。输出是 1 篇按学习依赖展开的技术解读,不做超出证据的推广。
语音识别转写 × 音素转写: 语音识别转写负责把整段语音还原为正字法文字,分工是提供可读的内容与词序列;音素转写负责还原实际发出的音段序列,分工是记录口音、误读与病理变异。两者搭配的原因是文字相同但发音可以不同,组合意义在于用前者做大规模预训练扩大说话人覆盖,再用后者的人工标注纠正发音细节。
学习时建议沿一个样本走完全程。一段失语症语音输入后,先提取声学表示,再经预训练与微调模型映射为音素序列,最后与专家标注序列比较加权特征误差。这个链条中,表示决定起点质量,监督来源决定是否忠实于声音,评价指标决定相似音是否给部分分数。后续章节按此依赖展开。
术语与符号如何统一,避免初学误读?
初学常混淆的 3 组术语在此统一。正字法文字指词面拼写,音素符号指实际音段,规范音指按词典预期的发音。机器标签接近规范音,专家标注接近实际音,两者在标准语音中重合,在口音与病理语音中分离。转写粒度上,窄式记录细节,宽式记录类别,同一小时数下前者对方差更敏感。指标上,加权误差考虑发音相似度,朴素错误率只看符号是否相同,前者更适合跨词表比较。
符号方面,小时数均指语音时长而非文本条数,百分比均指加权误差而非相对降低,特别说明 2.3 倍降低是相对 prior 系统的总体约减,不是单子集的承诺。百分点差值与相对百分比不同,阅读时保留原文单位与精度,不自行四舍五入。后续引用数字时,均按此口径理解。
已有路线如何解决标注稀缺,各自留下什么缺口?
第一条路线是专家标注。优点是直接记录真实发音,被视为金标准;代价是需要训练有素的标注者并处理一致性,非母语与非典型语音更难标注,因此多数公开系统只用到 5 小时以内的人类数据。第二条路线是字素到音素转换。做法是把大语音识别语料的文字转写用规则或模型转为音素,规模可达数千至上 10000 小时。
缺口是它反映规范发音,不建模口音、误读与病理实现,可能把模型推向标准音。第三条路线是自监督预训练与多语语音识别预训练。前者在约 10000 小时无标注语音上学习表示,后者在文字监督上扩大说话人覆盖;已有工作把它们与机器标注音素数据拼接,但未系统分离数量与质量的贡献。
字素到音素转换 × 人类专家标注: 字素到音素转换的分工是从文字按规范发音规则推导音素,优点是可扩展到数千小时;人类专家标注的分工是听声记录真实发音,优点是保留非典型实现。搭配理由是前者提供数量、后者提供质量,组合意义在于检验数量能否补偿噪声,本文的对照正是固定音频而替换两种标签比例。
本文不提出新结构,而是做受控扩展研究。固定音频、替换标签来源,同时变化预训练、语音识别、机器标注与人类标注 4 种监督,观察跨方言与非典型语音的泛化。这一定位决定了后文实验的读法。凡是比较人类与机器标签,必须核对音频是否相同;凡是比较预训练,必须核对微调数据是否相同,否则无法归因。
与同输入同目标的工作如何公平对照?
公平对照要求同输入、同目标、同监督与同运行阶段。规则基线运行在真实文字上,不是语音输入,不能与语音模型直接比错误率高低,只能用来判断机器标签的偏差方向。纯机器标注系统输入为语音、目标为音素,但监督为数千小时机器标签;少量人类数据的系统监督为几小时人类加机器混合。两者与本文全量人类课程相比,音频规模、说话人多样性与标注质量均不同,因此优势不能只归因于模型结构。
类别差异不当作胜负。宽式库与窄式库的绝对误差不可直接比大小,因为粒度不同导致基线不同;失语症子集的高误差不代表模型失败,而是任务本身包含不成词与迟疑。前人未报告超过 5 小时人类训练的系统,本文用 40 小时课程取得更低误差,这是在更大高质量监督下的结果,不是同条件下的结构胜利。引用时应同时列出训练机器小时数与人类小时数,并注明非音素预训练不计入该列。
要回答的核心问题与适用边界是什么?
核心问题有两个。在英语音素转写中,需要多少小时的多样化人类标注,才会使大规模机器标注的边际收益消失。超过该阈值后,哪种预训练仍能改善域外泛化而不引入规范发音偏置。论文的假设是多样化人类标注对跨方言与非典型语音稳健性更关键,数量驱动的机器标注扩展会较早出现收益递减。
适用边界在证据中写明。语言限定为英语,方言覆盖 9 种母语变体、8 种母语背景的第二语言语音与一种脑卒中后失语症,未覆盖其他语种的音位库存差异。测试强调泛化而非同分布拟合。留出意大利语与德语口音语料做未见方言测试,用多个已知方言的未见说话人测试集做说话人泛化。理解这一点才能正确解释阈值数字,它是该基准与该课程下的观测,不是跨语言常数。
一个可复述的最小实验是什么?
最小可复述实验包含 3 组对照。第一组固定音频为零人类标签,对比无机器预训练与有机器预训练,检验低资源下规模是否有帮助。第二组固定音频为约 20 小时人类标签,同样对比有无机器预训练,观察增益是否收窄。第 3 组固定人类全量,对比基线预训练、语音识别预训练、语音识别加机器预训练,检验域外方言上谁显著更低。每组都用同一超参数扫描协议与同一加权指标,并用自助法报告置信区间。
操作顺序不可颠倒。先确定测试划分与指标,再跑低人类档位,最后跑全量人类档位,否则容易把调参差异误读为阈值。若资源有限,可只跑总体与失语症两个子集,因为前者反映平均趋势,后者对标签质量最敏感。教学例子仅为理解流程,不附加无源数值;凡数值均以正文证据为准。
四段课程全景:从波形到音素经过哪些监督?
方法全景可分为 4 段。第一段是大规模自监督预训练,直接在原始波形上学习表示,候选包括对比学习的跨语种模型、掩码预测隐单元的模型与带去噪目标的模型,目的是获得低资源与跨语种迁移能力。第二段是多语监督语音识别微调,用高质量文字监督让模型见过更多说话人与方言,但不强加音素规范序列。第三段是机器生成音素标签微调,用字素到音素模型把文字近似为音素,规模大但不反映真实误读。第 4 段是人类专家标签微调,用 curated 的数十小时数据直接拟合真实发音。
自监督预训练 × 多语语音识别微调: 自监督预训练的分工是在无标注多语语音上学习通用声学表示,解决冷启动表示问题;多语语音识别微调的分工是用高质量文字监督引入说话人与方言多样性。搭配原因是前者不引入发音规范偏置,后者不强加标准音序列,组合后为后续音素微调提供更稳健的起点。
一个样本的完整路径是这样。波形进入自监督主干得到帧级表示,经过语音识别微调后表示更适应多说话人,再经音素输出层映射为音素序列。训练目标在第三段是拟合机器推导的规范序列,在第 4 段是拟合专家听到的真实序列。评价时把预测序列与专家序列按发音特征加权比较,相似音部分给分。先记住这条主路径,再看各组件的取舍。
表示与监督组件各自负责什么,如何组合?
表示组件比较 3 种自监督起点。论文报告在音素转写上,基于原始波形的跨语种对比学习起点错误率最低,因此被选为后续实验的基础。这一步只解决表示起点,不解决监督偏置问题。监督组件分为两类。语音识别监督来自文字,优势是规模与说话人多样性较大且不直接规定音素实现。
机器音素监督来自文字派生的音素,优势是规模极大但携带规范发音假设。人类监督规模最小但与目标一致。
组合逻辑是课程式叠加。先用自监督获得通用声学能力,再用语音识别扩大说话人覆盖,最后用人类数据纠正发音细节。机器标注数据可插在语音识别之后、人类之前,作为数据稀缺时的补充。论文的消融正是检验这种插入在不同人类数据量下是帮助还是干扰。实现细节上,超参数对每个实验做全扫描,训练与验证按非测试数据的八二划分,扫描范围基于前人工作设定,具体见后文训练节。梯度路径与参数冻结的逐层安排原文未逐项报告,本解读不从模型名称推定,只按证据讲监督来源与数据替换方式。
训练与数据替换如何操作,计算预算是多少?
训练操作的关键是控制变量。为了分离标签质量,作者固定音频而替换标签比例。人类微调数据按零、约 1/4、二分之一、四分之三与全量五档设置,同一段音频在不同档位下分别挂人类标签或机器标签。另 1 维是是否加入约 5300 小时的机器标注预训练,以反映机器路线的可扩展优势。每个实验都做超参数扫描,学习率、预热步数、批量大小、轮数、权重衰减与时间掩码、特征掩码均在给定区间内搜索,验证集取自非测试数据。
计算预算在证据中明确为单卡可复现量级。全部扫描可在四十显存的加速卡上约 730 小时完成,这对研究生规划复现有直接参考价值。数据清洗不是简单符号映射。不同语料使用不同音素集与转写粒度,需要映射并增补到正确的国际音标;同时做非语音过滤、说话人分离、缺失段重标与时间戳校正。清洗后原始音频大幅缩减,去除的主要是静音与非目标说话人,作者强调不是丢弃有效标注语音,以避免改变说话人分布。
下表整理清洗前后的语音量对比问题。比较问题是原始采集与可训练语音之间差多少,公平条件是同一批 8 个语料的同一处理流程,指标方向是小时数越大表示可用监督越多,但需注意去除的是非目标内容。
| 阶段 | 原始音频 | 清洗后总量 | 训练集 | 测试集 |
|---|---|---|---|---|
| 全部 8 个语料汇总 | 80.06 hours | 54.75 hours | 40.81 hours | 13.94 hours |
表后解释如下。原始约 80 小时经清洗得到约五十余小时可用语音,其中训练约 40 小时、测试约 14 小时,剩余为验证划分与清洗去除部分。主要收益是获得可比的音素符号体系与可靠的时间对齐;具体代价是名义小时数缩水,但作者说明缩水部分主要是静音与干扰说话人。未胜出项是若不做说话人分离与时间校正,失语症与自发语音的对齐误差会直接进入监督,需要补做的验证是公开清洗补丁的可重放性,本次资源状态显示代码链接当前不可用,复现时需按论文描述重写流程。
数据划分、指标与统计如何保证测的是泛化?
数据覆盖 8 个语料、逾 1000 名说话人,包含母语方言、8 种母语背景的第二语言语音与脑卒中后失语症。处理后训练约 40 小时、测试约 14 小时。划分策略是泛化导向。意大利语与德语口音语料整体留作未见方言测试;其余多个语料的测试集取未见说话人,用于已知方言的说话人泛化。自发语音与朗读语音分别保留,以检验自然变异。
窄式转写 × 宽式转写: 窄式转写分工是记录细粒度的发音细节,适用于发音反馈与临床判断;宽式转写分工是记录较粗的音位类别,适用于一般内容理解。搭配原因是基准同时包含两类粒度,组合意义在于揭示人类数据增益速度不同,窄式库用较少增量即显著下降,宽式库需要更多数据才显著。
评价指标选用加权音素特征错误率,越低越好。它用发音特征向量衡量替换差异,相似音部分给分,再按参考序列长度归一化。作者指出朴素音素错误率把所有替换等同看待,易受词表重叠影响而不公平。统计方法为自助法重采样 2000 次给出 95% 置信区间并检验显著性,图表中误差线即此含义。
加权音素特征错误率 × 音素错误率: 音素错误率的分工是统计音素符号是否完全相同,把所有替换等同看待;加权音素特征错误率的分工是按发音特征差异加权替换,相似音给部分分数。搭配原因是测试集音素词表不一致,组合意义在于更公平地反映语音学理解,而不是词表重叠带来的偶然优势。
基线选择覆盖近年代表性系统与规则基线。规则基线直接在真实文字转写上运行字素到音素工具,虽非语音模型可比,但能揭示机器标签在宽式与病理数据上的偏差方向。语音基线包括纯机器标注训练与少量人类数据训练的系统,训练机器小时数与人类小时数分别列出,非音素预训练小时数不计入该列。阅读时需核对同一测试集、同一指标与同一聚合对象,数值相同不代表指标相同,百分点与相对百分比不可混用。
主结果:在未见口音与病理语音上谁显著更低?
主结果的测试问题是跨方言与非典型语音的泛化,比较对象是不同课程组合,条件一致性靠固定预训练主干与微调协议,指标方向是加权音素特征错误率越低越好。最优课程为跨语种自监督起点加语音识别微调再加约 40 小时人类微调,不含大规模机器标注预训练。报告的平均误差约为 3.5%,约为前人系统的 2.3 倍降低,在非母语与失语症上增益更强。规则基线在宽式语料上尚可,但在失语症语料上显著偏高,这解释了纯机器标注模型在该子集上系统性落后的原因。
以下导读针对未见德语与意大利语口音的课程消融图。该图横轴为 3 种预训练,纵轴为误差百分比,左侧实心为人类微调,右侧斜纹为机器微调,比较问题是预训练与微调来源各自带来多少下降。
看图路径: 1. 先看横轴三组预训练条件与纵轴加权音素特征错误率百分比方向;2. 再对比左侧三根实心人类微调柱与右侧三根斜纹 G2P 微调柱的高低;3. 接着在每种微调下比较基线与语音识别预训练柱的下降幅度;4. 最后观察语音识别加 G2P 预训练是否比单语音识别预训练更低
论文图 1。原论文 Figure 1:“Out of Domain WPFER (↓) by Curriculum using unseen German and Italian speakers (ISLE [30]).”。
从像素可见,左侧三根实心柱整体低于右侧三根斜纹柱,说明微调来源是主要差异。同一微调下,语音识别预训练柱低于基线柱,且差异经自助检验显著;语音识别再加机器预训练并未进一步降低,甚至在人类微调下略有回升。作者的判断是语音识别带来说话人多样性而不强加规范序列,机器预训练则把规范偏置带入表示。限制是该图只显示一个未见方言测试集,不能推广到全部的分发;支持的判断是至少在该域外条件下,语音识别预训练单独即可达到或超过数千小时机器预训练的效果。
下表对比全量人类标签与全量机器标签的平均效果。表前问题是固定音频只换标签时误差差多少,公平条件是同一测试聚合与同一加权指标,方向是越低越好。
| 对比维度 | 评价对象 | 人类标签均值 | 机器标签均值 | 统计口径 |
|---|---|---|---|---|
| 总体平均 | 全部测试集 | 3.4% | 5.5% | 均值与 95% 置信区间 |
| 置信上限 | 总体均值区间 | 3.5% | 5.7% | 自助重采样 2000 次 |
表后解释如下。主要收益是全量人类标签比全量机器标签低约 2.1 个百分点,且置信区间不重叠,支持标签质量决定上限的判断。具体代价是人类数据需要数十小时的多样化标注,而非几小时即可。未胜出项是纯机器标签总体方案,它在平均意义上落后;未评测边界是其他语种与更极端低资源条件,原文结论部分已声明限定于英语与所选方言。
阈值从何而来:人类数据从零加到四十小时发生什么?
扩展实验固定音频,按零、十、二十、三十、40 小时五档增加人类标签比例,并分别在无机器预训练与有机器预训练两条线上观测。测的是每档的总体与分语料误差,比较条件是同一预训练起点与同一超参数扫描协议。总体趋势是人类数据越多误差越低,且多数相邻增量显著。分语料差异是教学重点。窄式转写的语料用 10 小时以内增量即可显著下降,宽式转写的语料至少需要 20 小时才显著,这与任务粒度有关。失语症子集的纵轴量级远高于其他子集,说明病理语音对方差与样本多样性更敏感。
以下导读针对六子图扩展规律图。每子图横轴为人类小时数,纵轴为误差百分比,实心为无机器预训练,斜纹为有机器预训练,比较问题是机器预训练的增益在何处消失。
看图路径: 1. 先确认六个子图标题与横轴人类数据小时数从 0 到 40 的递增;2. 再在每个子图内对比实心无 G2P 柱与斜纹有 G2P 柱的成对高低;3. 接着观察失语症子图纵轴量级与其他子图的显著差异;4. 最后比较窄式库与宽式库随人类数据增加而下降的陡峭程度
论文图 2。原论文 Figure 2:“WPFER (↓) Scaling with Human and G2P Data.”。
从像素可见,在 0 至 10 小时段,斜纹柱在总体与失语症子图上可见低于实心柱,最大可达数个百分点;随着人类数据增至 20 至 30 小时,两者差距收窄至误差线重叠;到 30 至 40 小时,有机器预训练不再显著更低,部分子图甚至略高。窄式子图的下降更陡峭,宽式子图更平缓。这支持阈值判断。
少于约 20 至 30 小时人类数据时,机器规模有补充价值;超过后无显著收益并可能轻微损害跨方言稳健性。总体趋势不等于每组每步都成立,个别档位会出现斜纹略高的波动,需结合置信区间阅读,不把单柱高低推广为全程规律。
失败条件也一并报告。机器数据不是无害的默认选项。当人类数据充足时加入它,域外方言误差没有统计显著改善,反而有退化迹象。作者将其归因于规范发音偏置。复现时应把是否加入机器预训练作为待消融开关,而不是固定流程。
哪些结论有边界,哪些缺项不是错误?
直接报告的部分是英语基准上的阈值与课程排序。有限解释的部分是偏置机制,即机器标签偏向标准音而降低对声学变异的敏感性,这与规则基线在病理数据上的偏差一致,但属于解释而非因果证明。未验证推测是其他语言是否出现相同小时数阈值,原文明确留待未来工作,不应把 20 至 30 小时当作跨语言常数。
缺失证据需要点名。论文未报告误判率分解到插入、删除、替换的详细分布,未测量延迟与推理开销,未给出逐说话人的公平性分解。这些缺项不是技术错误,只是意味着不能承诺延迟改善或误判公平性改善。训练资源只报告扫描总耗时与加速卡显存,未报告推理帧率与实际延迟,两者应分别讨论。相关性不等于因果。人类数据增加与误差下降同时出现,支持质量重要的判断,但严格因果还需排除标注多样性与语料组成的混杂,论文通过固定音频替换标签的设计部分缓解了该问题,但仍限于所选语料。
复现先做什么,需要哪些超参数与资源状态?
复现的第一步是重建可比的数据划分。按论文保留未见方言与未见说话人的测试集,不要混入训练;复刻音素集映射、非语音过滤、说话人分离与时间戳校正,并记录清洗补丁以保证可重放。第二步是固定课程顺序。先选跨语种对比学习起点,再做语音识别微调,最后做人类音素微调。
把大规模机器预训练作为可选分支,只在低人类数据档位启用。第三步是固定评价与统计。用发音特征加权误差而非朴素错误率,按参考长度归一化,自助 2000 次报告置信区间。
关键超参数与预算如下表。表前问题是复现需要预留多少搜索空间与算力,公平条件是同一非测试数据的八二验证划分,指标方向不涉及优劣,只交代范围。
| 配置维度 | 搜索下限 | 搜索上限 | 步长类型 | 预算说明 |
|---|---|---|---|---|
| 学习率 | 3 · 10−5 | 5 · 10−4 | 对数 | 共用 730 小时 |
| 预热步数 | 200 | 2000 | 线性 | 单卡四十显存 |
| 批量大小 | 16 | 64 | 线性 | 按验证集选择 |
| 训练轮数 | 3 | 20 | 线性 | 按验证集选择 |
| 时间掩码 | 0.05 | 0.15 | 线性 | 按验证集选择 |
表后解释如下。主要收益是每个实验都经过全扫描,避免把调参不足误读为监督来源差异;具体代价是总耗时较高,需提前申请算力。未胜出项是沿用单一默认超参数的快捷复现,它可能低估人类数据的增益。资源状态方面,本次收到的官方证据显示代码与数据集链接当前不可用,模型页本次未能确认可达,因此不能写已公开可下载。
复现应以论文正文与上述范围为依据重写流程,并补做可达性检查。致谢中提到的资助与标注支持不影响方法复述,但提醒符号映射需与原语料维护者核对。
何时值得尝试这条课程,还需补哪项验证?
当任务是英语的跨口音或病理语音的实际发音记录,且能筹集约 20 至 40 小时多样化专家标注时,值得采用自监督加语音识别再加人类微调的课程,并默认关闭大规模机器预训练。当人类数据少于约 20 小时,或只有宽式粗粒度需求时,可加入机器预训练作为补充,但需在未见方言集上验证是否真实下降。当目标是标准朗读的规范音序列而非真实实现时,本文结论不直接适用,不应套用阈值。
还需补的验证有三项。一是在本基准上报告插入、删除、替换分解与置信区间,以定位人类数据的增益来源;二是在另一语种或另一病理类型上重复五档扩展,检验阈值是否移动;三是公开可运行的清洗与训练脚本并固定随机种子,以支撑第三方重放。记住核心判断。数量不能自动补偿规范偏置,多样化人类标注在阈值之后更有效,而语音识别预训练是更稳健的规模来源。
⚖️ 评分明细
评分属于系统判断,不是论文实验结果;八维数值与总分见页首,原始审计记录保留在后端。
- 评分规则:type-aware-v1
- 评分模型:muse-spark-1.3-contributor
- 评分请求协议:openai_responses
![原论文 Figure 1:Out of Domain WPFER (↓) by Curriculum using unseen German and Italian speakers (ISLE \\[30\\]).](https://raw.githubusercontent.com/nanless/audio-paper-digest-images/main/interspeech-2026/3a387c4861f0/figure-1.png)
