不只认清单个字:用完整亲子对话检验多方言儿童语音识别
针对中文儿童语音数据少、方言覆盖窄、缺少完整对话的问题,论文构建 112.5 小时 498 名 2-8 岁儿童与 500 名看护人的 ChildTalk 语料,并在同库与跨库上证明微调能稳定降低字错率,而加入上文提示可进一步减少替换与删除错误,但低资源方言与低龄段仍很困难。
针对中文儿童语音数据少、方言覆盖窄、缺少完整对话的问题,论文构建 112.5 小时 498 名 2-8 岁儿童与 500 名看护人的 ChildTalk 语料,并在同库与跨库上证明微调能稳定降低字错率,而加入上文提示可进一步减少替换与删除错误,但低资源方言与低龄段仍很困难。
论文诊断单池逐层裁剪在语音大模型中的跨组件预算崩溃,提出双池 α-split 在保持联合灵敏度与全局 DP 保证不变下恢复可用词错误率,并以编码器 4.47 倍等效噪声换取语言模型仅 2.6% 开销。
该文把语音幻觉检测转为推理时读取注意力图的二分类问题,用四个音频注意力指标加轻量逻辑回归在同域语音识别上超过不确定性基线,最强提升约 0.23 PR-AUC,但跨任务需重训且模型依赖明显,少头反而更利于域外泛化。
DIFFA-2 针对自回归音频大模型数据贵、串行解码慢的问题,选择冻结 Whisper-Large-V3 加语义与声学双适配器加 LLaDA-8B 扩散主干与四阶段课程,在 MMSU 总体 60.45 分等公开基准上追平同级自回归模型,代价是第一阶段词错误率略高于自回归对照且三元混合音频仍偏弱。
该文用 k-稀疏自编码器把三种语音自监督特征压成不同稀疏度,再在 SUPERB 六任务上测出最优 k 各不相同,并用信息瓶颈解释为说话人与情感偏压缩、音素与识别偏保留,而输入层质量只能小幅移动该权衡。
论文用单词对齐的逐层干预揭示浅层保留声学细节而深层可大幅压缩的层级冗余,并提出训练无关的相似度合并与双阶段压缩,在三类语义任务上减少约 27.48% 预填充计算量,但中间过渡层敏感且细粒度声学影响尚未充分验证。
针对人听希望去噪干净而识别前端怕语音失真的问题,论文用源条件与额外标记两类提示扩展统一分离模型并按提示切换标准损失与正则损失,英日噪声实验显示识别分支降低了词错误率与字错误率而高质量分支保持了重建质量,代价是识别分支牺牲客观质量且仍未超过推理期混合基线。
该研究用同一套语音大模型先做短语音指令跟随再扩展到长语音,比较三种切分策略,最强证据是固定 30 秒切分取得 2.0663 的 HIFS 分数,代价是长摘要与章节任务仍不稳定且幻觉以重复插入为主。
针对构音障碍等病理语音与常态语音声学失配问题,该研究在冻结 Voxtral-Mini 全部权重下用 x-vector 驱动的逐层 FiLM 做说话人条件化,在 TORGO 和 NeuroVoz 上以约 1.6% 可训练参数获得接近微调的识别与问答保持能力,但原始识别输出更依赖后处理纠错。
针对北部库尔德语 Badini 变体缺平行语音文本问题,论文用 2000 句英译巴迪尼加 45 人录音验证得到 5224 条 15 小时 40 分钟语料,最强基线 W2V-BERT CTC 在测试集词错误率为 55.07%,而语音到文本翻译 BLEU 仅 5.24,代价是小数据微调仍难克服方言与书写差异。
论文在 Archi 与 Kina Rutul 两种东高加索濒危语言上整理约 45 分钟与 75 分钟训练语音并统一为 IPA 转写,对比 CTC 专用模型与 Whisper 及音频大语言模型,发现音素 F1 随对数训练频次呈 S 形增长,而面向语音的专用结构加语言相关词表与平均初始化在可运行条件下取得更低错误率,但稀有复合音素仍近乎无法识别。
该工作用流式语音识别加文本预处理加机器翻译加两阶段大模型压缩的级联管线做英译中自动字幕,在开发集上以压缩换合规并略微改善 SubER,而代价是保留时间戳不动且依赖确定性改写与人工规则阈值。
该文把群体差异拆成嵌入偏置与嵌入方差,用单群体训练的线性音素探针检验偏置、用同音素近邻距离检验方差,发现方差与识别错误稳定相关而同域训练收益有限,且领域增强对抗微调未改变两项几何指标。
共收录 38 篇 iwslt-2026 会议论文的 Reader 深度解读
针对多对多联合识别与翻译中共享模型的负迁移与目标语言漂移,论文在分层 Transducer 上加入源条件与目标条件两组 MoE 适配器,在 Europarl-ST 九语言 72 方向上以单个 77M 模型实现平均 20.5 BLEU、0.651 COMET 与 15.71% WER,代价是仍需已知源与目标语言标识且仅验证离线场景。
针对多文种语音识别中同一语言输出文字不确定的问题,论文用解码器激活均值差提取文字向量并在推理时相加,在塞尔维亚语和中文混淆缓解与跨语言罗马化、西里尔化上验证效果,但西里尔化弱语言与编码器干预仍有限。
针对噪声导致语言结构坍塌与语义模糊,论文提出 Speech-MLM 用频谱视觉结构、复述文本语义与门控跨模态融合做重建,在多噪声集上报告词错误率与语义相似度同步提升,但多分支带来推理开销与复述质量依赖。
针对无文字低资源语言难以从原始音频发现音素单元的问题,该工作在 HuBERT 基础上用 55 语言的发音特征与音素监督做多语言续训,再以 ABX 可辨别性检验上下文不变性,最强有监督自适应在开发集与测试集取得 3.07% 与 3.39% 的平均误差,但自监督与有监督之间仍有差距且评估集中于 ABX。
MCGA 用 119 小时真人朗读与六项语音任务检验多模态大模型理解古典文学的能力,最强模型在情感描述上仍不足 60 分,但用该语料微调可带来大幅提升,代价是曲类样本偏少且暂缺图文声三对齐图像。
针对印地语、孟加拉语、马拉地语语音转写中填充词与重复修复残留问题,论文用 MuRIL 词级标记引导指令微调并以对比损失惩罚复现不流利词,在人工校对与真实口语两类测试上取得一致提升,但真实集规模小且仅验证 3B 量级模型。