把大语言模型接到 Whisper 上,为什么朗读提升了、管制通话却没有?
该研究用不改 Whisper 结构的二次重排与浅融合接入 Mistral 7B,在 Common Voice 朗读上把词错误率从 15,28% 降到 14,18% 与 14,68%,而在 ATCO2 管制通话上最好只与 18,78% 基线统计等价,代价是权重过大时性能明显退化。
该研究用不改 Whisper 结构的二次重排与浅融合接入 Mistral 7B,在 Common Voice 朗读上把词错误率从 15,28% 降到 14,18% 与 14,68%,而在 ATCO2 管制通话上最好只与 18,78% 基线统计等价,代价是权重过大时性能明显退化。
共收录 118 篇 jep-2026 会议论文的 Reader 深度解读
共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读
针对无正式书写系统的 Amchi Konkani 口语转写问题,论文用冻结编码器的 Marathi IndicConformer 只微调 CTC 解码层并叠加约 5000 词众包词典与约 80 条正则后处理,把词错误率从 35.1% 降到 21.3%,代价是仅在小规模故事集上验证且依赖人工维护的词典与规则。
针对自发儿童语音标注稀缺问题,论文用 BEST-RQ 比较成人与儿童真声混合与 VEVO 合成儿童语音在自监督预训练和 CTC 微调中的位置,最强证据是合成语音只加入预训练时 MyST 测试词错率降到 16.07%,而直接加入识别训练几乎无增益且成人测试集代价明显。
针对中库尔德语数据少且算力弱的问题,该研究先微调 Seamless 大模型生成伪标签再训练 31M 小模型,用 Asosoft 上 7.67 对比 8.18、Fleurs 上 22.46 对比 20.31 的词错误率说明小模型接近大模型,但 Fleurs 上仍有约 2 点差距且推理只在给定软硬件下测得 18 倍加速。
针对班巴拉语 32 小时监督数据的离线解码任务,BaldWhisper 先把 Whisper-base 解码器 6 层按相邻对加权融合为 3 层并做知识蒸馏,再把共享输入输出嵌入矩阵做秩 96 低秩分解加特征蒸馏,最终在保持基线约九成性能的同时把体积缩小约一半并把解码速度提高到两倍以上,代价是词错误率从基线水平上升数个百分点。
针对奥克语数据稀少且集中在加斯科涅和朗格多克方言的问题,论文比较直接微调、跨方言微调和两阶段微调,最强证据是两阶段在大资源方言上继续降低词错误率,而代价是小资源方言只能做迁移评估且测试集极小。
针对捷克语、爱沙尼亚语和希腊语自动语音识别性能落后问题,论文用统一预处理加三阶段混合转写构建每语 1500 小时转写语料,以独立 5 小时测试集上标准化词错误率降至 3.38%-5.54% 为证据,代价是高度依赖母语者校验与语言归一化且未公开可下载资源。
论文用单篇民间故事田野录音比较动词前宾语与动词后宾语,发现后者在平均强度、平均基频和基频滑音幅度上显著更低而动词不受语序影响,该模式支持非突显成分易后置的解释,代价是时长无显著差异且信息状态效应只在合并语序时显著。
针对标准马拉地语识别在聋人语音上接近失效的问题,论文用冻结编码器的迁移学习加日常任务词表约束,把词错误率从 97% 降到 64%,代价是仍高达 64% 且依赖单人小词汇后处理。
针对蝙蝠被动声学监测中标注稀缺问题,论文固定紧凑 BAT 骨干比较半监督路线与目标构造,报告伪标签在欧洲十分之一标签下闭合至多 61.5% 全监督差距并迁移到南非野外录音,同属加均匀平滑再提升物种宏 F1 达 4.73 个百分点。
该研究以科西嘉塔拉瓦语自发语音中三个基元音的声学测量为输入,用随机森林加留一说话人验证做年龄组分类,最强的分元音证据是/i/的 55,6% 精度,而全局 43,3% 精度与显著的说话人差异说明仅靠元音尚不能实现可靠分类。
该研究以一句爱尔兰语男声合成中性句为基线,只按真人情感录音改造嗓音源参数并叠加语速与共振峰,用全局、重音局部与组合三类刺激做听辨,发现组合识别率最高而高激活情感区分更清晰,低激活情感则互相混淆。
共分析 27 篇语音/AI 论文
针对临床访谈数据少导致视觉编码器学不好,该工作用音频文本为条件合成视觉特征并与识别器联合优化,在 DAIC-WOZ 上 F1 达到 0.86、在 E-DAIC 上 CCC 达到 0.69,代价是依赖词级对齐与端到端联合训练的复杂度。
共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读
针对帕金森病理语音增强数据少且声学 atypical 的问题,论文在 PC-GITA 上系统比较变换型、生成型与噪声增强对预测式 CR 与生成式 SB 模型的影响,最强证据是噪声增强带来最稳健的大幅提升,而生成式合成在比例增大时反而损害性能,且病理与常态语音间的差距依然存在。
共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读
针对稀疏测量的声场重建问题,该工作用小波散射变换提取多尺度统计特征并以二值掩蔽只保留跨被试一致的系数,再与稀疏观测的数据保真项联合优化神经场,在 HUTUBS 仿真 HRTF 上以 7×7 观测重建全空间幅度时 MSNF 的 LSD 降到 5.34 并在 NCC 达到 87.79%,代价是每个 HRTF 需单独训练一个网络且只验证了幅度。