论文解读

把大语言模型接到 Whisper 上,为什么朗读提升了、管制通话却没有?

该研究用不改 Whisper 结构的二次重排与浅融合接入 Mistral 7B,在 Common Voice 朗读上把词错误率从 15,28% 降到 14,18% 与 14,68%,而在 ATCO2 管制通话上最好只与 18,78% 基线统计等价,代价是权重过大时性能明显退化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8711 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

在识别与切分之间加状态:用有序子音素与最优传输恢复帧级证据

针对发音评估既要认准音素又要定准边界的问题,该工作把每个音素展开为有序子音素状态并用最优时间传输做稠密单调训练,在朗读、自发与二语语音上改善切分并保持可比识别,主代价是更细帧率与更长拓扑会推高识别错误并需要权衡诊断增益。

 · 更新于 2026-09-24 · 约 23 分钟 · 11333 字 阅读 →
论文解读

用无标注空管语音改造 Whisper 编码器:BEARD 为何要把自监督放在中间层并用蒸馏拴住解码器

针对空管领域标注少而无标注语音多的问题,论文用 BEST-RQ 自监督加双层蒸馏先重训 Whisper-small 编码器再用 2 小时 24 分标注微调,在 ATCO2 上把词错误率从 19.54% 降到 17.17%,代价是需跑 5381 小时无标注数据约 7 小时 8 卡训练并依赖中间层与蒸馏权重的选择。

 · 更新于 2026-09-24 · 约 18 分钟 · 8619 字 阅读 →
论文解读

只有 1.5 小时录音时先冻住耳朵再改手写:Amchi Konkani 的迁移加词典修正

针对无正式书写系统的 Amchi Konkani 口语转写问题,论文用冻结编码器的 Marathi IndicConformer 只微调 CTC 解码层并叠加约 5000 词众包词典与约 80 条正则后处理,把词错误率从 35.1% 降到 21.3%,代价是仅在小规模故事集上验证且依赖人工维护的词典与规则。

 · 更新于 2026-09-24 · 约 20 分钟 · 9729 字 阅读 →
论文解读

合成儿童语音该放在哪一步:只做自监督预训练才增益的儿童语音识别

针对自发儿童语音标注稀缺问题,论文用 BEST-RQ 比较成人与儿童真声混合与 VEVO 合成儿童语音在自监督预训练和 CTC 微调中的位置,最强证据是合成语音只加入预训练时 MyST 测试词错率降到 16.07%,而直接加入识别训练几乎无增益且成人测试集代价明显。

 · 更新于 2026-09-24 · 约 16 分钟 · 7789 字 阅读 →
论文解读

大模型造数据、小模型干活:库尔德语低资源语音识别的节俭路线

针对中库尔德语数据少且算力弱的问题,该研究先微调 Seamless 大模型生成伪标签再训练 31M 小模型,用 Asosoft 上 7.67 对比 8.18、Fleurs 上 22.46 对比 20.31 的词错误率说明小模型接近大模型,但 Fleurs 上仍有约 2 点差距且推理只在给定软硬件下测得 18 倍加速。

 · 更新于 2026-09-24 · 约 20 分钟 · 9546 字 阅读 →
论文解读

浊音去哪了:普通话听者用送气与否重新划分法语塞音

该研究让 20 名未学过法语的普通话母语者用拼音自由转写法语 18 个 CV 塞音并做拟合度评分,显示法语浊塞音被稳定同化为普通话不送气塞音,而法语清塞音是否被听成送气取决于嗓音起始时间长短,代价是中间嗓音起始时间段出现大变异且元音与发音部位会系统改变判断。

 · 更新于 2026-09-24 · 约 22 分钟 · 10788 字 阅读 →
论文解读

只有 32 小时班巴拉语数据时,把解码器对折而不砍掉

针对班巴拉语 32 小时监督数据的离线解码任务,BaldWhisper 先把 Whisper-base 解码器 6 层按相邻对加权融合为 3 层并做知识蒸馏,再把共享输入输出嵌入矩阵做秩 96 低秩分解加特征蒸馏,最终在保持基线约九成性能的同时把体积缩小约一半并把解码速度提高到两倍以上,代价是词错误率从基线水平上升数个百分点。

 · 更新于 2026-09-24 · 约 19 分钟 · 9131 字 阅读 →
论文解读

音素串能否替代专家打分:17 个法语预训练模型的域内精度与病理跨域对照

该文把 17 个 Wav2vec 2.0、HuBERT 和 Whisper 模型统一微调为法语 35 音素识别器,先在 Common Voice 健康语音上建立基线,再冻结模型到 111 例 C2SI 病理语音上测跨域衰减与临床相关,最强证据是 Wav2vec 2.0 以 6,2% 错误率领先且错误率与人工评分高达 0,88 和 0,91 相关,但最低错误率 …

 · 更新于 2026-09-24 · 约 16 分钟 · 7862 字 阅读 →
论文解读

把临床对话变成可复核的时间线:自动语音分析如何从噪声中算出韵律

该演示针对精神科访谈中非正式韵律观察不可复现的问题,给出从录音到说话人分段、转写、音节定位再到时间韵律指标与人工核对的端到端流程,并以一段含 2 人 3 轮的示例说明可视化核对方法,代价是仍需人工复核且未报告定量精度与临床阈值。

 · 更新于 2026-09-24 · 约 18 分钟 · 8940 字 阅读 →
论文解读

可读难了,机器还能听准吗:可听性中结构复杂度与识别错误的解耦

该研究以 CLEAR 文本经合成语音再由 Whisper Tiny 识别为链路,用全局可读性指数与词错误率检验文本复杂度是否影响识别,最强证据是转写前后指数相关 0.97 而指数与错误率相关仅 0.03 且回归无法预测,代价是人类判断仍保留约负 0.28 的相关而未做真人听测验证。

 · 更新于 2026-09-24 · 约 18 分钟 · 8739 字 阅读 →
论文解读

广播里混着音乐和重播,编码器该吃什么:法语语音自监督的数据选择对照

该研究从法国电视广播档案出发固定编码器与训练步数,只改变一千小时预训练子集的成分,再用语音识别与语音音乐检测等下游对照检验成分效应,结果显示去音乐有助于识别而多样内容有助于兼顾语音与音乐,重复则同时带来识别下降与记忆上升。

 · 更新于 2026-09-24 · 约 21 分钟 · 10452 字 阅读 →
论文解读

自发性病理语音转写为何随严重程度分化:以 CER 为轴的多层次误差解读

该研究以 27 例唇口咽癌后自发对话语音检验 Whisper large 转写,发现字符错误率与感知严重度呈强负相关并以 50% 为界分出两组,重度组多层错误率平均高约 42.82%,其中词法与句法层代价最大而纯词性类别差异最小。

 · 更新于 2026-09-24 · 约 22 分钟 · 10522 字 阅读 →
论文解读

不重建声音本身:在潜空间里预测被遮住的法语语音

针对法语语音自监督编码问题,论文用 data2vec 2.0 式师生预测潜表示并引入 10 万小时 INA 电视广播音频,语音多任务上达到或超过 LeBenchmark 基线,但 114k 小时在大模型上在 CommonVoice 验证集未继续降低词错误率。

 · 更新于 2026-09-24 · 约 18 分钟 · 8768 字 阅读 →
论文解读

没有统一赢家:四类法语语音识别在自发与病理语音上的错法不同

该研究把转写词错率当作后续音素对齐的前置条件,在未见过的健康与病理法语数据上比较四类系统,最强证据是训练数据与评测风格越接近误差越低,而代价是没有任何模型在犹豫词和不同病理间保持稳定。

 · 更新于 2026-09-24 · 约 20 分钟 · 9757 字 阅读 →
论文解读

资源不均时先学共性再学个性:奥克语六方言的跨方言微调

针对奥克语数据稀少且集中在加斯科涅和朗格多克方言的问题,论文比较直接微调、跨方言微调和两阶段微调,最强证据是两阶段在大资源方言上继续降低词错误率,而代价是小资源方言只能做迁移评估且测试集极小。

 · 更新于 2026-09-24 · 约 18 分钟 · 8746 字 阅读 →
论文解读

小块流式缺未来信息时,用过去帧蒸馏出的语义向量增强当前帧

针对流式语音识别只能用过去和很小当前块导致词错误率上升的问题,SENS-ASR 用过去帧经上下文模块蒸馏句子嵌入教师得到的语义向量拼接增强每帧表示,在 160 毫秒小块上报告了词错误率下降,但大块和全上下文增益消失且需额外训练教师与上下文模块。

 · 更新于 2026-09-24 · 约 15 分钟 · 7077 字 阅读 →
论文解读

流式约束下自注意力退化为局部算子:去掉它为何词错误率几乎不变

该文在严格分块流式条件下检验 Conformer-Transducer 编码器中的自注意力,发现其退化为对角局部模式,进而用一维可变形卷积替换或直接删除自注意力,在 LibriSpeech 与 TEDLIUM-2 上保持词错误率基本不变并显著降低实时率与参数量。

 · 更新于 2026-09-24 · 约 18 分钟 · 8799 字 阅读 →