论文解读

把大语言模型接到 Whisper 上,为什么朗读提升了、管制通话却没有?

该研究用不改 Whisper 结构的二次重排与浅融合接入 Mistral 7B,在 Common Voice 朗读上把词错误率从 15,28% 降到 14,18% 与 14,68%,而在 ATCO2 管制通话上最好只与 18,78% 基线统计等价,代价是权重过大时性能明显退化。

 · 更新于 2026-09-24 · 约 18 分钟 · 8711 字 阅读 →
每日研究速递

jep-2026 论文深度解读

共收录 118 篇 jep-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 238 分钟 · 118878 字 阅读 →
每日研究速递

speechprosody-2026 论文深度解读

共收录 188 篇 speechprosody-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 360 分钟 · 180081 字 阅读 →
论文解读

只有 1.5 小时录音时先冻住耳朵再改手写:Amchi Konkani 的迁移加词典修正

针对无正式书写系统的 Amchi Konkani 口语转写问题,论文用冻结编码器的 Marathi IndicConformer 只微调 CTC 解码层并叠加约 5000 词众包词典与约 80 条正则后处理,把词错误率从 35.1% 降到 21.3%,代价是仅在小规模故事集上验证且依赖人工维护的词典与规则。

 · 更新于 2026-09-24 · 约 20 分钟 · 9729 字 阅读 →
论文解读

合成儿童语音该放在哪一步:只做自监督预训练才增益的儿童语音识别

针对自发儿童语音标注稀缺问题,论文用 BEST-RQ 比较成人与儿童真声混合与 VEVO 合成儿童语音在自监督预训练和 CTC 微调中的位置,最强证据是合成语音只加入预训练时 MyST 测试词错率降到 16.07%,而直接加入识别训练几乎无增益且成人测试集代价明显。

 · 更新于 2026-09-24 · 约 16 分钟 · 7789 字 阅读 →
论文解读

大模型造数据、小模型干活:库尔德语低资源语音识别的节俭路线

针对中库尔德语数据少且算力弱的问题,该研究先微调 Seamless 大模型生成伪标签再训练 31M 小模型,用 Asosoft 上 7.67 对比 8.18、Fleurs 上 22.46 对比 20.31 的词错误率说明小模型接近大模型,但 Fleurs 上仍有约 2 点差距且推理只在给定软硬件下测得 18 倍加速。

 · 更新于 2026-09-24 · 约 20 分钟 · 9546 字 阅读 →
论文解读

只有 32 小时班巴拉语数据时,把解码器对折而不砍掉

针对班巴拉语 32 小时监督数据的离线解码任务,BaldWhisper 先把 Whisper-base 解码器 6 层按相邻对加权融合为 3 层并做知识蒸馏,再把共享输入输出嵌入矩阵做秩 96 低秩分解加特征蒸馏,最终在保持基线约九成性能的同时把体积缩小约一半并把解码速度提高到两倍以上,代价是词错误率从基线水平上升数个百分点。

 · 更新于 2026-09-24 · 约 19 分钟 · 9131 字 阅读 →
论文解读

资源不均时先学共性再学个性:奥克语六方言的跨方言微调

针对奥克语数据稀少且集中在加斯科涅和朗格多克方言的问题,论文比较直接微调、跨方言微调和两阶段微调,最强证据是两阶段在大资源方言上继续降低词错误率,而代价是小资源方言只能做迁移评估且测试集极小。

 · 更新于 2026-09-24 · 约 18 分钟 · 8746 字 阅读 →
论文解读

少资源语言先补数据质量:LELD 用混合转写把捷克语等三语 ASR 做上去

针对捷克语、爱沙尼亚语和希腊语自动语音识别性能落后问题,论文用统一预处理加三阶段混合转写构建每语 1500 小时转写语料,以独立 5 小时测试集上标准化词错误率降至 3.38%-5.54% 为证据,代价是高度依赖母语者校验与语言归一化且未公开可下载资源。

 · 更新于 2026-09-24 · 约 17 分钟 · 8083 字 阅读 →
论文解读

动词前后宾语为何声音不同:伊捷尔曼语中信息状态与韵律突显的对应

论文用单篇民间故事田野录音比较动词前宾语与动词后宾语,发现后者在平均强度、平均基频和基频滑音幅度上显著更低而动词不受语序影响,该模式支持非突显成分易后置的解释,代价是时长无显著差异且信息状态效应只在合并语序时显著。

 · 更新于 2026-09-24 · 约 22 分钟 · 10522 字 阅读 →
论文解读

听不见反馈的声音怎么做识别:把马拉地语聋人语音映射到日常任务词表

针对标准马拉地语识别在聋人语音上接近失效的问题,论文用冻结编码器的迁移学习加日常任务词表约束,把词错误率从 97% 降到 64%,代价是仍高达 64% 且依赖单人小词汇后处理。

 · 更新于 2026-09-24 · 约 22 分钟 · 10762 字 阅读 →
论文解读

标签不够时让模型自己补课:伪标签与同属平滑的蝙蝠叫声识别

针对蝙蝠被动声学监测中标注稀缺问题,论文固定紧凑 BAT 骨干比较半监督路线与目标构造,报告伪标签在欧洲十分之一标签下闭合至多 61.5% 全监督差距并迁移到南非野外录音,同属加均匀平滑再提升物种宏 F1 达 4.73 个百分点。

 · 更新于 2026-09-24 · 约 17 分钟 · 8352 字 阅读 →
论文解读

只用三个元音能判断年龄吗:科西嘉塔拉瓦方言的尝试与落空

该研究以科西嘉塔拉瓦语自发语音中三个基元音的声学测量为输入,用随机森林加留一说话人验证做年龄组分类,最强的分元音证据是/i/的 55,6% 精度,而全局 43,3% 精度与显著的说话人差异说明仅靠元音尚不能实现可靠分类。

 · 更新于 2026-09-24 · 约 19 分钟 · 9233 字 阅读 →
论文解读

中性爱尔兰语合成句能否只改嗓音源就听出喜怒:全局与重音局部变换的叠加检验

该研究以一句爱尔兰语男声合成中性句为基线,只按真人情感录音改造嗓音源参数并叠加语速与共振峰,用全局、重音局部与组合三类刺激做听辨,发现组合识别率最高而高激活情感区分更清晰,低激活情感则互相混淆。

 · 更新于 2026-09-24 · 约 19 分钟 · 9405 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-14

共分析 27 篇语音/AI 论文

 · 更新于 2026-09-24 · 约 57 分钟 · 28192 字 阅读 →
论文解读

不追求更像人脸,而是生成对判别更有用的视觉特征:跨模态引导的抑郁识别训练框架

针对临床访谈数据少导致视觉编码器学不好,该工作用音频文本为条件合成视觉特征并与识别器联合优化,在 DAIC-WOZ 上 F1 达到 0.86、在 E-DAIC 上 CCC 达到 0.69,代价是依赖词级对齐与端到端联合训练的复杂度。

 · 更新于 2026-09-24 · 约 21 分钟 · 10499 字 阅读 →
每日研究速递

cvpr-2026 论文深度解读

共收录 103 篇 cvpr-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 212 分钟 · 106059 字 阅读 →
论文解读

病理语音不够、又不一样:三类数据增强到底谁能补上增强性能

针对帕金森病理语音增强数据少且声学 atypical 的问题,论文在 PC-GITA 上系统比较变换型、生成型与噪声增强对预测式 CR 与生成式 SB 模型的影响,最强证据是噪声增强带来最稳健的大幅提升,而生成式合成在比例增大时反而损害性能,且病理与常态语音间的差距依然存在。

 · 更新于 2026-09-24 · 约 19 分钟 · 9355 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

稀疏观测下只保留跨人一致的多尺度结构:掩蔽小波散射神经场做 HRTF 上采样

针对稀疏测量的声场重建问题,该工作用小波散射变换提取多尺度统计特征并以二值掩蔽只保留跨被试一致的系数,再与稀疏观测的数据保真项联合优化神经场,在 HUTUBS 仿真 HRTF 上以 7×7 观测重建全空间幅度时 MSNF 的 LSD 降到 5.34 并在 NCC 达到 87.79%,代价是每个 HRTF 需单独训练一个网络且只验证了幅度。

 · 更新于 2026-09-24 · 约 18 分钟 · 8774 字 阅读 →