论文解读

少资源语言先补数据质量:LELD 用混合转写把捷克语等三语 ASR 做上去

针对捷克语、爱沙尼亚语和希腊语自动语音识别性能落后问题,论文用统一预处理加三阶段混合转写构建每语 1500 小时转写语料,以独立 5 小时测试集上标准化词错误率降至 3.38%-5.54% 为证据,代价是高度依赖母语者校验与语言归一化且未公开可下载资源。

 · 更新于 2026-09-24 · 约 17 分钟 · 8083 字 阅读 →
论文解读

不用切分音节也能认词:连续韵律线索如何逐帧改写词竞争

论文用词即连续声学轨迹加听者线索权重的最小前馈模型复现英语首音队列、普通话声调分叉和意大利语重音延迟分化三类时程,代价是小词表演示且权重手工设定而非拟合人眼数据。

 · 更新于 2026-09-24 · 约 22 分钟 · 10791 字 阅读 →
论文解读

听不见反馈的声音怎么做识别:把马拉地语聋人语音映射到日常任务词表

针对标准马拉地语识别在聋人语音上接近失效的问题,论文用冻结编码器的迁移学习加日常任务词表约束,把词错误率从 97% 降到 64%,代价是仍高达 64% 且依赖单人小词汇后处理。

 · 更新于 2026-09-24 · 约 22 分钟 · 10762 字 阅读 →
论文解读

一个通用扰动为何能在不同 ASR 上都让转写偏向同一目标

该文研究针对 Whisper 系列的通用、有迁移性的目标性声学攻击,提出 MuteOut 随机掩码优化,以较大的扰动预算换取跨模型的目标词成功率,同时用词错率和语义分数量化通用性与迁移性之间的折中。

 · 更新于 2026-09-24 · 约 20 分钟 · 9635 字 阅读 →
论文解读

自回归交叉注意力丢了时间因果:用质心右移把对齐拉回来

针对 Transformer 解码器非因果交叉注意力导致的长删除与重复幻觉,该文提出只在推理时逐 token 右移注意力质心并钳制跳变的方法,在 LibriSpeech 四集上相对基线平均降低 8.9% 词错误率,代价是引入 δ、β、ν 三个需在开发集上调参的启发式阈值且不改变模型参数。

 · 更新于 2026-09-24 · 约 18 分钟 · 8609 字 阅读 →
论文解读

解码器才是瓶颈:冻结语音编码器与印度大模型做印英混读识别

针对印地语英语代码切换中声音对但文字错的问题,论文冻结语音编码器与指示大模型只训练 27.8M 瓶颈适配器,以 21.56% 词错误率与 20.69% 转写词错误率超过解码器微调基线,代价是依赖大模型词表与干净盲测集。

 · 更新于 2026-09-24 · 约 15 分钟 · 7235 字 阅读 →
论文解读

注意力也会分心:用差分门控让 Conformer 在噪声中保持对比度

针对 Conformer 在噪声下注意力分散导致上下文建模退化的问题,论文提出混合式修正差分门控注意力 Conformer,在保持参数量基本一致时于 Librispeech 干净与加噪测试上取得相对词错误率下降,但小模型增益有限且早期全量替换会损害表征。

 · 更新于 2026-09-24 · 约 18 分钟 · 8592 字 阅读 →
每日研究速递

eusipco-2026 论文深度解读

共收录 127 篇 eusipco-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 247 分钟 · 123292 字 阅读 →
论文解读

用音素识别度量声道形状合成:当逐点距离看不出时间稳定性时怎么办

该文把声道发音合成的评价转为发音特征上的音素识别问题,用同一识别器比较真实轮廓与三种合成轮廓的音素错误率,最强证据是加浊音编码后无模型合成达到 20.59 的错误率,代价是单说话人法语实时磁共振数据与缺声源信息的固有限制。

 · 更新于 2026-09-24 · 约 20 分钟 · 9554 字 阅读 →
论文解读

先读出发音再写出文字:音素前置如何约束语音大模型的声学对齐

针对语音编码器偏发音而大语言模型偏语义的对齐错位,该文提出先预测音素再生成文本的联合训练,在 100 小时低资源和 960 小时及荷兰语条件下报告词错率下降,代价是输出变长与仍需低秩适配。

 · 更新于 2026-09-24 · 约 16 分钟 · 7618 字 阅读 →
论文解读

剪掉反而更准:解码器自注意力与深层编码器的冗余在哪里

论文以 Whisper-small 为对象,用梯度与 Fisher 灵敏度定位可剪部位并做无微调一次幅度剪枝,最强证据是解码器自注意力 50% 稀疏度在 LibriSpeech test-other 上绝对词错误率下降 2.38%,代价是解码器前馈与早期解码器层在同等稀疏度下灾难性退化且全局均匀剪枝在 40% 附近崩溃。

 · 更新于 2026-09-24 · 约 17 分钟 · 8301 字 阅读 →
每日研究速递

aaai-2026 论文深度解读

共收录 147 篇 aaai-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 307 分钟 · 153423 字 阅读 →
每日研究速递

acl-2026 论文深度解读

共收录 199 篇 acl-2026 会议论文的 Reader 深度解读

 · 更新于 2026-09-24 · 约 433 分钟 · 216709 字 阅读 →
论文解读

两端多学中间少动:按深度分配低秩容量的低资源多语种适配

针对统一低秩适配破坏解码器中间层共享语义的问题,该研究按 U 形结构分配秩并用奇异值尾部方向冻结中间层,在 18 个低资源语言上以约五分之一参数达到与标准低秩相当的平均词错误率,并在极低数据下更稳定,代价是平均掩盖了分语言差异且未验证推理延迟。

 · 更新于 2026-09-24 · 约 19 分钟 · 9472 字 阅读 →
论文解读

把 Transformer 换成 Mamba 做语音自监督:长语音更快,但双向扩展仍有代价

该文把 HuBERT 的 Transformer 层替换为 Mamba 做语音自监督预训练,在因果与长上下文语音识别上验证线性复杂度与更低计算量优势,并以音素纯度、典型相关分析和 SUPERB 探测说明表征特点,代价是 Base 尺寸双向 Mamba 整体探测分数落后于 Transformer。

 · 更新于 2026-09-24 · 约 20 分钟 · 9889 字 阅读 →
论文解读

标签之外:用方言度与录音条件重新刻画阿拉伯方言语音

针对方言阿拉伯语数据分散与标注不一致问题,Arab Voices 用统一转写与元数据对齐 31 个数据集并以方言度与音频质量代理做可比刻画,在 14 个方言零样本评测中显示现代模型仍困难而多模态大模型相对更稳,代价是音频质量代理与人感并不完全一致且部分低资源方言仍缺乏数据。

 · 更新于 2026-09-24 · 约 18 分钟 · 8790 字 阅读 →
论文解读

希腊语歌声转写:规模放大适配效果,小模型靠翻译正则,大模型靠两阶段专注

该研究把希腊音频数据集扩展为片段对齐的歌词转写基准,在同一协议下对比 Whisper 三种规模与转写翻译配比及先语音后歌声的两阶段适配,报告 Large-v3 两阶段词错误率 27.2%,代价是翻译辅助只在小容量模型上为正且增强与复调训练均未获益。

 · 更新于 2026-09-24 · 约 17 分钟 · 8062 字 阅读 →
论文解读

总词错率相同,切换处却不同:英语-约鲁巴语码切换转写的边界失效

该研究在 2000 句共享英语-约鲁巴语码切换集上对比 6 个专用语音识别系统与 5 个音频语言模型,报告 Parakeet 与 Kimi-Audio 总词错率几乎相同但后者在切换边界显著更好,代价是约鲁巴语词错误普遍超过 97% 且生成式模型存在提示依赖的过度生成。

 · 更新于 2026-09-24 · 约 18 分钟 · 8763 字 阅读 →
论文解读

整块循环打乱先听后写的流水线:BiCycle 用分组递归保留语音识别机制

针对整块循环把语言表示回灌到底层造成语音到语言反复的问题,BiCycle 用累积注意力对角性划分语音组与语言组并只在组内递归,在英语与法语数据上以约一半物理参数报告更低词错率,代价是仍需预训练教师与先蒸馏 30 轮再识别训练 100 轮的两阶段成本。

 · 更新于 2026-09-24 · 约 21 分钟 · 10296 字 阅读 →
论文解读

先转写再执行:用翻译大模型统一语音识别、翻译与问答的指令跟随系统

该工作用翻译导向大模型加语音编码器处理英文语音并执行英中意德指令,以先转写后作答的思维链复用纯文本监督,在 IWSLT 2025 评测上翻译与问答达到可比最优,代价是语音编码器只训练约 0.8 轮且依赖后编辑修正格式。

 · 更新于 2026-09-24 · 约 20 分钟 · 9567 字 阅读 →