论文解读

念对了也白搭:尼泊尔金融语音里被格式卡住的钱包

语音识别 | 6.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8167 字 阅读 →
论文解读

在喇叭与犬吠同时响起时听清人声:VAANI 如何把印度田野噪声钉在时间轴上

语音识别 | 5.8/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9553 字 阅读 →
论文解读

边听边分清谁在说:把长历史留下来做说话人归属

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4402 字 阅读 →
论文解读

不做硬切分:用连续说话人占比给 Whisper 注入重叠感知

语音识别 | 6.2/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11582 字 阅读 →
论文解读

当解码器缺的不是声音,而是下一词的语义证据

语音识别 | 8.4/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11111 字 阅读 →
论文解读

用最轻的耳蜗换最高的精度:HLP 脉冲编码为何在干净数据上赢、在嘈杂数据上输

语音识别 | 6.8/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12869 字 阅读 →
论文解读

在并行与记忆之间找缝隙:WhisperX 如何既跑得快又记得住

语音识别 | 7.4/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10440 字 阅读 →
论文解读

听见是谁在说:用反事实声纹逼语音模型从猜文本回到听声音

说话人日志 | 7.0/10

 · 更新于 2026-09-25 · 约 29 分钟 · 14406 字 阅读 →
论文解读

当模型听得懂阿拉伯语,却看不懂阿拉伯文化:ImageEval 2026 的三重拷问

语音识别 | 8.1/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10990 字 阅读 →
论文解读

给大模型加声学缰绳:用 0.6 nats 的似然约束把翻译式幻觉拉回转录

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11082 字 阅读 →
论文解读

口音不是噪声,是距离:当母语离英语越远,ASR 的潜空间就越把你推开

语音识别 | 6.9/10

 · 更新于 2026-09-25 · 约 22 分钟 · 11019 字 阅读 →
论文解读

提示词动了,词错误率为什么不动:一次生产级口述史转录的预注册阴性消融

语音识别 | 7.4/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11646 字 阅读 →
论文解读

把循环拆成并行:用时带混合与自适应回退让增强前端不再拖累识别

语音增强 | 6.2/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9926 字 阅读 →
论文解读

听得更干净,却想得更错:当语音增强把大模型带偏

语音增强 | 8.0/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10322 字 阅读 →
论文解读

1500 个音频 token 真的都需要吗?用等间隔抽样戳破 Whisper 的时域冗余

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10278 字 阅读 →
论文解读

没有金标准时,怎么判断对齐切得准不准

语音识别 | 9.1/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8803 字 阅读 →
论文解读

先别让模型开口:当语音大模型需要学会拒绝

语音识别 | 8.3/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7960 字 阅读 →
论文解读

听错一句,机器就敢动手:语音误差如何撬开具身智能的安全锁

语音交互 | 5.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8038 字 阅读 →
论文解读

当一句非洲对话里藏着两种语言,语音识别该听哪一种?

语音识别 | 8.1/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8671 字 阅读 →
论文解读

在干净与噪声之间不敢用力的对比解码:用注意力给干预装上刹车

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8147 字 阅读 →