论文解读

朗读课文不该读出抑郁:用证据边界把筛查关进可审计的笼子

语音情感识别 | 7.0/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11117 字 阅读 →
论文解读

听见是谁在说:用反事实声纹逼语音模型从猜文本回到听声音

说话人日志 | 7.0/10

 · 更新于 2026-09-25 · 约 29 分钟 · 14406 字 阅读 →
论文解读

文字比原声更懂情绪:把生成音乐放进效价-唤醒坐标系来称重

音乐生成 | 6.0/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11830 字 阅读 →
论文解读

当模型听得懂阿拉伯语,却看不懂阿拉伯文化:ImageEval 2026 的三重拷问

语音识别 | 8.1/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10990 字 阅读 →
论文解读

当语音 Token 不再像自然语言:13 个编解码器在噪声下的语言统计学分化

语音编码 | 6.3/10

 · 更新于 2026-09-25 · 约 31 分钟 · 15156 字 阅读 →
论文解读

给大模型加声学缰绳:用 0.6 nats 的似然约束把翻译式幻觉拉回转录

语音识别 | 7.8/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11082 字 阅读 →
论文解读

别再比谁更像人:当生成音乐的评价回到音乐人的工作台

音乐生成 | 7.3/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9673 字 阅读 →
论文解读

提示词动了,词错误率为什么不动:一次生产级口述史转录的预注册阴性消融

语音识别 | 7.4/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11646 字 阅读 →
论文解读

听得更干净,却想得更错:当语音增强把大模型带偏

语音增强 | 8.0/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10322 字 阅读 →
论文解读

当模型听得见声音,却听不懂语气:VocalAffectBench 为何要把情感从文字里剥离

语音情感识别 | 7.4/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12243 字 阅读 →
论文解读

听见了,就要指得出来:用可验证的时间证据检验音乐大模型的耳朵

音乐理解 | 6.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9860 字 阅读 →
论文解读

文字答得滴水不漏,声音却露了怯:财报电话会里的双重规避

语音情感识别 | 6.2/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9247 字 阅读 →
论文解读

波形有用,不等于必须调用生成式音频模型

音频分类 | 6.0/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8679 字 阅读 →
论文解读

翻译丢掉的不只是词:当语调跨越语言还能剩下多少?

语音翻译 | 6.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8041 字 阅读 →
论文解读

看得懂谱,听得出演奏,才算懂音乐:MuSP-Bench 为何要把乐谱与演奏放在一起考

音乐理解 | 6.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7239 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-31

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 66 分钟 · 32614 字 阅读 →
论文解读

当一句非洲对话里藏着两种语言,语音识别该听哪一种?

语音识别 | 8.1/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8671 字 阅读 →
论文解读

长音频不是更长的短音频:AudioSpan 如何逼模型证明它真的听见了

音频理解 | 8.7/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8805 字 阅读 →
论文解读

口音的长尾,为什么让无监督语音表示最先露怯?

语音编码 | 5.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8018 字 阅读 →
论文解读

Omni 不等于会选:当模型被要求用对的模态回答

音视频理解 | 7.8/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8261 字 阅读 →