论文解读

歌声里藏着母语的口型:当音素的物理约束在旋律中留下指纹

音乐理解 | 8.0/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12286 字 阅读 →
论文解读

当模型听得见声音,却听不懂语气:VocalAffectBench 为何要把情感从文字里剥离

语音情感识别 | 7.4/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12243 字 阅读 →
论文解读

只给顺序不给时间:用会遗忘的节奏记忆补上塔布拉转录的弱监督缺口

音乐转录 | 6.3/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11985 字 阅读 →
论文解读

听见了,就要指得出来:用可验证的时间证据检验音乐大模型的耳朵

音乐理解 | 6.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9860 字 阅读 →
论文解读

主观分数能当奖励吗?当感知预测器遇上可懂度硬约束

语音合成 | 7.6/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11677 字 阅读 →
论文解读

模型听见的是期待的语调:当讽刺检测依赖高音与停顿的刻板印象

语音情感识别 | 7.4/10

 · 更新于 2026-09-25 · 约 27 分钟 · 13353 字 阅读 →
论文解读

当声音在笑、文字在哭:大音频语言模型为何听不见讽刺

语音情感识别 | 8.1/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12067 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-01

共分析 49 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 151 分钟 · 75584 字 阅读 →
论文解读

当混响不再模仿房间:用声码器思路把噪声织成尾响

音频生成 | 7.2/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9147 字 阅读 →
论文解读

方差不该越过底线:用单峰约束重画 MOS 的容许区间

语音质量评估 | 7.4/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7106 字 阅读 →
论文解读

文字答得滴水不漏,声音却露了怯:财报电话会里的双重规避

语音情感识别 | 6.2/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9247 字 阅读 →
论文解读

把截断搬进频域:用 sinc 重采样让振荡器同步不再混叠

音乐生成 | 7.9/10

 · 更新于 2026-09-25 · 约 7 分钟 · 3105 字 阅读 →
论文解读

波形有用,不等于必须调用生成式音频模型

音频分类 | 6.0/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8679 字 阅读 →
论文解读

对齐做得更紧,模型却更早替你做决定:音视频矛盾下的晚期先验固化

音视频理解 | 6.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8045 字 阅读 →
论文解读

在茶树里听见白蚁:当 81.5% 的准确率比 98% 更诚实

音频分类 | 5.1/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11553 字 阅读 →
论文解读

把空间感调得更夸张,音乐会更清晰吗?

音乐理解 | 6.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8378 字 阅读 →
论文解读

当目标永远无法被完美复刻,我们该如何评判模仿的好坏?

音频生成 | 6.4/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5751 字 阅读 →
论文解读

效果是效果,声音是声音:当表征必须同时记住与忘记内容

音频检索 | 8.0/10

 · 更新于 2026-09-25 · 约 18 分钟 · 9008 字 阅读 →
论文解读

翻译丢掉的不只是词:当语调跨越语言还能剩下多少?

语音翻译 | 6.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8041 字 阅读 →
论文解读

当和声不再只谈音高:用搬运代价度量音色的几何

音乐理解 | 5.5/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7830 字 阅读 →