论文解读

把响度与形状拆开:用归一化解耦让板混响参数在病态地形中收敛

音乐理解 | 6.3/10

 · 更新于 2026-09-24 · 约 22 分钟 · 10647 字 阅读 →
论文解读

不改脸只改声:把保护藏进人耳听不见的掩蔽阴影

语音合成 | 4.3/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11558 字 阅读 →
论文解读

文字比原声更懂情绪:把生成音乐放进效价-唤醒坐标系来称重

音乐生成 | 6.0/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11830 字 阅读 →
论文解读

别再比谁更像人:当生成音乐的评价回到音乐人的工作台

音乐生成 | 7.3/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9673 字 阅读 →
论文解读

议会里的声音政治学:当情感、犹豫与重音在四种斯拉夫语中分道扬镳

语音情感识别 | 5.6/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11892 字 阅读 →
论文解读

干净本身成了开关:当语音增强的理想输出反噬自身

语音增强 | 6.4/10

 · 更新于 2026-09-24 · 约 21 分钟 · 10275 字 阅读 →
论文解读

把循环拆成并行:用时带混合与自适应回退让增强前端不再拖累识别

语音增强 | 6.2/10

 · 更新于 2026-09-24 · 约 20 分钟 · 9926 字 阅读 →
论文解读

韵律能猜出多少句法?把停顿与时长放进互信息的秤上称重

Transformer | 7.6/10

 · 更新于 2026-09-24 · 约 24 分钟 · 11855 字 阅读 →
论文解读

歌声里藏着母语的口型:当音素的物理约束在旋律中留下指纹

音乐理解 | 8.0/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12286 字 阅读 →
论文解读

当模型听得见声音,却听不懂语气:VocalAffectBench 为何要把情感从文字里剥离

语音情感识别 | 7.4/10

 · 更新于 2026-09-24 · 约 25 分钟 · 12243 字 阅读 →
论文解读

模型听见的是期待的语调:当讽刺检测依赖高音与停顿的刻板印象

语音情感识别 | 7.4/10

 · 更新于 2026-09-24 · 约 27 分钟 · 13353 字 阅读 →
论文解读

方差不该越过底线:用单峰约束重画 MOS 的容许区间

语音质量评估 | 7.4/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7106 字 阅读 →
论文解读

波形有用,不等于必须调用生成式音频模型

音频分类 | 6.0/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8679 字 阅读 →
论文解读

不用再把 PDM 翻译成 PCM:让状态空间模型直接听懂单比特麦克风

语音增强 | 7.5/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8773 字 阅读 →
论文解读

看得懂谱,听得出演奏,才算懂音乐:MuSP-Bench 为何要把乐谱与演奏放在一起考

音乐理解 | 6.2/10

 · 更新于 2026-09-24 · 约 15 分钟 · 7239 字 阅读 →
论文解读

没有金标准时,怎么判断对齐切得准不准

语音识别 | 9.1/10

 · 更新于 2026-09-24 · 约 18 分钟 · 8803 字 阅读 →
论文解读

0.76 分里的诚实:当语音失灵时,眼睛如何泄露下一句话的时机

语音交互 | 6.0/10

 · 更新于 2026-09-24 · 约 19 分钟 · 9435 字 阅读 →
论文解读

在干净与噪声之间不敢用力的对比解码:用注意力给干预装上刹车

语音识别 | 6.0/10

 · 更新于 2026-09-24 · 约 17 分钟 · 8147 字 阅读 →
论文解读

AllMusicCaps:让专辑评论成为可检索音乐语义的补充监督

论文把专家专辑评论转为曲目级 caption,并在混合语料、编码层和目标函数的分轴比较中检验其适用范围。

 · 更新于 2026-09-24 · 约 20 分钟 · 9527 字 阅读 →
论文解读

别把中层热图当读心术:音频 LLM 的工作空间究竟替谁完成了推理

音频理解 | 6.6/10

 · 更新于 2026-09-24 · 约 12 分钟 · 5836 字 阅读 →