论文解读

当文字当指挥:MAESTRO 如何让声画专家按序就位

音视频理解 | 6.0/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10691 字 阅读 →
论文解读

别再比谁更像人:当生成音乐的评价回到音乐人的工作台

音乐生成 | 7.3/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9673 字 阅读 →
论文解读

当发言意愿也需要先验:用 Beta 倾向补全多通道日志的贝叶斯闭环

说话人日志 | 6.6/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11955 字 阅读 →
论文解读

提示词动了,词错误率为什么不动:一次生产级口述史转录的预注册阴性消融

语音识别 | 7.4/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11646 字 阅读 →
论文解读

议会里的声音政治学:当情感、犹豫与重音在四种斯拉夫语中分道扬镳

语音情感识别 | 5.6/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11892 字 阅读 →
论文解读

干净本身成了开关:当语音增强的理想输出反噬自身

语音增强 | 6.4/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10275 字 阅读 →
论文解读

把循环拆成并行:用时带混合与自适应回退让增强前端不再拖累识别

语音增强 | 6.2/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9926 字 阅读 →
论文解读

听得更干净,却想得更错:当语音增强把大模型带偏

语音增强 | 8.0/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10322 字 阅读 →
论文解读

把声学公式写进损失:PhysWave 如何让扩散模型不再猜方向

音频生成 | 6.6/10

 · 更新于 2026-09-25 · 约 28 分钟 · 13764 字 阅读 →
论文解读

同一音高多条路:用扩散与可演奏约束把吉他谱写对、写得能弹

音乐转录 | 8.2/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11909 字 阅读 →
论文解读

在只有 204 个婴儿的世界里,为什么 97.9% 的准确率不值得庆祝

音频分类 | 8.1/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10819 字 阅读 →
论文解读

一句里装不下两种心情:HybridEmo 如何让 TTS 先走完轨迹再调好混合

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12777 字 阅读 →
论文解读

把混音师的耳朵写成奖励:SPHERE 如何让 3B 音频语言模型学会摆位

音乐生成 | 6.9/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12674 字 阅读 →
论文解读

1500 个音频 token 真的都需要吗?用等间隔抽样戳破 Whisper 的时域冗余

语音识别 | 7.2/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10278 字 阅读 →
论文解读

给声音装上刻度:TEMPO 如何让大音频语言模型学会报时

音频事件检测 | 7.1/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12370 字 阅读 →
论文解读

别再只调大模型:用 88 行文字把声音的破绽说给 LLM 听

语音伪造检测 | 6.4/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11536 字 阅读 →
论文解读

相位越不准,幅度越要背锅:用频带加权把流式增强从过衰减里拉回来

语音增强 | 6.4/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10215 字 阅读 →
论文解读

韵律能猜出多少句法?把停顿与时长放进互信息的秤上称重

Transformer | 7.6/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11855 字 阅读 →
论文解读

当一句“右转航向 150”必须找到那架飞机:语音与轨迹如何在同一个地图上相遇

对比学习 | 7.5/10

 · 更新于 2026-09-25 · 约 32 分钟 · 15572 字 阅读 →
论文解读

当视频自己听不见节拍:VIBE 如何让背景音乐既对上画面,又听懂文字指令

音乐生成 | 7.1/10

 · 更新于 2026-09-25 · 约 27 分钟 · 13132 字 阅读 →