论文解读

把“像不像”拆开问:当音乐相似度被迫按属性回答时,人与机器在哪儿对齐、又在哪儿分叉

音乐检索 | 7.3/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12385 字 阅读 →
论文解读

别再让大模型把“3.45 美元”直接念出来:用 40 个可解释特征把文本对齐到可朗读

语音合成 | 7.4/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11235 字 阅读 →
论文解读

三个人怎么把话说完:TEIDAN 用统一的停顿尺子量出日英对话的节奏差

多模态模型 | 5.1/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9106 字 阅读 →
论文解读

不用真谱也能学会听谱:TUTTI 用 36 万首合成曲喂饱纯 Transformer

音乐转录 | 7.4/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11036 字 阅读 →
论文解读

长字幕为什么总在最后两层才说谎:用问答把数据、训练和推理锁在一起

音频字幕生成 | 6.8/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10434 字 阅读 →
论文解读

会打断、会附和,还要听得懂分寸:把“何时说话”从“说什么”里拆出来

语音交互 | 7.3/10

 · 更新于 2026-09-25 · 约 6 分钟 · 2608 字 阅读 →
论文解读

在噪声里听见和弦:一次卷积如何让田野录音带上调性色彩

音乐生成 | 5.9/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10057 字 阅读 →
论文解读

把声学公式写进损失:PhysWave 如何让扩散模型不再猜方向

音频生成 | 6.6/10

 · 更新于 2026-09-25 · 约 28 分钟 · 13764 字 阅读 →
论文解读

当模型听得见声音,却听不懂语气:VocalAffectBench 为何要把情感从文字里剥离

语音情感识别 | 7.4/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12243 字 阅读 →
论文解读

只给顺序不给时间:用会遗忘的节奏记忆补上塔布拉转录的弱监督缺口

音乐转录 | 6.3/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11985 字 阅读 →
论文解读

当声音在笑、文字在哭:大音频语言模型为何听不见讽刺

语音情感识别 | 8.1/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12067 字 阅读 →
论文解读

当八成轮替都重叠时,静音阈值为什么会失灵?

多模态模型 | 5.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8392 字 阅读 →
论文解读

当文字说得太漂亮,声音却在摇头:如何让模型听出言外之意

语音交互 | 6.6/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10404 字 阅读 →
论文解读

AllMusicCaps:让专辑评论成为可检索音乐语义的补充监督

论文把专家专辑评论转为曲目级 caption,并在混合语料、编码层和目标函数的分轴比较中检验其适用范围。

 · 更新于 2026-09-25 · 约 20 分钟 · 9527 字 阅读 →
论文解读

32 分钟语料能给 Baniwa ASR 一个起点,却不能借此跳过泛化检验

语音识别 | 4.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4842 字 阅读 →
论文解读

把 100 小时 MEG 拆成两种稀缺资源,才看得见神经语音解码该怎样扩展

基准测试 | 8.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5035 字 阅读 →
论文解读

把“该不该开口”拆成可追责时间表:TurnBench 逼出的轮次交接难题

语音交互 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4976 字 阅读 →
论文解读

Anatomy of a Scam Call: What 10,000 real scam and spam calls reveal about how phone scammers operate

语音交互 | 7.3/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6264 字 阅读 →
论文解读

LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training

音视频理解 | 9.4/10

 · 更新于 2026-09-25 · 约 14 分钟 · 6559 字 阅读 →
论文解读

The ISCSLP 2026 Real-World Audio-Visual Speech Enhancement Challenge

音视频语音分离 | 8.8/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6292 字 阅读 →