每日研究速递

语音/音乐/音频论文速递 2026-08-29

共分析 29 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 87 分钟 · 43538 字 阅读 →
论文解读

别让检测器猜伪迹:先把原声的压缩记忆藏回去

语音伪造检测 | 6.5/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5792 字 阅读 →
论文解读

不估路径,先认出声音:跨终端啸叫为何要改用对象门控

回声消除 | 4.9/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4302 字 阅读 →
论文解读

AllMusicCaps:让专辑评论成为可检索音乐语义的补充监督

论文把专家专辑评论转为曲目级 caption,并在混合语料、编码层和目标函数的分轴比较中检验其适用范围。

 · 更新于 2026-09-25 · 约 20 分钟 · 9527 字 阅读 →
论文解读

别把中层热图当读心术:音频 LLM 的工作空间究竟替谁完成了推理

音频理解 | 6.6/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5836 字 阅读 →
论文解读

想找回被替换的原话,先接受水印不能再像哈希那样精确

音频水印 | 6.4/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3888 字 阅读 →
论文解读

让声码器也理解方向:CSAVocoder 把空间线索留在最后一公里

空间音频 | 7.6/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4970 字 阅读 →
论文解读

让每个频率格为自己的关系负责:DS 接入音乐模型

音乐理解 | 7.2/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4422 字 阅读 →
论文解读

把电话声道和业务词汇分开付账:Canary 的两次适配实验

语音识别 | 7.9/10

 · 更新于 2026-09-25 · 约 8 分钟 · 3952 字 阅读 →
论文解读

32 分钟语料能给 Baniwa ASR 一个起点,却不能借此跳过泛化检验

语音识别 | 4.7/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4842 字 阅读 →
论文解读

ASR 评测别急着换大模型:先分清向量度量、候选裁判与错误解释

语音质量评估 | 6.1/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5237 字 阅读 →
论文解读

把教师的回声残差教给小模型:AEC 蒸馏到底补回了什么

回声消除 | 8.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4423 字 阅读 →
论文解读

把 100 小时 MEG 拆成两种稀缺资源,才看得见神经语音解码该怎样扩展

基准测试 | 8.9/10

 · 更新于 2026-09-25 · 约 11 分钟 · 5035 字 阅读 →
论文解读

忘掉不等于擦除:语音网络把关键期痕迹压在了最底层

语音识别 | 8.6/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4703 字 阅读 →
论文解读

谐音不是错字:让普通话 ASR 在纠错与保留笑点之间踩刹车

语音识别 | 5.7/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4240 字 阅读 →
论文解读

别把旧类压成一个点:SPECTRA 用低秩几何给 5-shot 音频增量学习留住记忆

音频分类 | 7.2/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5815 字 阅读 →
论文解读

别等整句说完:把数字人的手势变成一条受因果约束的数据流

音视频交互 | 6.9/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4260 字 阅读 →
论文解读

把“该不该开口”拆成可追责时间表:TurnBench 逼出的轮次交接难题

语音交互 | 8.5/10

 · 更新于 2026-09-25 · 约 10 分钟 · 4976 字 阅读 →
论文解读

语音助手的记忆为什么要分脑:VoiceMem 用 134 ms 换来 top-5 的长期理解

语音交互 | 6.6/10

 · 更新于 2026-09-25 · 约 13 分钟 · 6205 字 阅读 →
论文解读

别再把同步分数当裁判:先问它量的是偏移、内容,还是感知代理

音视频理解 | 8.8/10

 · 更新于 2026-09-25 · 约 12 分钟 · 5899 字 阅读 →