论文解读

把去噪塞进耳蜗编码器里:用稀疏脉冲换六倍能耗

语音增强 | 6.7/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8494 字 阅读 →
论文解读

不用再把 PDM 翻译成 PCM:让状态空间模型直接听懂单比特麦克风

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8773 字 阅读 →
论文解读

看得懂谱,听得出演奏,才算懂音乐:MuSP-Bench 为何要把乐谱与演奏放在一起考

音乐理解 | 6.2/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7239 字 阅读 →
论文解读

泛化失效有两种:能用标注买回的,和换什么表征也买不回的

音频理解 | 8.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9839 字 阅读 →
论文解读

没有金标准时,怎么判断对齐切得准不准

语音识别 | 9.1/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8803 字 阅读 →
论文解读

把拾音器从琴上焊死的位置里解放出来:64 路沿弦采样如何把音色选择推迟到混音台

音乐源分离 | 7.7/10

 · 更新于 2026-09-25 · 约 15 分钟 · 7164 字 阅读 →
论文解读

0.76 分里的诚实:当语音失灵时,眼睛如何泄露下一句话的时机

语音交互 | 6.0/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9435 字 阅读 →
论文解读

把销售话术拆成可审计的流水线:SETU 为何用多智能体而非一个大模型打分

音视频理解 | 5.5/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9507 字 阅读 →
论文解读

先别让模型开口:当语音大模型需要学会拒绝

语音识别 | 8.3/10

 · 更新于 2026-09-25 · 约 16 分钟 · 7960 字 阅读 →
论文解读

听错一句,机器就敢动手:语音误差如何撬开具身智能的安全锁

语音交互 | 5.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8038 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-08-31

共分析 22 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 66 分钟 · 32614 字 阅读 →
论文解读

当语音和文本各说各话,重排器如何当翻译官?

LoRA | 5.8/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8739 字 阅读 →
论文解读

先分清状态,再决定能不能说话:Anian 如何把生成关进安全笼子

语音交互 | 5.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8236 字 阅读 →
论文解读

当一句非洲对话里藏着两种语言,语音识别该听哪一种?

语音识别 | 8.1/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8671 字 阅读 →
论文解读

在干净与噪声之间不敢用力的对比解码:用注意力给干预装上刹车

语音识别 | 6.0/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8147 字 阅读 →
论文解读

长音频不是更长的短音频:AudioSpan 如何逼模型证明它真的听见了

音频理解 | 8.7/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8805 字 阅读 →
论文解读

口音的长尾,为什么让无监督语音表示最先露怯?

语音编码 | 5.5/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8018 字 阅读 →
论文解读

别只听响度:为什么 AI 炸点声会在“尾巴”里露馅

音频伪造检测 | 5.8/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8682 字 阅读 →
论文解读

同样的两段声音,为何转写稳得住、问答就垮掉?

音频理解 | 6.1/10

 · 更新于 2026-09-25 · 约 18 分钟 · 8603 字 阅读 →
论文解读

别只看那一刻有多自信,要看一路有多摇晃:TRACE 用轨迹来判断情感是否可信

音视频理解 | 7.7/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9757 字 阅读 →