论文解读

先听见,再分清:两级级联如何把稀有虎鲸从海噪里捞出来

音频分类 | 6.7/10

 · 更新于 2026-09-25 · 约 19 分钟 · 9076 字 阅读 →
论文解读

复述一句就能听出你来过:微调语音如何记住嗓音与录音

语音合成 | 7.5/10

 · 更新于 2026-09-25 · 约 26 分钟 · 12861 字 阅读 →
论文解读

先找到证据,再敢打分:PhoenixNest-Video 如何让面试评分可回放

音视频理解 | 6.3/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11200 字 阅读 →
论文解读

孤独听得出来吗:当说什么比怎么说更诚实

语音情感识别 | 4.9/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8019 字 阅读 →
论文解读

关掉麦克风不行,擦掉人声才行:助老监听的隐私防火墙

音频分类 | 5.9/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12221 字 阅读 →
论文解读

导演喊“再来一条”时,机器如何既不变声又听懂弦外之音

语音合成 | 6.8/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10186 字 阅读 →
论文解读

耳塞在震动什么:骨导语音的低频直线与单轴传感器的容差

语音增强 | 6.3/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10402 字 阅读 →
论文解读

一条声音,二十四种说法:SonicCaps 把听觉歧义变成检索的养分

音频检索 | 7.2/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10292 字 阅读 →
论文解读

念对了也白搭:尼泊尔金融语音里被格式卡住的钱包

语音识别 | 6.1/10

 · 更新于 2026-09-25 · 约 17 分钟 · 8167 字 阅读 →
论文解读

剧本写好了时间,音画却演错了拍子:用路由把时间还给剧本

音视频生成 | 7.5/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9837 字 阅读 →
论文解读

先分好组再混音:为什么两阶段不是技巧,而是分工

音乐生成 | 7.0/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9703 字 阅读 →
论文解读

在喇叭与犬吠同时响起时听清人声:VAANI 如何把印度田野噪声钉在时间轴上

语音识别 | 5.8/10

 · 更新于 2026-09-25 · 约 20 分钟 · 9553 字 阅读 →
论文解读

边听边分清谁在说:把长历史留下来做说话人归属

语音识别 | 7.5/10

 · 更新于 2026-09-25 · 约 9 分钟 · 4402 字 阅读 →
每日研究速递

语音/音乐/音频论文速递 2026-09-03

共分析 18 篇语音/AI 论文

 · 更新于 2026-09-25 · 约 49 分钟 · 24532 字 阅读 →
论文解读

评测比模型更碎:用一套可组合的流水线让全模态分数可比、可复现

多模态模型 | 8.3/10

 · 更新于 2026-09-25 · 约 22 分钟 · 10864 字 阅读 →
论文解读

当嵌入不再确定:把不确定性从打分一路带到校准的后端闭环

说话人验证 | 7.8/10

 · 更新于 2026-09-25 · 约 24 分钟 · 11936 字 阅读 →
论文解读

开耳助听器里漏进来的噪声,为何要让扬声器自己去抵消?

语音增强 | 7.5/10

 · 更新于 2026-09-25 · 约 27 分钟 · 13172 字 阅读 →
论文解读

把拉格从玄学拉回有限状态:当重建变成约束 MAP 的精确动态规划

音乐理解 | 6.8/10

 · 更新于 2026-09-25 · 约 21 分钟 · 10255 字 阅读 →
论文解读

单塔为何还能赢双塔:BiMTokenizer 用双向状态与固定格点重做 1.1 kbps 的语义-声学平衡

语音编码 | 8.3/10

 · 更新于 2026-09-25 · 约 25 分钟 · 12427 字 阅读 →
论文解读

越干净,越脆弱:当语音增强抹掉了阿尔茨海默病的线索

音频分类 | 7.0/10

 · 更新于 2026-09-25 · 约 23 分钟 · 11424 字 阅读 →